OCR (Optical Character Recognition)
OCR হলো অপটিক্যাল ক্যারেক্টার রিকগনিশনের প্রযুক্তি, যা টেক্সটের ছবি (স্ক্যান, ফটো, PDF) সম্পাদনাযোগ্য ও মেশিন-পাঠযোগ্য টেক্সট ফরম্যাটে রূপান্তরিত করে।
OCR কী
OCR (Optical Character Recognition) হলো ডেটা রিকগনিশনের একটি কম্পিউটার ভিশন প্রযুক্তি, যা ছবির (ফটো, স্ক্যান, PDF ফাইল) মধ্যে থাকা টেক্সট স্বয়ংক্রিয়ভাবে শনাক্ত করে তা সম্পাদনাযোগ্য ও মেশিন-পাঠযোগ্য ফরম্যাটে রূপান্তর করে। মূলত, OCR ডেটা রিকগনিশন হলো ডকুমেন্টের গ্রাফিক রূপকে টেক্সট লেয়ারে অনুবাদ করা: হাতে আবার টাইপ না করেই সিস্টেম নিজেই অক্ষরগুলো পড়ে এবং প্রয়োজনীয় ফরম্যাটে সংরক্ষণ করে। OCR টেক্সট লেয়ারবিহীন ডকুমেন্ট থেকেও টেক্সট বের করতে দেয়, ফলে সেগুলো অনুসন্ধান, সম্পাদনা ও বিশ্লেষণের উপযোগী হয়ে ওঠে। কর্পোরেট খাতে OCR হলো ইলেকট্রনিক ডকুমেন্ট ফ্লো সিস্টেম এবং ইলেকট্রনিক আর্কাইভের একটি মূল উপাদান। কাগজি আর্কাইভ ডিজিটালাইজ করতে, পাসপোর্ট ও পরিচয়পত্র থেকে ডেটা স্বয়ংক্রিয়ভাবে আহরণ করতে (MRZ রিকগনিশনের সঙ্গে যৌথভাবে) এবং LPR/ANPR সিস্টেমে গাড়ির নম্বর শনাক্ত করতে এই প্রযুক্তি ব্যাপকভাবে ব্যবহৃত হয়। রাশিয়ায় সরকারি তথ্য সিস্টেম, ব্যাংক, বীমা কোম্পানি ও চেকপয়েন্টে ডেটা ইনপুট স্বয়ংক্রিয় করতে ও হাতে-কলমে কাজ কমাতে OCR সমাধান ব্যবহৃত হয়। নিউরাল নেটওয়ার্ক প্রযুক্তির উন্নয়নের ফলে মানসম্মত ছবিতে আধুনিক OCR-এর নির্ভুলতা 99% পর্যন্ত পৌঁছেছে, যা আসা ডকুমেন্টের প্রক্রিয়াকরণ সম্পূর্ণ স্বয়ংক্রিয় করার সুযোগ দেয়।
OCR কীভাবে কাজ করে
অপটিক্যাল ক্যারেক্টার রিকগনিশনের প্রক্রিয়ায় কয়েকটি ধারাবাহিক ধাপ থাকে, যার প্রতিটিই উচ্চ নির্ভুলতা অর্জনের জন্য অত্যন্ত গুরুত্বপূর্ণ। ছবির প্রি-প্রসেসিং — নয়েজ দূর করা (ফিল্টারিং), ঝুঁকে থাকা ভঙ্গি সোজা করা (deskewing), কনট্রাস্ট বাড়ানো, বাইনারাইজেশন (বিশ্লেষণ সহজ করতে ছবিকে কালো-সাদা ফরম্যাটে আনা), আর্টিফ্যাক্ট ও দাগ অপসারণ। প্রি-প্রসেসিংয়ের মান সরাসরি রিকগনিশনের নির্ভুলতাকে প্রভাবিত করে। সেগমেন্টেশন — ছবিকে লজিক্যাল ব্লকে ভাগ করা: টেক্সটযুক্ত অঞ্চল নির্ণয় এবং লাইন, শব্দ ও আলাদা অক্ষরে বিভক্ত করা। এতে connected component বিশ্লেষণ ও projection histogram-এর অ্যালগরিদম ব্যবহৃত হয়। রিকগনিশন — প্রতিটি অক্ষরের আকৃতি বিশ্লেষণ করে রেফারেন্সের সঙ্গে মেলানো। ঐতিহ্যবাহী পদ্ধতিতে pattern matching ও feature extraction ব্যবহৃত হয়। আধুনিক সিস্টেম পুরো শব্দ বা লাইনের প্রসঙ্গে অক্ষর চিনতে deep neural network (CNN — convolutional neural network, transformer) ব্যবহার করে, যা নির্ভুলতা উল্লেখযোগ্যভাবে বাড়ায়। পোস্ট-প্রসেসিং — অভিধানের (ভাষা মডেল) সঙ্গে মিলিয়ে রিকগনিট করা টেক্সট যাচাই, প্রসঙ্গ পুনরুদ্ধার এবং সম্ভাবনাভিত্তিক মডেলের (যেমন hidden Markov model বা transformer-ভিত্তিক ভাষা মডেল) সাহায্যে ভুল সংশোধন। উদাহরণস্বরূপ, কোনো শব্দ ভুলভাবে রিকগনিট হলে সিস্টেম অভিধানের ভিত্তিতে তা সঠিক রূপে সংশোধন করতে পারে। আধুনিক OCR সিস্টেম হাইব্রিড পদ্ধতি অনুসরণ করে—অক্ষর রিকগনিশনে নিউরাল নেটওয়ার্ক এবং পোস্ট-প্রসেসিংয়ে ভাষা মডেল একত্রিত করে, ফলে দুর্বল মানের ছবি, বিভিন্ন ফন্ট, অস্বাভাবিক ফরম্যাটিং ও একাধিক ভাষার ক্ষেত্রেও উচ্চ নির্ভুলতা অর্জিত হয়।
বিভিন্ন ক্ষেত্রে OCR-এর প্রয়োগ
OCR প্রযুক্তি বিভিন্ন ক্ষেত্রে ব্যাপকভাবে ব্যবহৃত হয়, যা ডকুমেন্ট ও ডেটা প্রসেসিং স্বয়ংক্রিয় করে। ডকুমেন্ট ফ্লো ও আর্কাইভ — কাগজি ডকুমেন্টের ডিজিটালাইজেশন ও ইনডেক্সিং, অনুসন্ধানযোগ্য PDF আর্কাইভ তৈরি, আসা ডকুমেন্টের স্বয়ংক্রিয় শ্রেণিবিন্যাস, মূল রেকুইজিট (তারিখ, অঙ্ক, চুক্তির নম্বর) আহরণ। পাসপোর্ট ও পরিচয়পত্র রিকগনিশন — ব্যাংক, হোটেল ও চেকপয়েন্টে ডকুমেন্ট ভেরিফিকেশনের জন্য মেশিন-পাঠযোগ্য জোন (MRZ) ও ভিজ্যুয়াল জোন থেকে ডেটা স্বয়ংক্রিয়ভাবে আহরণ। ব্যাংকিং খাত — চেক, পেমেন্ট অর্ডার, চুক্তি ও ক্লায়েন্ট ফর্ম রিকগনিশন, যা সিস্টেমে স্বয়ংক্রিয়ভাবে পূরণ করতে ব্যবহৃত হয়। পরিবহন ও লজিস্টিকস — অ্যাক্সেস নিয়ন্ত্রণ, পার্কিং পেমেন্ট ও নিয়মলঙ্ঘন নথিভুক্ত করতে গাড়ির নম্বর রিকগনিশন (ANPR/LPR); চালান ও পণ্য-সহযোগী ডকুমেন্ট রিকগনিশন। চিকিৎসা — মেডিকেল রেকর্ড ও প্রেসক্রিপশনের ডিজিটালাইজেশন, টেস্টের ফলাফল রিকগনিশন, ইলেকট্রনিক মেডিকেল রেকর্ড স্বয়ংক্রিয়ভাবে পূরণ। রিটেইল — দামের ট্যাগ রিকগনিশন, প্যাকেজিংয়ের বারকোড ও টেক্সট স্ক্যান, ইনভেন্টরি স্বয়ংক্রিয়করণ। সরকারি সেবা — আবেদনপত্র ও নাগরিকদের আবেদনের স্বয়ংক্রিয় প্রসেসিং, সরকারি সেবা কেন্দ্রে ডকুমেন্ট স্ক্যান ও রিকগনিশন।
OCR সমাধানের ধরন
OCR সমাধানগুলো কয়েকটি মাপকাঠিতে শ্রেণিবদ্ধ করা যায়। ডিপ্লয়মেন্ট পদ্ধতি অনুযায়ী — লোকাল (ব্যবহারকারীর কম্পিউটারে ইনস্টল হয়, ডেটার গোপনীয়তা নিশ্চিত করে), ক্লাউড (API-র মাধ্যমে কাজ করে, ইনস্টলের প্রয়োজন নেই, প্রোভাইডারের ক্ষমতার কল্যাণে উচ্চ পারফরম্যান্স দেয়—যেমন Google Cloud Vision, Azure Cognitive Services, Yandex OCR), হাইব্রিড (লোকাল ও ক্লাউড রিকগনিশনের সমন্বয়)। কার্যকারিতা অনুযায়ী — সার্বজনীন (যেকোনো টেক্সট চেনে), বিশেষায়িত (নির্দিষ্ট ধরনের ডকুমেন্টের জন্য অপ্টিমাইজড: পাসপোর্ট, চেক, মেডিকেল রেকর্ড, টেকনিক্যাল ডকুমেন্টেশন)। ভাষা সমর্থন অনুযায়ী — একভাষিক, বহুভাষিক, স্বয়ংক্রিয় ভাষা শনাক্তকরণসহ। রিকগনিট করা টেক্সটের ধরন অনুযায়ী — মুদ্রিত টেক্সট (OCR), হাতের লেখা (ICR — Intelligent Character Recognition), হাতের স্বাক্ষর (SIG — Signature Recognition), মেশিন-পাঠযোগ্য জোন (MRZ — Machine Readable Zone)। আর্কিটেকচার অনুযায়ী — ঐতিহ্যবাহী (template ও feature-ভিত্তিক), নিউরাল নেটওয়ার্কভিত্তিক (deep learning-ভিত্তিক), হাইব্রিড। রাশিয়ায় আন্তর্জাতিক সমাধান (ABBYY FineReader — লোকাল, ABBYY Cloud OCR SDK, Tesseract — open-source, Google Vision, Microsoft OCR) এবং দেশীয় উন্নয়ন (SmartEngine, Cognitive OCR, VisionLabs OCR)—উভয়ই ব্যবহৃত হয়; এগুলো সরকারি তথ্য সিস্টেমের সঙ্গে ইন্টিগ্রেট হয় এবং 152-FZ-এর প্রয়োজনীয়তা পূরণ করে।
Frequently asked questions
OCR ও ICR-এর পার্থক্য কী?
OCR (Optical Character Recognition) মুদ্রিত টেক্সট চেনে। ICR (Intelligent Character Recognition) আরও উন্নত একটি প্রযুক্তি, যা হাতের লেখার বৈচিত্র্য বিশ্লেষণে মেশিন লার্নিং ব্যবহার করে হাতে লেখা টেক্সট চেনে। ব্যাংকে ফর্ম ও আবেদনপত্র প্রসেসিংয়ে এবং চিকিৎসায় প্রেসক্রিপশন ও মেডিকেল রেকর্ড রিকগনিশনে ICR প্রায়ই ব্যবহৃত হয়।
কোন কোন ফ্রি OCR সমাধান রয়েছে?
ফ্রি OCR সমাধানের মধ্যে জনপ্রিয় Tesseract (Google-এর open-source ইঞ্জিন, বহু ভাষা সমর্থন করে), Google Cloud Vision API (ভলিউমের সীমাসহ, মাসে 1000টি পর্যন্ত রিকোয়েস্ট), ABBYY FineReader Online (বেসিক রিকগনিশনের জন্য সীমিত সংস্করণ), OCR.space (ফ্রি ট্যারিফসহ অনলাইন সার্ভিস), Microsoft OCR (Windows-এ বিল্ট-ইন)। কর্পোরেট ব্যবহারের জন্য সাধারণত সাপোর্ট ও উচ্চ নির্ভুলতাসহ পেইড সমাধান বেছে নেওয়া হয়।
ডকুমেন্ট ফ্লো সিস্টেমে OCR কীভাবে ব্যবহৃত হয়?
ইলেকট্রনিক ডকুমেন্ট ফ্লো সিস্টেমে OCR আসা ডকুমেন্ট (ইনভয়েস, চালান, চুক্তি) স্বয়ংক্রিয়ভাবে চেনে, মূল ডেটা (অঙ্ক, তারিখ, রেকুইজিট, নম্বর) বের করে সংশ্লিষ্ট বিজনেস প্রসেসে পাঠায়। এতে হাতে ডেটা ইনপুট 80-90% কমে, ডকুমেন্ট প্রসেসিং 5-10 গুণ দ্রুত হয় এবং মানবীয় কারণজনিত ভুল বাদ পড়ে।
পাসপোর্টে OCR কীভাবে টেক্সট চেনে?
পাসপোর্ট রিকগনিশনে OCR MRZ রিকগনিশনের সঙ্গে জুটিতে ব্যবহৃত হয়। OCR ভিজ্যুয়াল জোন থেকে ডেটা আহরণ করে: নাম, জন্ম তারিখ, ডকুমেন্টের সিরিজ ও নম্বর। MRZ রিকগনিশন ডেটা ভেরিফিকেশনের জন্য মেশিন-পাঠযোগ্য জোন (পৃষ্ঠার নিচের দুই লাইন) পড়ে। এই প্রযুক্তির যৌথ ব্যবহার উচ্চ নির্ভুলতা (99.5% পর্যন্ত) ও ভুল থেকে সুরক্ষা নিশ্চিত করে। রিডিং সাধারণত ক্যামেরাসহ NFC রিডার দিয়ে করা হয়।
OCR কি একাধিক ভাষার টেক্সট চিনতে পারে?
হ্যাঁ, আধুনিক OCR সিস্টেম বহুভাষিক রিকগনিশন সমর্থন করে। কিছু সমাধান ডকুমেন্টের ভাষা স্বয়ংক্রিয়ভাবে নির্ণয় করে সংশ্লিষ্ট অভিধান ও মডেল প্রয়োগ করতে পারে। যেমন Tesseract 100-এর বেশি ভাষা এবং ABBYY FineReader 190-এর বেশি ভাষা সমর্থন করে। ভিন্ন ভাষার ডকুমেন্ট নিয়ে কাজ করা আন্তর্জাতিক কোম্পানি ও সরকারি সিস্টেমের জন্য এটি বিশেষভাবে গুরুত্বপূর্ণ।
আধুনিক OCR-এর নির্ভুলতা কত?
আধুনিক OCR-এর নির্ভুলতা মূল ছবির মান ও ডকুমেন্টের ধরনের ওপর নির্ভর করে। মানসম্মত ছবিতে (300 dpi, স্পষ্ট টেক্সট) নির্ভুলতা 99-99.8% পর্যন্ত পৌঁছায়। দুর্বল মানের ডকুমেন্টে (কম রেজোলিউশন, নয়েজ, অস্বাভাবিক ফন্ট, হাতের লেখা) নির্ভুলতা 80-95%-এ নেমে আসতে পারে। নিউরাল নেটওয়ার্ক মডেল ও ভাষাগত পোস্ট-প্রসেসিং ব্যবহার নির্ভুলতা উল্লেখযোগ্যভাবে বাড়ায়, বিশেষত জটিল ডকুমেন্টে।
OCR-এর জন্য হার্ডওয়্যারের প্রয়োজনীয়তা কী?
লোকাল OCR-এর জন্য যথেষ্ট পারফরম্যান্সসম্পন্ন কম্পিউটার দরকার: Intel Core i5 বা তার সমতুল্য/উত্তম প্রসেসর, 8-16 GB RAM, নিউরাল নেটওয়ার্ক প্রসেসিং দ্রুত করতে GPU (ভিডিও কার্ড) থাকলে ভালো। ডকুমেন্ট স্ক্যানের জন্য 300 dpi বা তার বেশি রেজোলিউশনের স্ক্যানার ব্যবহারের পরামর্শ দেওয়া হয়। ক্লাউড OCR সমাধানের জন্য ইন্টারনেটসংযুক্ত যেকোনো ডিভাইসই যথেষ্ট, কারণ প্রসেসিং প্রোভাইডারের পাশে সম্পন্ন হয়।
ডেটা রিকগনিশন কী এবং OCR কীভাবে তা সম্পাদন করে?
ডেটা রিকগনিশন হলো হাতে ইনপুট ছাড়াই ডকুমেন্ট থেকে তথ্য স্বয়ংক্রিয়ভাবে আহরণ। OCR (টেক্সট রিকগনিশন) স্ক্যান ও PDF থেকে অক্ষর পড়ার কাজটি করে, আর এর ভিত্তিতে ডেটা রিকগনিশন সিস্টেম অতিরিক্তভাবে রেকুইজিট আলাদা করে: তারিখ, অঙ্ক, চুক্তির নম্বর, নাম, ডকুমেন্টের সিরিজ ও নম্বর। এ ধরনের OCR সমাধান ডকুমেন্ট ফ্লো স্বয়ংক্রিয়করণ, আসা ইনভয়েস ও চালানের প্রসেসিং, পরিচয়পত্র ভেরিফিকেশন ও অ্যাক্সেস নিয়ন্ত্রণে ব্যবহৃত হয়। নিউরাল নেটওয়ার্কসহ আধুনিক OCR সমাধান 99% পর্যন্ত নির্ভুলতায় ডেটা চিনতে পারে, যা হাতে ইনপুট সম্পূর্ণ দূর করে।
Other terms in «ডকুমেন্ট যাচাই ও অ্যাক্সেস নিয়ন্ত্রণ»
Was this information helpful?
Need help with implementation?
Leave a request — our specialists will contact you and help solve the ocr (optical character recognition) task. Individual approach and guaranteed results.