در هر اداره، مغازه یا انباری، همیشه انبوهی از کاغذ وجود دارد: فاکتور، رسید، فرم ورود کالا، برچسب قفسه، جزوهٔ دست‌نویس. همهٔ این‌ها اطلاعات دارند، اما تا وقتی کسی آن‌ها را تایپ نکند، این اطلاعات در سیستم شما دیده نمی‌شوند. دقیقاً همین‌جاست که OCR وارد می‌شود؛ فناوری‌ای که کارش خواندن نوشته از روی یک عکس یا اسکن و تبدیل آن به متنی است که می‌شود کپی، ویرایش و جست‌وجو کرد.

شاید تصور کنید OCR یک اختراع تازه است، اما ریشهٔ آن به نزدیک صد سال پیش برمی‌گردد. در دهه‌های ۱۹۲۰ و ۱۹۳۰ میلادی، نخستین دستگاه‌هایی ساخته شدند که قرار بود متن چاپی را برای افراد نابینا بخوانند؛ تلاشی دست‌وپاگیر اما نویدبخش یک ایدهٔ بزرگ. در دهه‌های ۱۹۶۰ و ۱۹۷۰، بانک‌ها نخستین کسانی بودند که این فناوری را جدی گرفتند، برای خواندن سریع شمارهٔ چک‌ها. کمی بعد، با ورود اسکنرهای خانگی و اداری در دهه‌های ۸۰ و ۹۰، نرم‌افزارهای OCR هم به بازار آمدند و به ابزاری آشنا برای دفاتر و شرکت‌ها تبدیل شدند. نقطهٔ عطف بعدی، پروژه‌های بزرگ دیجیتالی‌سازی کتاب و روزنامه در اوایل دهه ۲۰۰۰ بود، زمانی که میلیون‌ها صفحهٔ کاغذی به آرشیوهایی دیجیتال و قابل جست‌وجو تبدیل شدند. با فراگیر شدن گوشی‌های هوشمند، OCR از دنیای متخصصان بیرون آمد و به ابزاری ساده در دسترس همه رسید.

چند سال اخیر، بیشترین جهش در تاریخ این فناوری رخ داده است. تا همین اواخر، OCR تنها با متن‌های تمیز و چاپی خوب کار می‌کرد و کوچک‌ترین کجی، سایه یا خط‌خوردگی روی کاغذ، نتیجه را مخدوش می‌کرد. اما نسل تازه‌ای از این سرویس‌ها که با هوش مصنوعی همراه شده، دیگر صرفاً حروف را تشخیص نمی‌دهد، بلکه متن را در بافت خودش می‌فهمد؛ می‌داند کدام بخش عنوان است، کدام بخش جدول است، و کدام رقم به مبلغ فاکتور یا تاریخ مربوط می‌شود. همین درک زمینه، دقت را به‌شکل چشمگیری بالا برده است. امروز خواندن دست‌خط نیز تا حد زیادی ممکن شده، عکس‌های واقعی گرفته‌شده با گوشی - با کاغذ چروک‌خورده، نور کم یا زاویهٔ کج - نتیجهٔ قابل‌قبولی می‌دهند، و سندی که هم‌زمان فارسی، عربی و انگلیسی دارد در یک مرحله خوانده می‌شود. چون این پردازش روی سرورهای آنلاین انجام می‌شود، نتیجه معمولاً چند ثانیه پس از گرفتن عکس آماده است. می‌توانید نمونهٔ این تجربه را در سرویس تبدیل عکس به متن پردآوا ببینید.

اهمیت این پیشرفت برای یک کسب‌وکار فقط در سرعت خلاصه نمی‌شود. وقتی کاری که تایپ دستی آن ساعت‌ها طول می‌کشید، برای هر سند به چند ثانیه می‌رسد، زمان قابل توجهی آزاد می‌شود. از سوی دیگر، وقتی متن مستقیماً از روی سند خوانده شود، بسیاری از خطاهای رایج تایپ - مانند جابه‌جا شدن یک رقم در فاکتور - از چرخهٔ کار حذف می‌شوند. و شاید مهم‌تر از همه، وقتی صدها یا هزاران سند کاغذی به متن تبدیل می‌شوند، پیدا کردن هر اطلاعات از میان آن‌ها به‌جای گشتن در پوشه‌های کاغذی، به یک جست‌وجوی ساده تبدیل می‌شود.

کاربرد این فناوری هم به یک حوزه محدود نیست. در حسابداری و خرید، فاکتور و رسید کاغذی بدون تایپ مبلغ و شرح کالا ثبت می‌شود. در انبار و لجستیک، برچسب جعبه و برگهٔ ورود کالا خوانده می‌شود تا ثبت در سیستم سریع‌تر انجام شود. در منابع انسانی، فرم استخدام، نامه و مدارک به پروندهٔ دیجیتال تبدیل می‌شوند. و در کارهای شخصی یا آموزشی، جزوه، یادداشت روی تخته یا صفحهٔ کتاب به متنی قابل جست‌وجو بدل می‌شود.

فناوری OCR در طول این چند دهه از یک ایدهٔ کمک به نابینایان آغاز شد، از دل بانک‌ها و کتابخانه‌ها گذشت و امروز به ابزاری رسیده که هرکسی می‌تواند با یک عکس ساده از آن استفاده کند. اگر بخشی از کار شما هنوز با تایپ دستی از روی کاغذ می‌گذرد، شاید وقتش رسیده این کار را به همان فناوری بسپارید؛ می‌توانید همین حالا آن را در صفحهٔ تبدیل عکس به متن پردآوا امتحان کنید.