स्कैन एक तस्वीर है, डॉक्यूमेंट नहीं
जब आप कोई पेज स्कैन करते हैं या उसकी फोटो लेते हैं, तो जो बनता है वह एक इमेज होती है। आप उसे देख सकते हैं, पर न कोई पंक्ति चुन सकते हैं, न कोई खाता नंबर कॉपी कर सकते हैं, न Ctrl-F दबाकर कोई शब्द ढूँढ़ सकते हैं। OCR (ऑप्टिकल कैरेक्टर रिकग्निशन) उस तस्वीर में से अक्षर पढ़ता है और उन्हें PDF में वापस हर शब्द के ठीक ऊपर बैठी एक अदृश्य परत के रूप में लिख देता है। पेज बिलकुल वैसा ही दिखता है — पर अब वह खोजा जा सकता है, कॉपी किया जा सकता है, और काम का है।
यह टूल कौन इस्तेमाल करता है
वे सब जिन्हें स्कैन किए हुए बैंक स्टेटमेंट, एग्रीमेंट, मार्कशीट या पुराने रिकॉर्ड में से कुछ खोजना या कॉपी करना है — और जो इसके लिए एक निजी डॉक्यूमेंट किसी अनजान सर्वर पर नहीं चढ़ाना चाहते।
इसे कैसे इस्तेमाल करें
- स्कैन की हुई PDF जोड़िए, या पेजों की फोटो।
- इसे खोजने लायक बनाइए दबाइए। इंजन एक बार डाउनलोड होता है, फिर हर पेज आपके डिवाइस पर पढ़ा जाता है — हर पेज में कुछ सेकंड।
- PDF डाउनलोड कीजिए। वह दिखने में वैसी ही है, पर अब आप उसका टेक्स्ट चुन और खोज सकते हैं।
पेज स्कैन करने के बजाय फोटो खींच रहे हैं? पहले उन्हें डॉक्यूमेंट स्कैनर से गुज़ार दीजिए — पेज सीधा और साफ़ हो जाने पर OCR काफ़ी बेहतर काम करता है।
ईमानदार सीमाएँ
यह छपा हुआ अंग्रेज़ी टेक्स्ट पढ़ता है — हिंदी अभी नहीं। हिंदी में लिखे पेज पर यह कुछ नहीं पहचान पाएगा, चाहे स्कैन कितना भी साफ़ हो। साफ़, सीधे और अच्छी रोशनी वाले अंग्रेज़ी स्कैन पर यह अच्छा चलता है; धुँधली फोटो, हाथ की लिखावट, अनोखे फ़ॉन्ट और भारी बैकग्राउंड पैटर्न पर यह अटकता है — और कहीं-कहीं कोई अक्षर ग़लत भी पढ़ सकता है। किसी ज़रूरी काम में इस्तेमाल करने से पहले नतीजा हमेशा जाँच लीजिए।
अक्सर पूछे जाने वाले सवाल
OCR असल में करता क्या है?
यह स्कैन की हुई इमेज में से शब्द पढ़ता है और उन्हें PDF में एक अदृश्य टेक्स्ट परत के रूप में जोड़ देता है, जिससे फ़ाइल दिखने में वैसी ही रहती है पर खोजी और कॉपी की जा सकती है।
क्या मेरा डॉक्यूमेंट अपलोड होता है?
नहीं। पहचानने वाला इंजन आपके ब्राउज़र में डाउनलोड होकर आपके डिवाइस पर ही चलता है। डॉक्यूमेंट कभी आपकी मशीन से बाहर नहीं जाता।
हर पेज में कुछ सेकंड क्यों लगते हैं?
क्योंकि काम किसी सर्वर फ़ार्म की जगह आपका अपना डिवाइस कर रहा है — फ़ाइल कभी किसी को न देने की यही क़ीमत है।
क्या यह हिंदी या हाथ की लिखावट पढ़ता है?
अभी नहीं — यह छपा हुआ अंग्रेज़ी टेक्स्ट पहचानता है। हाथ की लिखावट किसी भी OCR इंजन के लिए भरोसेमंद नहीं होती।