דלג לתוכן

זיהוי תווים אופטי (OCR)

AI יישומי

הגדרה

זיהוי תווים אופטי (OCR) הוא טכנולוגיה שהופכת תמונה של טקסט — דף סרוק, צילום של שלט או כתב יד — לטקסט דיגיטלי שאפשר לחפש, להעתיק ולערוך.

💡 דוגמה

מצלמים בטלפון דף מתכון מספר ישן, ובתוך שניות אפשר להעתיק את רשימת המצרכים להודעה.

מתמונה לאותיות

בעיני מחשב, דף סרוק הוא רק אוסף של נקודות צבע. זיהוי תווים אופטי הוא, לפי ויקיפדיה, "ההמרה האלקטרונית או המכנית של תמונות של טקסט מודפס, מוקלד או כתוב ביד לטקסט מקודד-מכונה". אחרי ההמרה אפשר לחפש במסמך, להעתיק ממנו ולערוך אותו. ויקיפדיה מונה שימושים רבים: הקלדת נתונים מדרכונים, מחשבוניות ומדפי בנק; זיהוי אוטומטי של לוחיות רישוי; הפיכת ספרים סרוקים לכאלה שאפשר לחפש בהם, כמו ב-Google Books; כלי עזר לאנשים עם לקות ראייה; ואפילו עקיפה או בדיקה של מבחני CAPTCHA, שנועדו להבחין בין אדם לתוכנה.

מהטלגרף ועד מכונת הקריאה

לפי ויקיפדיה, ב-1914 פיתח עמנואל גולדברג מכונה שקראה תווים והמירה אותם לקוד טלגרף. בערך באותה תקופה בנה אדמונד פורנייה ד'אלב את האופטופון, סורק ידני שהשמיע צליל שונה לכל אות כשהעבירו אותו על דף מודפס. ב-1931 קיבל גולדברג פטנט על "מכונה סטטיסטית" לחיפוש במיקרופילם. קפיצה גדולה הגיעה ב-1974, כשריי קורצווייל הקים חברה שפיתחה את מערכת ה-OCR הראשונה שמזהה טקסט בכל גופן רגיל — עד אז סורקים ידעו לקרוא רק כמה גופנים. ב-13 בינואר 1976 הוצגה מכונת הקריאה של קורצווייל לעיוורים, במסיבת עיתונאים עם ראשי הפדרציה הלאומית של העיוורים בארצות הברית. היא חייבה שתי המצאות נוספות: סורק שטוח והמרת טקסט לדיבור. סטיבי וונדר היה המשתמש הראשון בגרסה המסחרית.

איך זה עובד

ויקיפדיה מתארת שתי שיטות יסוד. בהתאמת תבניות משווים את צורת האות, פיקסל אחר פיקסל, לאוסף אותיות שמור מראש. בחילוץ מאפיינים מפרקים כל אות למרכיבים — קווים, לולאות סגורות, כיוונים והצטלבויות — ומזהים אותה לפיהם. אחרי הזיהוי אפשר לשפר את התוצאה בעזרת מילון שמגביל את הפלט למילים מותרות. הדיוק תלוי מאוד באיכות המקור: לפי מחקר שוויקיפדיה מצטטת, דיוק של תוכנות OCR מסחריות על טקסט לטיני מוקלד נע בין 81% ל-99% לכל תו. כתב יד, ובעיקר כתב מחובר, קשה הרבה יותר.

המעבר לרשתות נוירונים

המנוע החינמי המוכר ביותר הוא Tesseract. הוא פותח ב-Hewlett-Packard בין 1985 ל-1994, נפתח כקוד פתוח ב-2005, וגוגל פיתחה אותו מ-2006 עד 2017. גרסה 4, מ-2018, הוסיפה מנוע שמבוסס על רשת נוירונים מסוג LSTM ומתמקד בזיהוי שורות שלמות. היום הוא מזהה יותר מ-100 שפות, כולל שפות שנכתבות מימין לשמאל כמו עברית וערבית, ומופץ ברישיון Apache 2.0. השלב הבא הוא מודלים רב-מודליים, שמבינים תמונה וטקסט יחד: Mistral AI השיקה במרץ 2025 את Mistral OCR, שלפי החברה מבין גם טבלאות, משוואות ותמונות בתוך המסמך, ותומך באלפי כתבים, גופנים ושפות. כאן הקריאה הופכת לשלב הראשון בתהליך שנקרא עיבוד מסמכים חכם — לא רק לזהות אותיות, אלא להבין מה הן אומרות.

עברית, כתב יד ומה עדיין קשה

לעברית יש מאפיינים שאין בכתב הלטיני: כתיבה מימין לשמאל, אותיות סופיות וניקוד. לפי ויקיפדיה העברית, שיטות OCR מסורתיות מתקשות במיוחד בזיהוי כתב יד עברי, ובין הכלים החינמיים לעברית היא מזכירה את hocr. גם כשהמנוע מצוין, התוצאה טובה רק כמו הסריקה: דף מקומט, תאורה חלשה או צילום בזווית מורידים את הדיוק. לכן, כשמשתמשים ב-OCR לדברים חשובים — מספרי זהות, סכומים, שמות — כדאי לעבור על הטקסט שהתקבל ולהשוות אותו למקור.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שאלות נפוצות ❓

מה זה OCR במילים פשוטות?

טכנולוגיה שמסתכלת על תמונה של טקסט — דף סרוק או צילום — והופכת אותה לטקסט שאפשר להעתיק, לחפש ולערוך.

מתי התחיל OCR?

לפי ויקיפדיה, כבר ב-1914 בנה עמנואל גולדברג מכונה שהמירה תווים לקוד טלגרף. ב-1976 הציג ריי קורצווייל מכונת קריאה לעיוורים שזיהתה טקסט בכל גופן רגיל.

האם OCR עובד טוב בעברית?

על טקסט מודפס יש כלים שתומכים בעברית, כמו Tesseract. כתב יד עברי עדיין קשה הרבה יותר, לפי ויקיפדיה העברית.

מה ההבדל בין OCR רגיל ל-OCR מבוסס בינה מלאכותית?

שיטות ותיקות משוות צורות של אותיות. מנועים חדשים משתמשים ברשתות נוירונים שקוראות שורה שלמה, ומודלים רב-מודליים מבינים גם טבלאות ומבנה של מסמך.

איך משפרים את התוצאה?

סורקים או מצלמים דף ישר, בתאורה טובה ובחדות גבוהה, ובודקים בסוף מספרים ושמות מול המקור.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו