עיבוד מסמכים חכם (Document AI)
הגדרה
עיבוד מסמכים חכם (Document AI) הוא שימוש בבינה מלאכותית כדי לקרוא מסמכים — חשבוניות, טפסים, חוזים ותעודות — להבין מה כתוב בהם ולהוציא מהם את הנתונים החשובים בצורה מסודרת שמחשב יכול לעבוד איתה.
💡 דוגמה
מצלמים קבלה ממסעדה באפליקציה של רואה החשבון, והסכום, התאריך ושם העסק נכנסים לבד לשורות הנכונות בטבלת ההוצאות.
יותר מקריאת אותיות
כשסורקים חשבונית, המחשב מקבל בסך הכול תמונה. זיהוי תווים אופטי (OCR) הופך את התמונה לטקסט, אבל טקסט לבדו עדיין לא אומר איזה מספר הוא הסכום לתשלום ואיזה הוא מספר העוסק. עיבוד מסמכים חכם עושה את הצעד הבא. גוגל מגדירה את שירות Document AI שלה כפלטפורמה ש"לוקחת מידע לא מובנה ממסמכים והופכת אותו למידע מובנה" — כלומר לשדות מסודרים, כמו "תאריך", "ספק" ו"סכום", שאפשר להכניס למערכת הנהלת חשבונות. אמזון מתארת את השירות המקביל שלה, Textract, כמשהו ש"הולך מעבר ל-OCR פשוט" כדי לזהות, להבין ולחלץ נתונים מסוימים. בעולם העסקי התחום נקרא גם IDP, ובוויקיפדיה הוא מתואר כסוג של אוטומציה חכמה של תהליכים, שמשלב למידת מכונה, עיבוד שפה טבעית וזיהוי תווים.
איך זה עובד: לסווג, לחלץ, לבדוק
התהליך בנוי בדרך כלל מכמה שלבים. קודם הופכים את הסריקה לטקסט ובודקים את איכותה; גוגל, למשל, מוסיפה זיהוי של תמונה לא קריאה ויישור אוטומטי של דף עקום. אחר כך מסווגים את המסמך — חשבונית, תעודת זהות או חוזה — כדי לדעת מה לעשות איתו, ולפעמים מפצלים קובץ אחד שמכיל כמה מסמכים. ואז מחלצים את הנתונים: זוגות של שם שדה וערך, וטבלאות. מיקרוסופט מציעה ב-Azure Document Intelligence מודלים מוכנים לחשבוניות, לקבלות, לתעודות מזהות ולחוזים, וכל שדה חוזר בסוג הנכון — תאריך החשבונית כתאריך, הסכום כסכום כספי. עסק עם טופס משלו יכול לאמן מודל מותאם על דוגמאות מסומנות, ומסווג מותאם מזהה את סוג המסמך לפני שמתחילים לחלץ.
הפריצה: לקרוא גם את הפריסה
במסמך, המיקום של מילה חשוב לא פחות מהמילה עצמה: מספר שמופיע ליד "סה"כ" בתחתית הדף הוא כנראה הסכום הסופי. לפי ויקיפדיה, עד שנות ה-2010 שלטו בתחום שיטות קלאסיות של ראייה ממוחשבת, ומאז החליפו אותן בהדרגה רשתות נוירונים. אבן דרך מוכרת היא LayoutLM של מיקרוסופט, מדצמבר 2019, שלפי מחבריו היה הפעם הראשונה שבה טקסט ופריסה נלמדו יחד במסגרת אחת. במבחנים שפרסמו, הדיוק בהבנת טפסים עלה מ-70.72 ל-79.27, בהבנת קבלות מ-94.02 ל-95.24, ובסיווג מסמכים מ-93.07 ל-94.42.
עידן המודלים הרב-מודליים
בשנים האחרונות נכנסים לתחום גם מודלים גדולים שמבינים תמונה וטקסט יחד. גוגל מציעה ב-Document AI "מחלץ מותאם עם בינה מלאכותית יוצרת", שמוציא נתונים לפי הגדרה, בלי לבנות מודל מאפס. Mistral AI השיקה במרץ 2025 את Mistral OCR, שלפי החברה מבין כל רכיב במסמך — טקסט, טבלאות, משוואות ותמונות — ומחזיר את התוכן לפי הסדר, וגם בפורמט מובנה כמו JSON. לפי החברה, הוא מעבד עד 2,000 עמודים בדקה על שרת אחד, והיא הציגה אותו כמתאים במיוחד למערכות RAG, שבהן צ'טבוט עונה על שאלות מתוך אוסף מסמכים של הארגון.
איפה זה עובד, ומה נשאר לאדם
השימושים הבולטים הם במקומות שבהם יש הרבה ניירת שחוזרת על עצמה. אמזון מונה בקשות להלוואות ולמשכנתאות, טופסי קבלה של מטופלים ותביעות ביטוח, וטפסים ממשלתיים כמו דוחות מס. ויקיפדיה מוסיפה חשבוניות, הזמנות רכש וחוזים, וגם ארכיונים ואוספי מורשת שהופכים למידע שאפשר לחקור. עם זאת, המערכת יכולה לטעות בספרה אחת, ובסכום כסף ספרה אחת היא הכול. לכן שירותים כמו של גוגל כוללים כלי לבדיקה אנושית של המסמכים ושל התחזיות, ובמקרים רגישים אדם עדיין מאשר את מה שהמכונה חילצה.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
שאלות נפוצות ❓
מה ההבדל בין עיבוד מסמכים חכם ל-OCR?
OCR הופך תמונה של טקסט לטקסט. עיבוד מסמכים חכם מבין גם מה כל חלק אומר — איזה מספר הוא הסכום ואיזה הוא התאריך — ומחזיר את הנתונים כשדות מסודרים.
אילו מסמכים מתאימים לזה?
בעיקר מסמכים שחוזרים על עצמם: חשבוניות, קבלות, תעודות מזהות, חוזים, בקשות להלוואה ותביעות ביטוח.
מי מציע שירותים כאלה?
בין היתר גוגל (Document AI), מיקרוסופט (Azure Document Intelligence), אמזון (Textract) ו-Mistral AI (Mistral OCR).
אפשר לסמוך על התוצאה בלי לבדוק?
לא תמיד. טעות בספרה אחת יכולה לשנות סכום, ולכן השירותים כוללים כלים לבדיקה אנושית, ובמקרים רגישים אדם מאשר את התוצאה.
מה זה LayoutLM?
מודל של מיקרוסופט מ-2019 שלמד יחד את הטקסט ואת מיקומו בדף, ושיפר את הדיוק בהבנת טפסים וקבלות.