עיבוד חשבוניות עם בינה מלאכותית

מה המודל פותר באמת, מה אסור לו להכריע, איך מודדים דיוק בצורה שאומרת משהו, ומה משתנה עם המעבר לחשבוניות דיגיטליות.

בקצרה

המודל טוב בדבר אחד: חילוץ שדות ממסמך שלא ראה את הפורמט שלו קודם. זה בדיוק מה שהיה קשה בגישות שדרשו תבנית לכל ספק. מה שהוא לא צריך לעשות הוא להכריע אם לשלם, כי ההכרעה דורשת הקשר שלא נמצא במסמך. הגבול המעשי הוא סף ביטחון לכל שדה: מעל הסף הערך נכנס, מתחתיו שדה אחד מגיע לאדם לאישור. ואת החיסכון קובע עיצוב המסך לא פחות מאיכות המודל.

שלוש שכבות, ולכל אחת תפקיד אחר

מערכות שעובדות בנויות כך. מערכות שמאכזבות בדרך כלל אחדו את שתי הראשונות.

שכבה מה היא עושה מה היא לא עושה איך בודקים אותה
המודל מוציא שדות מהמסמך ומצרף לכל שדה מידה של ביטחון לא מחליט אם הערך נכון עסקית ולא משווה להסכם דיוק לכל שדה בנפרד, על מסמכים אמיתיים שלכם
הכללים משווה את מה שחולץ להזמנה, להסכם המסגרת, לתקציב ולספק המוכר לא מנחש. מה שלא נמצא, לא נמצא כמה מקרים נחסמו נכון, וכמה נחסמו לשווא
האדם מכריע במה שנשאר, ובמיוחד במה שהמודל לא היה בטוח בו לא קורא מחדש מסמכים שעברו כמה שניות לוקחת הכרעה אחת, ואיזה אחוז מהמסמכים מגיע אליו

הערך של הפרדה כזו הוא לא אדריכלי אלא מעשי: כשמשהו יוצא לא נכון, אפשר לדעת איזו שכבה טעתה. מערכת שמחזירה «אישור» אחד בלי שלוש השכבות האלה לא תאפשר לכם לתקן אותה, כי לא תדעו מה לתקן.

שני סוגי טעות שאינם דומים

זה החלק החשוב ביותר בעמוד הזה, והוא זה שחסר כמעט בכל הצעה.

המערכת לא ידעה. הסכום מטושטש, השדה בפורמט לא מוכר, המסמך סרוק עקום. זה מצב בטוח: הוא ניתן לזיהוי, ניתן לניתוב לאדם, ועלותו היא כמה שניות של עבודה.

המערכת הייתה בטוחה וטעתה. היא קראה מספר אחד במקום אחר והמשיכה. זה מצב מסוכן, כי הוא לא מסמן את עצמו, והוא נתגלה בהתאמת בנק בעוד חודש או לא נתגלה כלל.

לכן דיוק של 95 אחוז הוא מספר חסר משמעות עד שיודעים ממה מורכבים החמישה. חמישה אחוז מהסוג הראשון הם מערכת טובה; חמישה אחוז מהסוג השני הם בעיה. כששואלים ספק את השאלה הזו, התשובה גם מלמדת אם הוא מדד את זה בעצמו.

איך בודקים בפועל. קחו מאה חשבוניות אמיתיות שלכם, כולל הסרוקות העקומות ואת זו שכתובה ביד, והריצו. אל תבדקו את הסיכום. בדקו שדה-שדה והפרידו את שני סוגי הטעות. בדיקה על מסמכי הדוגמה של הספק מודדת את הספק ולא אותך.

המסך הוא חצי מהחיסכון

נקודה שנשמעת שולית והיא לא. אותו מודל בדיוק, בשני מסכים שונים, נותן שתי תוצאות שונות לגמרי בזמן העבודה.

מסך גרוע מציג מסמך שבו «משהו לא בטוח» ומבקש מהאדם לעבור עליו. הוא קורא את כולו, כי הוא לא יודע מה חשוד. מסך טוב מציג שדה אחד, את הקטע מהמסמך שממנו הוא נלקח, ושתי אפשרויות. הראשון לוקח דקות, השני לוקח שניות, וההבדל בין השניים הוא כל ההחזר של הפרויקט.

לכן כשמעריכים ספק, בקשו לראות את מסך הטיפול בחריגים ולא את מסך ההצלחה. מסך ההצלחה נראה טוב בכל מוצר.

מה משתנה עם חשבוניות דיגיטליות

המעבר בישראל לחשבוניות שמונפקות מול רשות המס משנה את התמונה בשני כיוונים הפוכים.

לטובה: מסמך מובנה מגיע עם השדות מופרדים, ולכן חלק מעבודת החילוץ נעשה מיותר. מי שבונה עכשיו מערכת שכולה חילוץ בונה פתרון לבעיה שמצטמקת.

ומה שלא נעלם: ספקים קטנים ומסמכים מחו"ל ימשיכו להגיע כקבצים חופשיים עוד זמן רב, ולכן החילוץ נשאר נדרש לחלק מהזרם. וחשוב מזה, לחשבונית יש מעכשיו מצב מול גורם חיצוני. קליטה מפסיקה להיות קריאת קובץ והופכת לבדיקה שעשויה להיות איטית, להיכשל או לסרב.

לכן הארכיטקטורה הנכונה מתייחסת לקליטת חשבונית כאל תהליך שיכול להמתין ולחזור על עצמו, ולא כאל פעולה שנגמרת מיד. מערכת שנבנתה בהנחה הראשונה תשתנה בקלות; מערכת שנבנתה בהנחה השנייה תצטרך שינוי בדיוק במקום הרגיש שלה. קשור: תוכנה לניהול רכש.

מסמכים דו-לשוניים, וכתב יד

נקודה שספקים בינלאומיים לא מתמחרים, ושבישראל היא חלק מהזרם הרגיל.

חשבונית ישראלית טיפוסית מערבת עברית, מספרים ולעתים שמות מוצר באנגלית באותה שורה. זה בדיוק המקרה שבו חילוץ נשבר: כיוון הקריאה מתחלף באמצע, והמודל צריך להחליט מה שייך לאיזה שדה כשהסדר החזותי לא עוזר. מודל שנבדק על מסמכים בשפה אחת יראה דיוק גבוה ויאכזב על הזרם שלכם.

שני מקרים נוספים שכדאי להכניס לבדיקה מראש, כי הם קיימים בכל ארגון ולעולם לא נמצאים בערכת הדוגמה של הספק: חשבונית שספק קטן כתב ביד או מילא בטופס מודפס, ומסמך מחו"ל עם פורמט תאריך אחר, הפרדת אלפים אחרת ומטבע אחר. פורמט התאריך הוא המקרה המסוכן מכולם, כי שתי הפרשנויות סבירות ושתיהן מתקבלות בלי שגיאה.

לכן בערכת הבדיקה שלכם צריכים להיות ארבעה סוגים, ולא מאה חשבוניות מאותו ספק: דו-לשונית, כתובה ביד, מחו"ל עם תאריך דו-משמעי, וסרוקה גרועה. ארבע אלה קובעות את התוצאה האמיתית יותר מהשאר יחד.

מה למדוד לפני שמתחילים

  1. כמה זמן לוקחת קליטה של חשבונית תקינה היום, בשניות. מספר אחד.
  2. כמה זמן לוקחת אחת שדרשה בירור, וכמה אנשים נגעו בה.
  3. איזה אחוז מהחשבוניות נופל לקטגוריה השנייה. זה המספר שהפרויקט מנסה להזיז.

שלושת המספרים נאספים בשבוע, בלי ספק ובלי מערכת. בלעדיהם אין למול מה להשוות אחרי שנה, ולכן גם לא יהיה אפשר לומר אם הפרויקט הצליח, וזה המצב שבו נמצאים רוב הפרויקטים האלה.

איך אני עובד על זה

עיסוק בתחום מאז 2004, עבודה על מערכות AI מאז 2023, פרויקטים ללקוחות בארבע עשרה מדינות. אני ארכיטקט עצמאי ולא ספק מוצר, ולכן המסקנה «הזרם שלכם קטן מדי מכדי להצדיק את זה» היא תוצאה אפשרית של סקירה, ולפעמים היא הנכונה.

מה סקירה מייצרת: מדידה של שלושת המספרים, בדיקת חילוץ על המסמכים האמיתיים שלכם עם הפרדה בין שני סוגי הטעות, סף ביטחון לכל שדה, ועיצוב מסך החריגים, שהוא המקום שבו נמצא רוב ההחזר.

מאיפה להתחיל

שלחו עשר חשבוניות אמיתיות, כולל הגרועות: הסרוקה העקומה, זו מחו"ל, וזו שספק קטן כתב ביד. עשר כאלה אומרות יותר על הפרויקט שלכם ממסמך דרישות.

דברו איתי  |  קשור: פתרונות AI, ניהול רכש, אוטומציה

SLAtech LTD