מאמר מקצועי

הזיות בינה מלאכותית: למה הן קורות ואיך מצמצמים אותן

למה מודלי שפה ממציאים עובדות, איך מודדים את זה, ואיך RAG ובחירת מודל נכונה מצמצמים את הבעיה.

בועז שמר4 דק׳ קריאה

איור טכנולוגי עבור המאמר הזיות בינה מלאכותית: למה הן קורות ואיך מצמצמים אותן

בשנים האחרונות, מודלי שפה גדולים הפכו לחלק אינטגרלי מסביבת העבודה שלנו. יחד עם זאת קיימת בעיה שמתרחשת מאחורי הקלעים, והיא עלולה להיות מסוכנת יותר מכל תקלה טכנית אחרת: המודלים מייצרים תשובות שנראות מהימנות לחלוטין, אך למעשה הן שטות מוחלטת.

הסיכון הגדול ביותר טמון בדיוק בזה שהטקסט נראה משכנע. הניסוח מקצועי, הטון בטוח, ואין שום אינדיקציה שמשהו לא בסדר. זו המגבלה המשמעותית ביותר שמונעת היום שימוש בטוח ויומיומי במודלים כמו ChatGPT וכיוצא באלה. ככל שכלים אלו משתלבים עמוק יותר בתהליכי קבלת החלטות בארגוניים, כך גדל הצורך לדעת איך לזהות את הבעיה, למדוד אותה, ובעיקר לצמצם אותה.

איך ייתכן שמודל "ממציא" עובדות?

תופעת ההזיות היא אחד האתגרים המורכבים ביותר בעבודה עם מודלים גדולים של שפה. מדובר במצבים שבהם המערכת מחזירה תשובה שנראית הגיונית לחלוטין, אבל היא פשוט לא נכונה. לפעמים מדובר בטעות, ולפעמים בהמצאה מוחלטת של מידע. אז איך זה קורה?

התשובה נמצאת באופן שבו המודלים האלה בנויים. הם לא באמת מבינים את העולם כמו שאנחנו מבינים אותו. מה שהם עושים זה חיזוי של המילים הבאות בטקסט, על בסיס כמויות אדירות של טקסט שהם קראו במהלך הזמן שאימנו אותם. אין להם מנגנון פנימי שבודק האם מה שהם כותבים תואם למציאות או לא.

כדי להבין למה זה קורה, צריך לדעת שהמודלים לא לומדים מהי האמת. הם לומדים דפוסים שחוזרים על עצמם בטקסטים. כלומר, מה נוטה להופיע אחרי מה. כשהמודל כותב תשובה, הוא לא שואל את עצמו האם זה נכון, הוא פשוט מנסה לנחש איזו מילה תישמע הכי טבעית במקום הזה. אין לו מושג אם מה שהוא כתב מבוסס על עובדות או לא.

יש כאן הבחנה חשובה בין שתי גישות עבודה. גישה אחת נקראת ספר סגור: המודל עונה מתוך מה שהוא למד באימון, בלי גישה לשום מידע נוסף. זה אומר שהוא לא יכול להתעדכן ולא יכול לבדוק את עצמו מול מקורות חיצוניים. הגישה השנייה היא ספר פתוח: כאן המודל קודם כל מחפש מידע רלוונטי מבחוץ, ורק אז מייצר תשובה על בסיסו. הגישה הזו מורידה משמעותית את הסיכוי להזיות.

בעיה נוספת היא שהמודלים לא יודעים להגיד "אני לא יודע". הם לא מתוכנתים להודות בכך שאין להם תשובה טובה. במקום זה, הם זורמים עם משהו שנשמע סביר, גם אם הוא שגוי לגמרי. והחלק הכי בעייתי הוא שהם עושים את זה בביטחון מלא! מה שיוצר אצל המשתמש תחושת אמינות מוחלטת.

אז לא, זה לא נובע מרשלנות או תכנות גרוע. זה תוצר ישיר של האופן שבו המערכות האלה נבנות ומאומנות: המטרה שלהן היא לכתוב טקסט שנראה טוב, לא בהכרח טקסט שנכון.

איך ניתן למדוד את רמת ההזיות?

זה אולי נשמע מפתיע, אבל מודלים קטנים ויעילים עלו לא פעם על מודלים גדולים בהרבה במבחני דיוק. מה שקובע באמת זה לא כמות הפרמטרים, אלא האופן שבו המודל אומן.

כמה תובנות מרכזיות:

  • משפחות מודלים שומרות על עקביות. מודלים שמגיעים מאותה סדרה טכנולוגית, כמו GPT או Gemini, מציגים רמת דיוק דומה.
  • פחות זה יותר. תשובות קצרות וממוקדות נוטות פחות להזות מאשר סיכומים ארוכים.
  • עדיף לשתוק מאשר להזות - יש מודלים שמסרבים לענות כשאין להם ודאות.

והחדשות הטובות? יש דרכים להתמודד עם הבעיה. אחת הגישות המובילות נקראת RAG, ראשי תיבות של Retrieval Augmented Generation. בעברית פשוטה: מודל שיודע קודם לחפש, ואז לנסח.

במקום לסמוך על הזיכרון הפנימי של המודל, RAG עובד אחרת לגמרי. המערכת קודם מאתרת מידע מעודכן ממקורות חיצוניים אמינים, ורק אחרי שהיא מצאה את המידע הרלוונטי, היא מבקשת מהמודל לסכם אותו. זה מצמצם באופן משמעותי את הסיכוי לטעויות והמצאות.

אבל כדי שמערכת RAG תעבוד באמת, שני תנאים חייבים להתקיים. ראשית, האחזור חייב להיות מדויק. המידע שנשלף צריך להיות רלוונטי, עדכני ואמין. שנית, הסיכום שהמודל יוצר צריך להישאר נאמן למקור, בלי לעוות או להוסיף מידע מבחוץ.

יש לציין כי כיום ישנם מודלים שמגיעים לרמת עקביות של מעל 99 אחוזים. אבל זה עדיין לא אומר שהבעיה נפתרה לגמרי. במיוחד כשמדובר בשאלות מורכבות או בתחומים שבהם אין הרבה מידע איכותי זמין.

אז מה אפשר לעשות?

תופעת ההזיות היא אתגר שדורש התייחסות מודעת מצד כל מי שעובד עם הכלים האלה, מפתחים, ארגונים ומשתמשים קצה.

בחירת המודל הנכון הדוח של (vectare leadbord (https://github.com/vectara/hallucination-leaderboard)) יכול לעזור לכם לזהות מודלים שמציגים רמת דיוק גבוהה במיוחד.

יישום של RAG חיבור המודל למקורות מידע חיצוניים שנבדקו ואומתו יכול לצמצם משמעותית את תדירות ההזיות. אבל זה עובד רק כשמנגנון האחזור עצמו מדויק, והמודל יודע לסכם בלי לעוות את המידע.

חינוך משתמשים חשוב לזכור שלא לסמוך באופן עיוור על תשובות שמתקבלות ממודל בינה מלאכותית. יש לאמת, לבדוק ולהצליב את המידע מול מקורות נוספים, ולהכיר את המגבלות של המערכת שאיתה עובדים. בנוסף, כדאי להימנע מדיונים עם מודלים בנושאים שאינכם מבינים לעומק , אחרת כל טענה תישמע מהימנה, פשוט מפני שאין לכם בסיס ידע להשוואה.

לסיכום:

בינה מלאכותית צריכה להיות לא רק חכמה, אלא גם אמינה. תופעת ההזיות מלמדת אותנו שטכנולוגיה מתקדמת דורשת גם שיקול דעת מתקדם. היא לא מחליפה חשיבה ביקורתית, היא דורשת אותה עוד יותר. ככל שהמודלים האלה ישתלבו עמוק יותר בתהליכי העבודה שלנו, כך נצטרך להיות ערניים יותר לגבי האופן שבו אנחנו משתמשים בהם, מה אנחנו מאמינים להם, ומתי אנחנו בודקים אותם מחדש.

מקורות וקישורים רשמיים

  1. 1. vectare leadbord — github.com

להמשך קריאה

פתרונות וכלים חדשיםO-SPACE · מעניין במיוחד לפרודוקטיביות בעבודה

קבוצות פייסבוק בנושא בינה מלאכותית: 5 קהילות AI שכדאי להכיר

מדריך מתעדכן לקבוצות פייסבוק בעברית ובאנגלית שעוסקות ב-ChatGPT, Claude, יצירה, פיתוח ויישומי AI — כולל השוואה מהירה, למי כל קבוצה מתאימה ואיך להפיק ממנה ערך.

10 דק׳ קריאה