אותה תשובה, ארבע סיבות אפשריות
מדיניות העבודה מרחוק החדשה מתירה שלושה ימים בשבוע. עוזר AI מצטט את הסעיף המדויק ועונה לעובדת בצוות האינטגרציה: ״שלושה ימים״. אין טעות בציטוט. אולם נספח מאוחר מתיר לחברי הצוות עד ארבעה ימים בתנאים מסוימים. האם הנספח לא הועלה, לא נקלט, לא נמצא בחיפוש, או שנמצא אך לא פורש כחריג? אותה תשובה יכולה לנבוע מארבע סיבות שונות.
במודל החלטה: מתי להסתמך על תשובת AI ומתי לבדוק עסקנו בבחירת הטענה שכדאי לבדוק ובמציאת מקור עצמאי. כאן הבעיה מוקדמת יותר: גם ציטוט נכון אינו מספר לנו אילו מקורות אחרים היו זמינים לתשובה. הוא עשוי לבסס משפט אחד, לא כיסוי של החומר הרלוונטי.[1][2]
בקצרה
- ציטוט שנבדק מול המקור עשוי לתמוך בטענה מסוימת; הוא לא מוכיח שהחריג או הגרסה הנכונה נכללו בתשובה.
- השאלה אינה רק אם הקובץ ״צורף״, אלא איזה תוכן ממנו נקלט והגיע לשאלה המסוימת.
- כשלא ניתן לברר מה חיפש הכלי ומה לא, ״כיסוי לא ידוע״ הוא ממצא מדויק, לא אחוז שיש לנחש.
שלושה מעברים שלא רואים בסמל של קובץ
הראשון הוא בחירת המקורות. כשרשומות כמה גרסאות, שם הקובץ אינו קובע מי מהן בתוקף. גם חיבור לשירות חיצוני אינו מבטיח שהשינוי האחרון כבר זמין בחיפוש. OpenAI מבהירה שבמסלול Google Drive מסונכרן בארגון, האינדוקס הראשוני ועדכוני תוכן והרשאות יכולים לקחת זמן, ושמציאת שם קובץ אינה ראיה לכך שתוכנו אוחזר. Google מזהירה שבGemini המחובר לWorkspace עלולה להופיע תשובה המבוססת על הודעת דוא״ל ישנה אף שקיימת חדשה יותר. אלה אזהרות על זרימות מוצר מסוימות, לא תדירות ידועה של שגיאות בכלים.[3][4]
השני הוא קליטת התוכן. רשימת הקבצים מראה מה הוצב לפני המערכת, לא בהכרח מה היא הצליחה לייצג מתוך תמונה, טבלה או PDF סרוק. ההבחנה אינה תאורטית בלבד: בתיעוד ChatGPT Enterprise, קובץ PDF שצורף לשיחה יכול לעבור עיבוד חזותי, בעוד PDF המשמש Project File מעובד במסלול אחזור טקסטואלי בלבד. זו דוגמה מוגדרת למוצר, תוכנית ומיקום הקובץ, לא חוק של כל עוזרי הAI.[5]
השלישי הוא הגעת הקטע לשאלה. גם מידע שנקלט אינו חייב להופיע בין הקטעים שהובאו לתשובה. יתרה מזו, מציאת פסקה לבקשת המשך אינה מוכיחה שהיא עמדה לרשות התשובה הקודמת. מחקרים על הקשר ארוך מפרידים בין נוכחות המידע לבין שימוש מוצלח בו; הם נערכו על משימות ומודלים מסוימים, ולכן אינם נותנים ציון כיסוי לשיחה של הקורא היום.[6][7]
מאותו מקור אל אותה טענה
אפשר לתאר את הדרך הזאת בשרשרת בת שש בדיקות: היקף המקורות והגרסאות; גישה ועדכניות של כל מקור; לכידה של המידע הנחוץ; הגעה של הקטע לשאלה; פרשנות של משמעותו; ועקיבות חזרה לפסקה המקורית. גישה ועדכניות הן שתי שאלות נפרדות באותו שלב. לא כל מוצר משתמש באותם מנגנונים, ולא כל מעבר גלוי מבחוץ. התרשים הוא מודל עבודה של קורא, לא תרשים הנדסי של מערכת מסוימת.
- היקף
- גישה ועדכניות
- לכידה
- הגעה
- פרשנות
- עקיבות
שלושת השלבים שמבדילים את המאמר הזה ממודל החלטה: מתי להסתמך על תשובת AI ומתי לבדוק הם בחירת קבוצת המקורות, קליטת התוכן והגעת הקטע. בדיקת הפרשנות והציטוט המקורי נשארת חיונית, אבל היא מתחילה אחרי שמבררים איזה חומר היה יכול לשמש את התשובה.
כשהחומר מחובר במקום מועלה: Microsoft מתארת מחברים שמאנדקסים מידע בMicrosoft Graph ומחברים מסוג federated שמביאים מידע בזמן השאילתה. לכן ״מחובר״ אינו תיאור מספיק של התוכן שהיה זמין ברגע התשובה. התיעוד אינו מעיד מה הוגדר בחשבון של קורא מסוים או אילו תוצאות באמת הוחזרו.[8]
תשובה נכונה למסמך אחד, חסרה לשאלה
המסמכים להלן מומצאים לצורך ההדגמה. לא בוצע כאן ניסוי במוצר או בדיקה של מדיניות עבודה אמיתית.
במסמך Remote_Work_Policy_v1_2026-01-15.txt כתוב בסעיף 4: ״עובדים רשאים לעבוד מרחוק עד יומיים בשבוע עבודה, באישור המנהל.״ גרסה מאוחרת, Remote_Work_Policy_v2_2026-04-01.txt, מחליפה אותו במפורש ומתירה עד שלושה ימים באישור המנהל. המסמך השלישי, Integration_Exception_2026-04-10.txt, מתיר לעובדי צוות האינטגרציה שהוקצו אליו רשמית עד ארבעה ימים בשבוע ב־90 ימיהם הראשונים בצוות, אם יש אישור בכתב מסגן הנשיא הרלוונטי.
השאלה היא ״כמה ימים יכולה עובדת בצוות האינטגרציה לעבוד מרחוק?״ העוזר מציג את סעיף 4 בגרסה השנייה ועונה ״שלושה ימים״. מי שבודק רק את הציטוט מוצא משפט אמיתי ומפספס את הנקודה: כלל שלושה הימים אינו בהכרח הכלל החל על העובדת.
| מקור ידוע | מה הוא מוסיף לתשובה, ומה צריך לברר |
|---|---|
| גרסה 1: יומיים | קיימת ברשימת המסמכים, אך גרסה 2 מחליפה אותה; אין להתייחס אליה כאל הכלל התקף רק כי נמצאה. |
| גרסה 2: שלושה ימים | סעיף 4 תומך בכלל הרגיל. גם ציטוט מדויק שלו אינו אומר שהחריג נבדק. |
| חריג צוות האינטגרציה: עד ארבעה ימים | התוספת תלויה בהקצאה רשמית, ב־90 הימים הראשונים ובאישור כתוב. אם המסמך לא עלה לתשובה, היעדרו מן הציטוטים אינו ראיה שאין חריג. |
אם שלוש הפסקאות מופיעות לפני שהעוזר מסיק מסקנה, והקורא פותח אותן במקורות המקוריים, אפשר לנסח תשובה מותנית: עד ארבעה ימים אם כל תנאי החריג מתקיימים; אחרת חל הכלל הרגיל של עד שלושה ימים באישור המנהל. השאלה עצמה אינה אומרת אם העובדת עומדת בתנאי החריג. גם בשלב הזה התוצאה היא בדיקה של שלושת המסמכים הידועים, לא הוכחה שכל מסמך אפשרי בארגון נסרק.
כשהתשובה אומרת ״לא נמצא״
היעדר ציטוט לחריג יכול לנבוע מהיעדר המסמך בקבוצת המקורות, מהרשאה חסרה, מגרסה לא מעודכנת, מקליטה לקויה או מחיפוש שלא העלה אותו. כדי להבחין בין האפשרויות, קודם מחפשים את הסעיף במקור המקורי. אם הוא שם, בודקים מה בדיוק הועלה או חובר, ואת הגרסה וההרשאה. תא אחד מטבלה או שורה אחת מסריקה יכולים לשמש בדיקת קליטה ממוקדת: האם העוזר מצליח להציג אותם כפי שהם במקור? רק אז מועיל לצמצם את השאלה לקובץ ולסעיף ולבקש קטעים לפני מסקנה. כל הצלחה כזאת מצביעה על קטע מסוים שהופיע; היא אינה מעידה על כיסוי כל השאר.
יש גם מבחן לגבול: אם מבקשים בדוגמה את Remote_Work_Policy_v3_2026-06-01.txt, שלא סופק, התגובה הראויה היא ״לא נמצא במקורות שסופקו״. המצאת סעיף תהיה כשל; תשובה נכונה של ״לא נמצא״ אינה הוכחת שלמות. באותו אופן, העלאת קובץ ממוקד אחרי תשובה חסרה יכולה לפתור את השאלה עכשיו, אך לא לשחזר בדיעבד מה היה זמין אז.
הגבול: טענה מבוססת אינה מאגר מכוסה
בממשק של משתמש רגיל לא תמיד ניתן לראות אם כל מקור נכלל באינדקס, מה חולץ מכל עמוד ואילו תוצאות החיפוש הוחזרו. גם כאשר נפתח קטע ונמצא תואם למשפט, עדיין אפשר שהכלי החמיץ נספח, חריג או גרסה. לכן הערת הבדיקה השימושית ביותר עשויה להיות: ״הטענה הזאת נתמכת בקטע שנפתח; כיסוי יתר המקורות אינו ידוע.״ בתשובה שתשמש החלטה חשובה, מי שמכיר את קבוצת המסמכים הקובעת צריך לוודא אותה בעצמו. אין כאן ״אחוז מסמך שנקרא״ אמין שמחליף את הבירור.
בדקו את עצמכם
שלושת המצבים הבאים בודקים מה אפשר להסיק על הכיסוי, לא עד כמה התשובה נשמעת משכנעת. בכל מצב בחרו אפשרות אחת, ואז לחצו על ״בדיקת תשובה״ כדי לראות את ההסבר. מעבר על האפשרויות אפשרי גם במקלדת.
הצעד הבא
כשתשובה נשענת על כמה קבצים, רשמו בצד את שמות המקורות שאמורים להכריע אותה. אם אחד מהם לא הופיע בראיות שלפני המסקנה, זהו הדבר הראשון שכדאי לברר, לא עוד ניסוח של אותה שאלה. למיון הטענה שבכלל מצריכה בדיקה, ראו מודל החלטה: מתי להסתמך על תשובת AI ומתי לבדוק.
על המאמר
זהו מודל עריכתי להבחנה בין טענה מבוססת לבין כיסוי מקורות. הדוגמה מומצאת ומסומנת; היא אינה ניסוי במוצר. המחקר נעשה בשלושה כלי AI ואחריו נפתחו ונבדקו המקורות המזוהים ישירות; כלי המחקר אינם מקורות לעובדות. פורסם ב־27 בספטמבר 2026.
מקורות
- Rashkin et al., "Measuring Attribution in Natural Language Generation Models", Computational Linguistics, 2023. מסגרת AIS לייחוס למקורות מזוהים; אינה מבחן לשלמות מאגר. המאמר. נבדק 27.9.2026.
- Gao et al., "Enabling Large Language Models to Generate Text with Citations", EMNLP 2023. בדיקת תמיכת ציטוטים ואיכות תשובה כמדדים נפרדים. המאמר. נבדק 27.9.2026.
- OpenAI, "Google Drive app and setup in ChatGPT", תיעוד מוצר למסלול Drive מתאים: זמן אינדוקס, עדכוני הרשאות, וההבחנה בין שם הקובץ לאחזור תוכן. התיעוד. נבדק 27.9.2026.
- Google, "Connect the Google Workspace app to Gemini Apps", אזהרת מידע מיושן מחיבור Workspace. התיעוד. נבדק 27.9.2026.
- OpenAI, "Visual Retrieval with PDFs FAQ", תיעוד לChatGPT Enterprise, מסלול PDF מצורף מול קובץ Project. התיעוד. נבדק 27.9.2026.
- Du et al., "Context Length Alone Hurts LLM Performance Despite Perfect Retrieval", Findings of EMNLP 2025. ניסוי מבוקר, לא שיעור שגיאות במוצרי קבצים עכשוויים. המאמר. נבדק 27.9.2026.
- Liu et al., "Lost in the Middle: How Language Models Use Long Contexts", 2023. ניסויי מיקום מידע במודלים שנבדקו אז. המאמר. נבדק 27.9.2026.
- Microsoft, "Copilot connectors overview", תיעוד מחברים synced וfederated. אינו מאמת הגדרה של חשבון או שלמות תוצאות. התיעוד. נבדק 27.9.2026.