החוקרים של מיקרוסופט מציינים שהמודלים הבינה המלאכותית עדיין אינם מסוגלים לפתור בעיות מורכבות.
חוקרי מיקרוסופט זיהו מגבלות של מודלים גדולים לשפה (LLM) בביצוע משימות מורכבות מרובות
במסגרת ניסויים, מחקר Microsoft מצא שגם המודלים המתקדמים ביותר מבצעים שגיאות חמורות כאשר מתבקשים לבצע פעולות ארוכות ומורכבות. בין המערכות שנבדקו – Gemini 3.1 Pro, Claude 4.6 Opus ו‑GPT 5.4 – בממוצע כל אחת איבדה כ-25 % מהתוכן של המסמכים לאחר עיבוד אוטונומי.
מה בדיוק נבדק
* מדד DELEGATE‑52
נוצר על ידי פיליפ לָבּאן, טוביוס שנבל וגנר יֶנִיל. הוא מְשַׁכֵּל תהליכי עבודה ב-52 תחומי מקצוע: מתכנות ונוטציה מוזיקלית עד קריסטולוגיה.
* קריטריון הערכה
המודלים הוערכו לפי כמה הם שומרים על שלמות המסמך לאחר 20 מחזורים. סף "הכנה" נקבע ל-98 % – אם התוצאה ירדה מתחת, המשימה נחשבה כלא מוצלחת.
מסקנות עיקריות
תחום תוצאות הטובות ביותר תכנות ביצועים חזקים ביותר שפה טבעית מודלים פחות אמינים
* נפילת איכות
ב-80 %+ מהשילובים המסמכים, האיכות ירדה ל-80 % ומטה. המודל הטוב ביותר (Gemini 3.1 Pro) עמד בקריטריונים רק ב-11 מתוך 52 תחומים.
* שגיאות קפיציות
הפסדים לא התרחשו בהדרגה אלא "בציפורים": בכל מחזור, המודל יכול היה לאבד בין 10 ל‑30 % מהדיוק. מודלים מתקדמים יותר (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) ניסו להימנע משגיאות קטנות על ידי דיחוי עיבודם לשלב מאוחר יותר והפחתת מספר האינטראקציות.
* ניהול סוכן
בשימוש בכלים במצב של ניהול סוכן, התוצאות לא השתפרו: בסיום המחזור, האיכות ירדה כ-6 %.
מה זה אומר למשתמשים
המדענים מדגישים כי עדיין חשוב למשתמשים לנהל בקפידה את עבודת המערכות AI בעת שהן מקבלות סמכויות. המודלים הנוכחיים מסוגלים לפעול אוטונומית רק בתחומים מצומצמים.
למרות זאת, מחברי המדד מדגישים התקדמות ניכרת: משפחת המודלים של OpenAI בשנה ו-16 חודשים שיפרה את ביצועיה מ-14.7 % ל‑71.5 %. זה מאשר כי LLM ממשיכים להתפתח אך עדיין מוגבלים במשימות מורכבות מרובות.
תגובות (0)
שתפו את דעתכם — אנא היו מנומסים והישארו בנושא.
התחברו כדי להגיב