החוקרים של מיקרוסופט מציינים שהמודלים הבינה המלאכותית עדיין אינם מסוגלים לפתור בעיות מורכבות.

החוקרים של מיקרוסופט מציינים שהמודלים הבינה המלאכותית עדיין אינם מסוגלים לפתור בעיות מורכבות.

20 hardware

חוקרי מיקרוסופט זיהו מגבלות של מודלים גדולים לשפה (LLM) בביצוע משימות מורכבות מרובות

במסגרת ניסויים, מחקר Microsoft מצא שגם המודלים המתקדמים ביותר מבצעים שגיאות חמורות כאשר מתבקשים לבצע פעולות ארוכות ומורכבות. בין המערכות שנבדקו – Gemini 3.1 Pro, Claude 4.6 Opus ו‑GPT 5.4 – בממוצע כל אחת איבדה כ-25 % מהתוכן של המסמכים לאחר עיבוד אוטונומי.

מה בדיוק נבדק
* מדד DELEGATE‑52

נוצר על ידי פיליפ לָבּאן, טוביוס שנבל וגנר יֶנִיל. הוא מְשַׁכֵּל תהליכי עבודה ב-52 תחומי מקצוע: מתכנות ונוטציה מוזיקלית עד קריסטולוגיה.

* קריטריון הערכה

המודלים הוערכו לפי כמה הם שומרים על שלמות המסמך לאחר 20 מחזורים. סף "הכנה" נקבע ל-98 % – אם התוצאה ירדה מתחת, המשימה נחשבה כלא מוצלחת.

מסקנות עיקריות
תחום תוצאות הטובות ביותר תכנות ביצועים חזקים ביותר שפה טבעית מודלים פחות אמינים
* נפילת איכות

ב-80 %+ מהשילובים המסמכים, האיכות ירדה ל-80 % ומטה. המודל הטוב ביותר (Gemini 3.1 Pro) עמד בקריטריונים רק ב-11 מתוך 52 תחומים.

* שגיאות קפיציות

הפסדים לא התרחשו בהדרגה אלא "בציפורים": בכל מחזור, המודל יכול היה לאבד בין 10 ל‑30 % מהדיוק. מודלים מתקדמים יותר (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) ניסו להימנע משגיאות קטנות על ידי דיחוי עיבודם לשלב מאוחר יותר והפחתת מספר האינטראקציות.

* ניהול סוכן

בשימוש בכלים במצב של ניהול סוכן, התוצאות לא השתפרו: בסיום המחזור, האיכות ירדה כ-6 %.

מה זה אומר למשתמשים
המדענים מדגישים כי עדיין חשוב למשתמשים לנהל בקפידה את עבודת המערכות AI בעת שהן מקבלות סמכויות. המודלים הנוכחיים מסוגלים לפעול אוטונומית רק בתחומים מצומצמים.

למרות זאת, מחברי המדד מדגישים התקדמות ניכרת: משפחת המודלים של OpenAI בשנה ו-16 חודשים שיפרה את ביצועיה מ-14.7 % ל‑71.5 %. זה מאשר כי LLM ממשיכים להתפתח אך עדיין מוגבלים במשימות מורכבות מרובות.

תגובות (0)

שתפו את דעתכם — אנא היו מנומסים והישארו בנושא.

אין תגובות עדיין. השאירו תגובה ושתפו את דעתכם!

כדי להשאיר תגובה, אנא התחברו.

התחברו כדי להגיב