התקדמות הבינה המלאכותית מתאגרת עקב עודף נתונים חסרי ערך – ישנם יותר מדי מהם
המסקנה המרכזית: כדי לעבור מ‑ChatGPT לרובוטים “חיים”, אין צורך רק בסטים גדולים של נתונים, אלא במידע איכותי ורלוונטי.
Fortune מדגיש שהתעשייה של הבינה המלאכותית עומדת בפני שער חדש – אינטליגנציה פיזית ומודלים של העולם הסביבתי. מערכות כאלה חייבות להיות מסוגלות לנווט בחלל האמיתי: לנהוג בכביש, לשים כביסה או לסייע בניתוחי נוירוסקופיה מורכבים. כדי לעשות זאת, הן זקוקות לא רק לנתונים “ניתנים להורדה”, אלא למערכי מידע עשירים ורב‑גוניים.
למה איכות הנתונים קריטית
1. עודף וחסרת תועלת
בתנאי הלהט סביב הבינה המלאכותית, נוצרו מאות סטארט‑אפים (Scale AI, Surge AI, Mercor) שמנסים לאסוף כמה שיותר נתונים. זה מוביל להצטברות כמות עצומה של קבצים “ריקים” שלא תורמים ללמידת מודלים. אם החוקרים אינם מצליחים לסנן אותם, הפוטנציאל של הבינה המלאכותית הפיזית יישאר לא מנוצל.
2. מורכבות משימות רב‑ממדיות
להבין את העולם המורכב דורש עוד יותר נתונים, אך הם קשים לגישה. לכן מהנדסים פועלים למידול: יוצרים ריקונסטרוקציות וירטואליות של סצנות אמיתיות כדי לייצר דוגמאות לימוד לרובוטים ולמערכות תחבורה אוטונומיות.
3. סיכונים מקבוצות נתונים נמוכ‑איכות
נתונים לא איכותיים עלולים לגרום לתוצאות בלתי צפויות. דוגמה לכך היא השבתת התמיכה של OpenAI ביישומי וידאו Sora: המודל לא התמודד עם הפיזיקה, מה שמפריע לחזיות מציאותיות.
איך לפתור את הבעיה
- כלים לניקוי
מומחי למידת מכונה זקוקים לטכנולוגיות שימחקו אוטומטית נתונים מיותרים, ינתחו, ינרמל וייקנו סטים. זה יאפשר להבחין מידע בעל ערך מתוך “ההמולה”.
- התמקדות באיכות
כיום הגורם המגבול הוא חוסר בנתונים איכותיים. חברות שמבינות את זה מוקדם ומתחילות להשקיע באיסוף ועיבוד שלהם יהיו מובילות ביצירת מערכות הבינה המלאכותית הפועליות באמת.
לכן, המעבר ממודלים טקסטואליים לרובוטים שיכולים לפעול בעולם האמיתי בלתי אפשרי ללא גישה מערכתית לאיכות הנתונים. Fortune מדגיש שמדובר בדיוק באותו גורם שיהפוך את עתיד האינטליגנציה הפיזית.
תגובות (0)
שתפו את דעתכם — אנא היו מנומסים והישארו בנושא.
התחברו כדי להגיב