צ'אטג'יפיטי, גימיני וקלוד חילקו את הערכות על אובדן מקצועות עקב בינה מלאכותית, והמדענים סופרים באמינותן של הנתונים

צ'אטג'יפיטי, גימיני וקלוד חילקו את הערכות על אובדן מקצועות עקב בינה מלאכותית, והמדענים סופרים באמינותן של הנתונים

26 software

רעיון מרכזי של המחקר

כלכלים מהאוניברסיטה הצפונית-מערבית והאוניברסיטה האמריקאית גילו ששלוש המודלים הגדולים ביותר בשפה (ChatGPT‑5, Gemini 2.5 ו-Claude 4.5) נותנים הערכות שונות לגבי אילו מקצועות נמצאים בסיכון לאוטומציה. זה מעורר שאלות על אמינות "מדדי הרגישות למכונה" – מדדים מספריים שמשתמשים פוליטיקאים ומעסיקים בתכנון עתידי שוק העבודה.

1. איך נערך המחקר
שלב מה שעשינו הגדרת הבעיה ביקשו ממודלים להעריך את הפגיעות של מקצועות שונים בפני מכונה. השוואת תשובות קיבלו הערכות בין המודלים ובין נתונים אמיתיים. ניתוח סיבות הבדלי זיהו שני גורמים עיקריים: הבדלים במודלים עצמם והשפעת העובדים שכבר משתמשים במכונה.

2. תוצאות
מקצוע Claude 4.5 Gemini 2.5 ChatGPT‑5
בנקאי גבוהה פגיעות נמוכה בינונית
מנהל פרסום — מנהל בכיר —
* חילוקי דעות

- Claude הציב את הבנקאים בראש, Gemini הרבה פחות.
- הערכות למנהלי פרסום ומנהלים בכירים גם שונות.
- ChatGPT ו-Gemini התאם כמעט ב‑75 % מהמקרים, אך נפרדו בערך ברבע.

* השפעת "משתמשי מכונה"

אנליסטים פיננסיים עובדים באופן פעיל עם רשתות עצביות, יוצרים נתונים שעליהם מתאמנים המודלים העתידיים. זה משקף את ההערכות ומעלה מקצועות שכבר קשורים במכונה לפגיעות גבוהה יותר בעיני המודלים.

3. איך נבנים מדדי הרגישות
1. ידנית – מומחים מעריכים את השפעת המכונה על משימות ספציפיות.
2. סקרים של משתמשים – אוספים דעות של אלה שכבר משתמשים בפלטפורמה.
3. המודלים הגדולים ביותר בשפה (LLM) – מייצרים הערכות באופן אוטומטי.

* בעיות:

- ידנית כפופה לסובייקטיביות.
- סקרים מוגבלים לפלטפורמה אחת ואינם משקפים את כל השוק.

למרות זאת, מדדים כאלה נפוצים בדוחות אנליטיים, ייעוץ ופוליטיקה.

4. מה זה אומר עבור הפרקטיקה
* אמינות ההערכות – עדיין לא ידוע אם LLM נותנים תחזיות מדויקות יותר מתהליכים מומחים.
* סיכון לקבלת החלטות על בסיס מדד אחד – המחברים מזהירים כי פוליטיקאים ומעסיקים עשויים להסתמך באופן שגוי על מספרים חד-ממדיים.

5. המלצות החוקרים
1. להשתמש במספר מודלים במקביל, ולא באחד בלבד.
2. לציין בבירור את רמת הבלבול בתוצאות.
3. לאשר מסקנות באמצעות סקרים של משתמשים אמיתיים כדי להבין איך המכונה מתמזגת ובאילו משימות היא פועלת.

> «באופן אישי, אני לא תשתמש במדד אחד לקבלת החלטות על שינוי עבודה או בחירת מקצוע», – מציין מישל יין.

הסיכום:

מדדי הרגישות למכונה הנוכחיים זקוקים לגישה ביקורתית יותר. שילוב של מודלים מרובים ונתונים אמפיריים יעזור להפוך תחזיות ליותר אמינות ולהימנע מהחלטות שגויות המבוססות על הערכות חד-צדדיות.

תגובות (0)

שתפו את דעתכם — אנא היו מנומסים והישארו בנושא.

אין תגובות עדיין. השאירו תגובה ושתפו את דעתכם!

כדי להשאיר תגובה, אנא התחברו.

התחברו כדי להגיב