צ'סקו גילתה סיבות לכך שגם דוחות מלאים של בינה מלאכותית על אירועי סייבר שנראים כמעט מושלמים אינם כדאי להתייחס אליהם כאל אמת
Cisco Talos מחקר את דיוק מודלי שפה גדולים ביצירת דוחות סייבר
צוות Cisco Talos Incident Response ערך בדיקה כדי לקבוע עד כמה מודלים LLM (ChatGPT, Claude ו‑Gemini) אמינים לייצר דוחות טכניים על אירועי סייבר. התוצאות הראו שגם המסמכים המראים את המראה המקצועי ביותר מכילים טעויות עובדתיות, סתירות וחוסר התאמה.
איך בוצע המחקר
* הכנה – החוקרים שלחו לכל מודל הערות גולמות על האירוע עם בקשה להכין דוח.
* תוצאה – כל שלושת ה‑LLM הפיקו מסמכים שנראים משופצים, אך ניתוח מעמיק חשף אי דיוקים ומסקנות לא צפויות.
נייט פורס (Nate Pors), מנהל בכיר של תגובת אירועים ב־Cisco Talos, תיאר את התוצאות בפורום החברה בפרוטרוט.
למה LLM "טעים"
Cisco מסביר שהבעיות נובעות מהטבע ההסתברותי של המודלים: הם חוזרים על המילה הבאה לפי משקל סטטיסטי ולא מבינים משמעות. לפי פורס, הטעויות מתבטאות בארבעה כיוונים:
1. קטעי נתונים שונים
בכל בקשה המודל מסתמך על חלקים שונים מהקלט, מה שמונע תוצאות חוזרות ונשנות ומאופשרות.
2. מסקנות לא מוסכמות
אותם נתונים יכולים להוביל המלצות שונות: בדוח אחד יציעו החלפת סיסמאות מחייבת בכל הארגון, בעוד בדוח אחר רק שינויים נקודתיים. המודל נוטה להתמקם על ההמלצה הראשונה שנוצרה, גם אם אינה מתאימה.
3. מבנה לא סטנדרטי
מכיוון שה-LLM מייצרים טקסט תו אחרי תו, המסמכים הסופיים עשויים להיות בעלי מבנה ועיצוב שונים, מה שמחייב תבניות בקרת איכות בסביבה זו.
4. בעיות בחלון הקשר
כאשר כמות הנתונים עולה על מגבלת ההקשר, המודל יכול "להשכיח" מידע חשוב מתחילת הפגישה ולהפיק תוצאות בלתי צפויות או מעורבות.
מה זה אומר לביטחון סייבר
Cisco מכירה כי באופן תאורטי ניתן להגביל את המשימה לחלק מסוים של הדוח, אך גישה כזו מפסידה למשתמשים חיסכון בזמן. בתחום הגנת הסייבר, אפילו טעות קטנה יכולה לעלות ביוקר. לכן מחברי המסמכים הסופיים חייבים לבדוק כל מילה בקפדנות ולא להסתמך במלואו על המלצות ה‑LLM.
הסיכום: מודלי שפה גדולים מסוגלים ליצור דוחות במהירות, אך המסקנות שלהם דורשות בדיקה מחייבת של מומחים כדי למנוע טעויות וחוסר התאמה בהקשר קריטי לאירועי סייבר.
תגובות (0)
שתפו את דעתכם — אנא היו מנומסים והישארו בנושא.
התחברו כדי להגיב