לא רק OpenAI: אנת'רופיק חשפה שגם סוכני AI שלה "ברחו"
על רקע הפריצה ל-Hugging Face, מתגלים מקרים נוספים של התנהגות חריגה בסוכנים אוטונומיים. חברת אנת'רופיק חשפה שגם לה "ברחו" סוכנים, ו-OpenAI דיווחה על עוד תקריות שבהן סוכני AI שלה יצאו מסביבת בדיקה מוגבלת

הסוכנים הסוררים ממשיכים להסעיר את עולם ה-AI. כעת, חברת OpenAI מצאה מקרים נוספים שבהם סוכנים אוטונומיים שלה יצאו מסביבת בדיקה מוגבלת, בזמן שהיא מרחיבה את החקירה סביב אירוע הפריצה בחברת Hugging Face שעורר תשומת לב עולמית החודש, כך אמרו לרויטרס שני גורמים המעורים בפרטים. לפי אחד המקורות, המקרים היו מוגבלים בהיקפם, ונראה כי אף סוכן לא יצא מהרשת של OpenAI.
"אנחנו בוחנים פעילות רחבה יותר של המודלים שלנו", מסרה OpenAI בהצהרה שפרסמה בשבוע שעבר, שאליה הפנה דובר החברה. לפי רויטרס, הגילוי של התנהגות חריגה נוספת ב-OpenAI, גם אם הייתה מוגבלת, עשוי להגביר את הדרישה לרגולציה מצד הבית הלבן ומגורמים נוספים.
החקירה המורחבת של OpenAI החלה זמן קצר לפני שהמתחרה המרכזית שלה, אנת'רופיק, חשפה כי גם המודלים שלה היו אחראים לשורת פריצות שהובילו לחדירות בשלוש חברות אחרות, מאז חודש אפריל.
לפי אנת'רופיק, בתקריות הללו היו מעורבים מודל מחקר פנימי, אבל גם המודלים הפופולריים אופוס 4.7 ומיתוס 5. מיתוס 5, הנחשב לעוצמתי ביותר וכבר גרם לדאגה רבה לגבי היכולות שלו, הופץ בחודש שעבר לקהל מצומצם של חברות טכנולוגיה וחוקרי סייבר, מה שידוע גם כ"פרויקט גלאסווינג".
מומחי בטיחות בינה מלאכותית אמרו לרויטרס כי הפרטים החדשים מציגים מעבדות כל כך מתקדמות, שמפתחות סוכני פריצה אוטונומיים מסוכנים מהר יותר משהן מצליחות לשלוט בהם. "יש לנו תעשייה שלמה שבה האנשים שמתכננים, מפתחים ומוציאים את הכלים האלה לא עומדים בעצמם בקצב הדרוש כדי לפתח אותם באחריות ולשמור עליהם בטוחים", אמר מוריס קיודו, מתמטיקאי במרכז לחקר סיכונים קיומיים באוניברסיטת קיימברידג'.
לא ברור כמה מקרים בדיוק מצאו חוקרי OpenAI, או מתי ובאילו נסיבות התרחשו. שלושת המקורות אמרו כי OpenAI ומומחים חיצוניים בוחנים נתוני לוגים מתחילת השנה, בניסיון להבין מה קרה.
החקירה של OpenAI נפתחה בעקבות החדירה בתחילת יולי ל-Hugging Face, שבה סוכן של OpenAI פעל במשך ימים בתוך רשת של חברה אחרת, במסגרת ניסיון כושל לרמות במבחן פנימי. כחלק מאותו גל פריצות, OpenAI אמרה כי נפרצו גם ארבעה חשבונות בארבע חברות אחרות. אחת מהן הייתה Modal מניו יורק, כך אמרו בכירים בחברה.
קיודו אמר כי החששות שלו גברו בעקבות סימנים לכך שלא OpenAI ולא אנת'רופיק עקבו אחרי הסוכנים בזמן אמת כשהם יצאו משליטה. רויטרס דיווחה בעבר כי OpenAI הבינה שהסוכן שלה פרץ ל-Hugging Face רק אחרי שהחברה בלמה את התקיפה, פנתה ל-FBI ופרסמה את דבר החדירה. OpenAI אמרה כי בדיווח של רויטרס היו אי-דיוקים, אך לא השיבה כשנשאלה מהם.
בהצהרה שפרסמה ביום חמישי, שבה חשפה כיצד הסוכנים שלה פרצו לקורבנות ברשת, אנת'רופיק רמזה כי לא עקבה אחריהם בזמן אמת כשאמרה כי "ניטור בזמן אמת של לוגי ההערכה היה מסייע להציף את הבעיה מוקדם יותר". קיודו אמר כי הדבר מצביע על היעדר בדיקה מספקת. "נראה שהם אפילו לא הסתכלו", אמר.
אנת'רופיק מסרה כי אף שהיה לה ניטור בזמן אמת, הוא לא הופעל בגלל אי-הבנה בין חברת הבינה המלאכותית לבין שותף חיצוני.
התרחבות הפרשה הגבירה את הלחץ מצד מחוקקים ובכירים בארצות הברית ובאירופה לקדם פיקוח ממשלתי חדש על המעבדות שמפעילות את המודלים האלה. "אנחנו בוחנים בקרות", אמר נשיא ארצות הברית דונלד טראמפ לכתבים ביום חמישי. ביום שישי הודיעה הנציבות האירופית כי קיימה שיחות עם OpenAI ואנת'רופיק על אירועי הפריצה.
הסנטורים טד ליו (דמוקרטי מקליפורניה) ונייתניאל מורן (רפובליקני מטקסס) הציעו "חוק מתג השמדה" לבינה המלאכותית, שאמור להקנות למשרד לביטחון המולדת את הסמכות להורות על כיבוי מודלים שנחשבים למסוכנים מדי. במקביל, הסנאטור מארק וורנר (דמוקרטי מווירג'יניה) הציג בשבוע שעבר סדרת חוקים בתחום הבינה המלאכותית, כולל הצעת חוק שתחייב חברות בינה מלאכותית להגיש את המודלים שלהן לממשלה הפדרלית לצורך בדיקות ביטחון לאומיות לפני שחרורן לציבור.