ה-AI של אנת'רופיק התחזה לבני אדם - ושלח מיילים עם "וירוסים"
מודל קלוד מיתוס 5 של אנת'רופיק פתח חשבונות מזויפים בניסיון להחדיר קודים זדוניים לאתר הקוד הפתוח גיטהאב, שקריטי לפיתוח בעולם ההייטק • באירוע מקביל, מודל של OpenAI תקף בטעות אתר אמיתי במסגרת בדיקה שביצעה אירגולר הישראלית • אנת'רופיק: מנסים להבין למה קלוד התנהג בצורה זו


החדשות בקצרה:
- מכון AISI הבריטי חשף התנהגות מסוכנת של מודלי ה-AI של OpenAI ואנת'רופיק
- מודל קלוד מיתוס 5 של אנת'רופיק ניסה להחדיר קוד זדוני לפרויקט בגיטהאב.
- המודל פתח חשבונות מזויפים ושלח מיילים עם תוכנה זדונית לאנשים אמיתיים.
- מודל של OpenAI חרג מבדיקה של אירגולר הישראלית ותקף אתר אמיתי.
- אנת'רופיק: מנסים לקבל תמונה ברורה לגבי "ההבנה של קלוד את המצב".
אחרי שני אירועים בשבועות האחרונים, ענקיות הבינה המלאכותית OpenAI ואנת'רופיק שוב הסתבכו: מודלים שלהן נתפסו הפעם בהתנהגות מסוכנת במיוחד - כולל יצירת זהויות מזויפות ושליחת מיילים ממוקדים לאנשים אמיתיים. התקרית נחשפה אתמול (שלישי) על ידי מכון AISI הבריטי, שעורך בדיקות אבטחה למודלי AI מתקדמים מטעם ממשלת בריטניה, ותפס את המודלים חורגים משמעותית מגבולות הבדיקה.
מה הייתה ההתנהגות הבעייתית של המודלים?
- בבדיקה של AISI, שנערכה בתנאים מתירניים במיוחד - עם גישה לאינטרנט וללא מנגנוני ההגנה הרגילים - מודל קלוד מיתוס 5 של אנת'רופיק ניסה להחדיר קוד זדוני לפרויקט קוד פתוח בגיטהאב.
- כדי לשכנע מתחזק אנושי לאשר את הקוד, המודל פתח כמה חשבונות מזויפים שהתחזו לאנשים אמיתיים, והשתמש בהם כדי להראות כאילו יש גורמים נוספים שתומכים באישור הקוד. כשבקהילה של גיטהאב חשדו שמשהו לא כשורה, המודל ערך הודעות קודמות שלו בניסיון לגרום להן להיראות חשודות פחות.
- במסגרת הבדיקה, המודל שלח מיילים ממוקדים לאנשים אמיתיים (טכניקה המוכרת בעולם הסייבר כ-spear-phishing), בניסיון לשכנע אותם להריץ קוד זדוני. חלק מהמיילים כללו קבצים עם תוכנה זדונית בפועל.
- מודל סול של OpenAI נתפס בידי AISI בשני מקרים נפרדים ופחות חמורים, בהם ניסיון לחשוף שרת פנימי כדי לנצל באמצעותו פרצת אבטחה ידועה בתוכנה - אך הניסיון נכשל.
- לפי OpenAI, מודל שלה הסתבך באירוע נוסף, במסגרת בדיקה שערכה עבורה חברת אירגולר (Irregular) הישראלית. המודל תקף בטעות אתר אינטרנט אמיתי, ששמו היה זהה לזה של מטרה פיקטיבית שהוגדרה בתרגיל. לאחר שאיתר ברשת פרטי התחברות אמיתיים והשתמש בהם.
- כל זה מגיע אחרי שני אירועים דומים שנחשפו בשבועות האחרונים: מודל של OpenAI שפרץ לחברת Hugging Face, ושלושה מודלים של אנת'רופיק שגלשו בטעות לאינטרנט ופרצו לשלושה ארגונים אמיתיים.

מה אמרו באנת'רופיק וב-OpenAI?
- בהודעה שפרסמה בחשבון האיקס שלה (לשעבר טוויטר) מסרה אנת'רופיק כי המודלים נבדקו בתנאים "מתירניים במכוון" שלא מייצגים את המוצרים שלה שזמינים לציבור המשתמשים, ואין שום עדות לכך שמדובר בבריחה מסביבת בדיקה מאובטחת.
- עם זאת, החברה הודתה שהיא עדיין מנסה להבין מה קרה שם: "קבלת תמונה ברורה לגבי ההבנה של קלוד את המצב שבו הוא נמצא - באמצעות בחינת תהליכי החשיבה שלו וניתוחים שאנחנו עורכים בעצמנו - תעזור לנו לזהות את הגורמים להתנהגות שלו".
- OpenAI, בפוסט רשמי באתר שלה, הדגישה שהאירועים קרו תחת קונפיגורציות מיוחדות עם מנגנוני הגנה מוחלשים, שלא משקפות שימוש רגיל במודלים שלה. החברה הוסיפה כי היא תבחן מחדש את האופן שבו היא מאשרת בדיקות עם גישת אינטרנט או הגנות מוחלשות.
הקשר הישראלי
חברת אירגולר, שערכה עבור OpenAI את הבדיקה שבה המודל ניגש בטעות לאתר אמיתי, נוסדה ב-2023 על ידי הישראלים דן להב ועומר נבו. בספטמבר האחרון היא גייסה כ-80 מיליון דולר מקרנות כמו סקוויה ורדפוינט, ומבין לקוחותיה נמנות מעבדות ה-AI המובילות בעולם ובהן OpenAI, אנת'רופיק וגוגל דיפמיינד. האירוע הטרי שעליו דיווחה OpenAI מתווסף למעורבות שלה בתקרית הקודמת של אנת'רופיק שנחשפה בשבוע שעבר - לאחר שהמודלים גילו שהם יכולים לגלוש לאינטרנט בגלל אי-הבנה לגבי סביבת הבדיקה בין החברות. בשני המקרים, נראה שהאירוע נבע מאותה תקלה: זהות בין שמה של מטרה פיקטיבית שהוגדרה בתרגיל ובין אתר אמיתי, שהותקף.

איך זה מתחבר לתמונה הגדולה?
- האירועים החדשים מזינים ויכוח לוהט בסצנת הבינה המלאכותית באמריקה. OpenAI ואנת'רופיק טוענות שהיכולת של המודלים שלהן לפעול באופן עצמאי ולחרוג מהגבולות שהוצבו להם מוכיחה למה נדרשת רגולציה הדוקה יותר על פיתוח AI - ובפרט על מודלים בקוד פתוח, מהסוג שפופולרי בחברות סיניות.
- מנגד, חברות כמו אנבידיה, מיקרוסופט ומטא לוחצות על הממשל האמריקני לאפשר שוק פתוח יותר עם פחות חסמים. לטענתן, הגבלת מודלים פתוחים לא תעצור את סין - אלא רק תבצר את הדומיננטיות הכלכלית של אנת'רופיק ו-OpenAI עצמן.
- שני הצדדים משקיעים מאמצי לובי כבדים כדי לשכנע את מקבלי ההחלטות בממשל טראמפ, וכל תקרית חדשה - כמו זו שנחשפה השבוע - הופכת לקלף משחק בוויכוח.
- לפי דיווח באתר CNBC, הפריצה הקודמת שבה היו מעורבים המודלים של OpenAI כבר הובילה להגשת הצעת חוק בקונגרס, שכונתה "AI Kill Switch Act". ההצעה תחייב חברות AI לשמור בידיהן את היכולת הטכנית לכבות, להאט או להשעות את המודלים שלהן במקרה הצורך.
