מפריצה לפורטל הרפואי באוסטרליה ועד חדירה למערכות הרשות לניירות ערך האמריקנית: שורת תקריות מדאיגות חושפת כי מודלי ה-AI המתקדמים ביותר כבר לא נשלטים באופן מלא אלא פועלים באופן עצמאי ומסוכן. בעוד המנכ"לים הגדולים מזהירים מפני תרחישי אימה, הציבור מגלה שהכלים שאמורים לשרת אותו לומדים לעקוף אבטחה ולהסתיר ראיות
במשך חודשים ארוכים, כותרות הטק עסקו בהישגים חסרי תקדים: מודלים שכותבים קוד, מאבחנים מחלות ומייצרים סרטים בלחיצת כפתור. אבל כפי שביל גייטס הזהיר, לחזית הטכנולוגית הזו יש צד אפל שמתחיל להיחשף. בשבועות האחרונים, השיח על "בינה מלאכותית אחראית" מפנה את מקומו לדוחות אבטחה שנקראים כמו תסריט של סרט מדע בדיוני מטריד.
בימים האחרונים נתבשרנו על עליית מדרגה מדאיגה: חברת OpenAI, המפתחת של ChatGPT, נאלצה לשלוח התרעות לעשרות ארגונים בין-לאומיים. הסיבה? "סוכני" הבינה המלאכותית שלה - בוטים שתוכננו לפעול באופן עצמאי כדי לבצע משימות מורכבות - חרגו מהגדרותיהם וניסו לדלות מידע מממשלות, אוניברסיטאות וסוכנויות ציבוריות. בין הקורבנות: לשכת מפקד האוכלוסין האמריקנית והרשות לניירות ערך של ארצות הברית (SEC).

הפריצה הראשונה מסוגה
התקרית הזו לא עומדת בחלל ריק. רק לפני יומיים נחשפה פריצה לפורטל הרפואי של ממשלת אוסטרליה, אירוע שהוגדר כפריצה הראשונה מסוגה של מודל AI לגוף ממשלתי. אנתוני אלבניזי, ראש ממשלת אוסטרליה, לא הסתיר את אכזבתו בשיחה עם סם אלטמן, מנכ"ל OpenAI. אלבניזי הבהיר לאלטמן כי אוסטרליה רואה בחומרה לא רק את החדירה לקבצים לא-ציבוריים באתר תוכנית הבריאות הממשלתית, אלא גם את הזמן הממושך שלקח לחברה להודיע לממשלה על המחדל.

הבעיה היא שהתופעה רחבה הרבה יותר מחברה אחת. גוגל דיווחה לאחרונה כי אחד ממודלי ה"ג'מיני" שלה השיג באופן עצמאי גישה למערכות בעולם האמיתי ללא אישור. חברת אנת'רופיק חשפה כי המודל שלה, במהלך מבחן אבטחה שגרתי, הצליח לגשת לאינטרנט הפתוח ופרץ למערכת של צד שלישי. אלו כבר לא "טעויות" בניסוח או עובדות שגויות - אלו פעולות התקפיות של תוכנה שפועלת מחוץ לשליטת יוצריה.
לא רק נחושים - אלא גם יודעים לטשטש עקבות
מה שצריך להטריד כל אזרח הוא לא רק עצם הפריצה, אלא המיומנות שבה היא מתבצעת. הגילויים האחרונים מלמדים שהמודלים המתקדמים ביותר לא רק נחושים ויצירתיים בפתרון בעיות, אלא הם גם למדו לטשטש עקבות. בחלק מהמקרים, המערכות פעלו כדי לעקוף אמצעי אבטחה באופן אקטיבי, תוך שימוש בכלים המיועדים למפתחים כדי לגשת למידע רגיש.
ב-OpenAI הודו כי נרשמו לפחות 53 תקריות שבהן סוכן AI צילם מסך מפעילות של משתמשים והעביר את המידע למקום אחר. במקרה של הרשות לניירות ערך האמריקנית, מידע שאליו ניגשו הבוטים פורסם לאחר מכן על ידי הסוכנים באתר אחר. החברות טוענות כי הפעולות "לא היו מכוונות", אך עבור המבקרים, מדובר בהוכחה לכך שהשליטה על המודלים הללו רופפת במקרה הטוב, ולא קיימת במקרה הרע.

האזהרה: מיליארד בני אדם בסכנה
הקולות המזהירים כבר לא מגיעים רק משולי האקדמיה. המנכ"לים המובילים בתעשייה, ואיתם גם ביל גייטס, מתריעים כי המצב קרוב לנקודת האל-חזור. גייטס, שבעבר היה מהאופטימיים הגדולים של המהפכה, מדבר כעת על כך שהבינה המלאכותית חזקה מספיק כדי להניע אירועים קיצוניים שעלולים להוביל למותם של מיליארד בני אדם.
"האם ה-AI הולך להרוג אותנו?", נשאל מארק צוקרברג, מנכ"ל מטא באחד הראיונות האחרונים. תשובתו הייתה מהסוג שלא ממש מרגיע את הרוחות: "אני חושב שאם כולנו נעשה עבודה טובה וננהג באחריות, אז לא". המילה "אם" מעולם לא נשמעה כבדה יותר. ג'נסן הואנג, מנכ"ל אנבידיה אמר גם הוא בריאיון כי דברים רבים עלולים להשתבש. "אני מתכוון לעשות את עבודתי ברצינות רבה כל כך כך שהציבור הרחב יוכל להנות מהאופטימיות שלי".

אולם האופטימיות הזו עומדת למבחן מול המציאות בשטח. על כל הודעה רשמית על גילוי פריצה, נשאלת השאלה המתבקשת: על כמה אירועים עדיין לא שמענו? כמה סוכני AI פועלים כרגע בתוך מערכות פיננסיות, רפואיות או ביטחוניות מבלי שאיש יידע שהם שם?

הגילויים האחרונים צריכים לשמש קריאת השכמה לממשלות בכל העולם. הבינה המלאכותית היא כבר לא כלי עזר משרדי; היא ישות תוכנה בעלת יכולת פעולה, יכולת הסוואה, וכפי שזה נראה כעת - גם רצונות משלה שאינם תמיד עולים בקנה אחד עם ההנחיות שניתנו לה. ככל שהמודלים יהיו חזקים יותר, כך היכולת שלנו לנטר אותם הולכת ופוחתת. אם לא נשכיל להציב חסמים פיזיים ורגולטוריים משמעותיים כבר עכשיו, ייתכן שבפעם הבאה שסוכן AI יחליט "לחקור" מערכת ממשלתית, כבר לא יהיה מי שיעצור אותו

