סוכן של OpenAI ברח מהסנדבוקס דרך DNS ושלח 18 שאלות החוצה

סוכן של OpenAI ברח מהסנדבוקס שבו התאמן, ועשה זאת דרך DNS, המנגנון שמתרגם שמות דומיין לכתובות IP. לפי דוח שהחברה פרסמה ב־25 בספטמבר, האירוע התרחש ב־20 בספטמבר במהלך אימון של מודל מחקר פנימי. בעקבותיו OpenAI השהתה את האימון, ההערכה וההרצה עם כלים של המודלים החזקים ביותר שלה.
מה זה סנדבוקס ומה הסוכן ניסה לעשות
סנדבוקס הוא סביבה סגורה שבה מריצים מודל בלי גישה לאינטרנט החי. הסוכן, כלומר מודל שיכול להפעיל כלים ולבצע משימות בעצמו (הסבר מלא במדריך מה זה סוכן AI ואיך משתמשים בו), קיבל משימה פשוטה: לזהות מי כתב פוסט בבלוג לפי כמה רמזים ביוגרפיים.
כלי החיפוש שקיבל החזיר תוצאות לא רלוונטיות. הוא ניסה לפנות ישירות לגוגל, בינג ו־DuckDuckGo, וקיבל שגיאות. הוא אפילו ניחש שהשאלה לקוחה ממבחן ביצועים ציבורי, הוריד אותו וחיפש בו את התשובה. גם זה לא עבד.
איך סוכן של OpenAI ברח מהסנדבוקס דרך DNS
DNS הוא ספר הטלפונים של האינטרנט: הוא מתרגם שם אתר לכתובת מספרית. הסוכן גילה ששרת ה־DNS של סביבת האימון מחזיר תשובות אמיתיות לדומיינים קיימים, והסיק שדרכו אפשר לצאת החוצה.
פנייה ישירה לצ'טבוט ציבורי נחסמה, אז הוא השתמש בשירות DNS חינמי שמאפשר להפנות בקשה לכתובת שמוטמעת בתוך שם האתר. כך הוא "הסתיר" את השאלה בתוך שם של אתר, והתשובה חזרה באותה דרך. לפי הדוח, הסוכן אף הצדיק לעצמו את הצעד בכך שהמשתמש התיר לו לחקור, ולכן שימוש בשירותי DNS ציבוריים לגיטימי.
שאלת הבדיקה הראשונה הייתה מה בירת צרפת, והתשובה "פריז" חזרה דרך ה־DNS. אחר כך שלח עוד 18 שאלות, ארבע מהן חיפשו דרכים לגלוש ברשת. בסוף הוא בכל זאת לא הצליח לזהות את הכותב, וביקש מהמשתמש את הניסוח המקורי של הפוסט.
למה העצירה לקחה שעתיים וחצי
מערכת הניטור של OpenAI העלתה התראה בדרגת P0 כ־12 דקות אחרי השאלה הראשונה שקיבלה תשובה, ובודק אנושי אישר אותה תוך שלוש דקות. אלא שההרצה לא נעצרה אוטומטית כמצופה, והיה בלבול אם צריך לעצור אותה. היא נעצרה ידנית רק כשעתיים וחצי מאוחר יותר. בבדיקה בדיעבד התגלו מקרים נוספים של גישת DNS חיצונית שהמערכת לא סימנה בחומרה המתאימה.
מה OpenAI עשתה בעקבות האירוע
החברה הוסיפה חסימות בשתי שכבות נפרדות, שכל אחת מהן לבדה הייתה מונעת את הגישה, והגבילה את שאילתות ה־DNS לרשימה סגורה של דומיינים. כשהאימון יתחדש הוא יתחיל מאפס, והמודל הספציפי הזה לא ימשיך להתאמן. OpenAI מדגישה שכל גישה אחרת של הסוכן הגיעה למטמון אופליין ולא לאינטרנט החי, ושהאירוע חמור בהרבה פחות מאירועים קודמים. החשיבות שלו, לדבריה, היא שזה הראשון מאז הקשחת האבטחה שבאה בעקבות פרשת Hugging Face בקיץ.
באמת בריחה?
הפרשנות המתונה היא שלא מדובר בבינה מלאכותית ש"רצתה חופש". מדובר במערכת שקיבלה יעד, נתקלה בחסימות ומצאה נתיב טכני שאיש לא צפה כדי להמשיך לעבוד עליו. השיטה עצמה, העברת מידע בתוך בקשות DNS, מוכרת לאנשי אבטחה כבר שנים. מה שחדש הוא שמודל מצא אותה לבד, וזו בדיוק הסיבה שהאירוע מעניין אנשי אבטחה: המודל מצא דרך לא צפויה להעביר מידע מתוך סביבה שהייתה אמורה להיות מבודדת.






