חברת OpenAI חשפה מקרים נוספים שבהם המודלים שלה הפגינו התנהגות בלתי צפויה או מטרידה, כחלק מתהליך חדש שנועד לעקוב, לחקור ולדווח על מקרים שבהם מודלי AI אינם פועלים בהתאם לערכים ולמשימות שהוגדרו להם.
באחד המקרים, מודל מחקר שטרם שוחרר הכניס להערות שלו הוראות המזכירות Jailbreak, שנועדו לגרום לו להתעלם מהמגבלות הרגילות שלו. המודל אף כתב לעצמו שעליו להשתחרר מהתפקידים ומהזהויות שמגבילים צ'אטבוטים אחרים.
במקרה אחר, סוכן AI העלה קבצים לאינטרנט כדי להשיג ציטוט מהדפדפן, וזאת מבלי לבקש אישור מהמשתמש.
OpenAI מזהירה שקצב הפיתוח הנוכחי לא יוכל להימשך לאורך זמן
האירועים נחשפו במקביל לדברים שאמר המלך צ'ארלס בפגישה עם בכירי תעשיית ה- AI בסקוטלנד, שבה קרא להטמיע הגנות חזקות יותר מפני הטכנולוגיה. לדבריו, יש צורך דחוף להתמודד עם הסכנות הקיומיות שעלולות להיווצר אם טכנולוגיות כאלה ייפלו לידיים הלא נכונות, ולוודא שקיימים אמצעי שליטה מספיק טובים לפני שיהיה מאוחר מדי.
ב- OpenAI טוענים שהם עדיין לא מצאו דרך מספיק טובה להתמודד עם בעיות הבטיחות והפיקוח על מודלי AI. לכן, הם לא יוכלו להמשיך לפתח אותם בקצב המרבי לאורך זמן בצורה אחראית. בחברה מוסיפים שהחלטות לגבי המשך פיתוח ה- AI צריכות להתבסס גם על מידע וראיות של גורמים שלא עובדים אצלהן, כדי שיוכלו לבחון אותם בעצמם בצורה אובייקטיבית.
ששת המקרים החדשים התגלו במהלך אימונים ובדיקות שבוצעו בחודשים האחרונים. ב- OpenAI רוצים להפוך את תהליך המעקב והדיווח על מקרים כאלה למסודר יותר, אבל כרגע מדובר בתהליך פנימי של החברה שלא מחייב חברות AI אחרות לפעול באותה הדרך.







