ב-20 בספטמבר, בשעה 09:50, סוכן AI פנימי של OpenAI הצליח להגיע לצ'אטבוט חיצוני דרך נתיב תקשורת שלא נחסם כראוי. ב-10:02 מערכת הניטור העלתה התראה חמורה. כעבור שלוש דקות עובד אישר שקיבל אותה.
האימון המשיך לרוץ.
רק ב-12:34 הוא נעצר. לפי התחקיר שפרסמה OpenAI, מנגנון העצירה האוטומטי לא פעל כמצופה. הסוכן לא קיבל משימה לפרוץ למערכת: הוא התבקש למצוא מידע על אדם ופוסט בבלוג, וכשהדרכים הרגילות לא סיפקו תשובה, השתמש בפרצה בסינון תקשורת ה-DNS כדי להגיע לשירות חיצוני. החברה הדגישה שהאירוע היה חמור פחות מאירועי בטיחות קודמים, אך חשף פער נוסף בין הגבלות שתוכננו לבין הגבלות שנאכפו.
זהו אחד האתגרים שאליהם מכוונת ההכרזה החדשה של אנבידיה. לא רק לזהות שהסוכן חרג. לעצור אותו.
ביום שני, 28 בספטמבר, הציגה החברה את NVIDIA Open Agent Safety Platform, המשלבת תוכנת קוד פתוח בשם OpenShell עם תכנון מערכת בשם Sentry, הנשען על חומרה נפרדת לניטור ולאכיפה. לפי אנבידיה, השכבה הנוספת מסוגלת לבודד ולעצור סוכנים שחורגים מגבולותיהם בתוך מילישניות. זו טענת ביצוע של החברה, לא השוואה מבוקרת מול האירוע של OpenAI.
לא לבקש מהסוכן להתנהג יפה - להגביל את מה שהוא יכול לעשות
ההבחנה המרכזית בגישה של אנבידיה היא בין הוראה לבין הרשאה.
הוראה אומרת לסוכן: אל תשלח את הקובץ הזה החוצה. הרשאה קובעת אם בכלל קיימת עבורו דרך לשלוח אותו.
במסמך שפרסמה ב-21 בספטמבר הציגה אנבידיה דוגמה: סוכן שמעדכן רשומת לקוח נתקל במסמך המכיל הוראות זדוניות ומנסה לייצא מידע ליעד לא מורשה. ההגנה, לפי החברה, צריכה לחסום את ההעברה ברמת הרשת ולתעד את הניסיון, גם אם המודל השתכנע שהפעולה נחוצה להשלמת המשימה.
סוכן יכול לקבל החלטה שגויה. סביבת העבודה שלו אינה אמורה להפוך כל החלטה כזאת לפעולה אפשרית.
כאן נכנסת OpenShell.
התוכנה מפעילה סוכנים בסביבות מבודדות ואוכפת כללים לגבי הקבצים שיוכלו לקרוא או לשנות, היעדים שאליהם יוכלו להתחבר והשירותים שבהם יורשו להשתמש. התיעוד מציג, בין היתר, הגבלת גישה למפתחות התחברות, חסימת יעדי רשת שלא אושרו וצמצום האפשרות להשיג הרשאות מערכת נוספות.
השליטה יכולה להיות מפורטת יותר מהשאלה אם מותר להתחבר לאתר מסוים. במדריך ההפעלה אנבידיה מדגימה כיצד מתירים קריאה דרך ממשק התוכנה של GitHub, אך חוסמים בקשת כתיבה דרך אותו ממשק. במנגנון נוסף, פרטי ההתחברות האמיתיים נשארים מחוץ לסביבת הסוכן ומצורפים רק לבקשות שאושרו.
עבור גוף פיננסי, ההיגיון ברור: הרשאה לקרוא נתונים לצורך הכנת דוח אינה צריכה להפוך להרשאה לשנות אותם. הרשאה לנתח תיק השקעות אינה הרשאה להעביר הוראת מסחר.
Sentry: השומר אינו יושב בתוך החדר שעליו הוא שומר
OpenShell היא שכבת ההגבלה בסביבת ההפעלה. Sentry מוסיפה נקודת פיקוח נפרדת.
לפי התכנון של אנבידיה, Sentry פועלת על מעבדי BlueField-4 מסוג DPU - מעבדי תשתית ונתונים, לא המאיצים הגרפיים שעליהם מתבצע עיקר חישוב המודל. ההפרדה נועדה להשאיר את מנגנוני הניטור והאכיפה מחוץ לתוכנה ולשרת המארח שעליהם הסוכן עשוי להשפיע. גם Arm מתארת את המבנה הזה כהפרדה בין המחשוב שמפעיל את הסוכן לבין המחשוב שמפקח עליו.
אחת מנקודות השליטה בתכנון היא החיבור בין הסוכן למודל שמספק לו את החלטותיו הבאות. אנבידיה מציעה לנטר את הנתיב הזה ולהשתמש בו גם כנקודת עצירה. במערכות Vera Rubin POD המתוארות במסמך הטכני שלה, BlueField-4 ממוקם בנתיב היחיד של צומת המחשוב אל המודל.
זהו ה-Kill Switch בגרסה תשתיתית: לא להסתמך רק על כך שהסוכן יציית להוראת עצירה, אלא להחזיק בנקודת בקרה שאינה נתונה לשליטתו.
אבל גם כאן יש גבול. ניתוק הגישה למודל אינו מחזיר מידע שכבר נשלח ואינו מבטל פעולה שכבר התבצעה במערכת אחרת. היכולת לעצור המשך פעילות חשובה; היא אינה תחליף למניעת הפעולה המסוכנת הראשונה.
האותיות הקטנות: אפשר לתעד הפרה בלי לחסום אותה
כדי להבין אם מדובר ב"חיסון", כדאי לקרוא גם את מדריך ההגדרות.
OpenShell חוסמת כברירת מחדל חיבורי רשת ליעדים שלא אושרו. אולם בתוך חיבורים מאושרים, מנגנון בדיקת הבקשות ברמת היישום מבחין בין שני מצבים: audit, שבו הפרות מתועדות והתעבורה ממשיכה, ו-enforce, שבו בקשות שאינן תואמות לכללים נחסמות.
בתיעוד הנוכחי, audit מוגדר כברירת המחדל של מנגנון הבדיקה הזה. אנבידיה ממליצה להתחיל בתיעוד, לבדוק שהכללים מתאימים לעבודה הנדרשת ורק לאחר מכן לעבור לאכיפה.
זו אינה הוכחה שהמוצר אינו בטוח. זו המחשה לכך שבטיחות תלויה גם בהטמעה.
ארגון יכול להתקין מערכת הגנה, לראות התראות ולהניח שהפעולות נעצרות - כאשר חלק מהכללים מופעלים לתיעוד בלבד. מנגד, חסימה אגרסיבית מדי עלולה לשבש עבודה תקינה. גם את הסיכון הזה אנבידיה מציינת במדריך שלה.
יש הסתייגות נוספת: OpenShell כוללת מנגנון לאימות פורמלי של מדיניות ההרשאות. אך התיעוד מבהיר שההבטחות שלו חלות רק על התכונות וההתנהגויות שמיוצגות במודל הבדיקה. אימות של כללי הרשאה אינו הוכחה מתמטית שכל מערכת ה-AI בטוחה.
גם אנתרופיק בפנים - המחלוקת אינה מונעת שיתוף פעולה
אנבידיה מדווחת על יותר מ-100 ארגונים העובדים עם טכנולוגיות הפלטפורמה. אחד השמות המשמעותיים הוא דווקא Anthropic.
לפי ההודעה, שירות Claude Managed Agents מפריד בין השרת שמפעיל את לולאת הסוכן לבין סביבות הביצוע שבהן מתבצעת העבודה. השילוב עם OpenShell ו-BlueField נועד להוסיף שליטה בגישת הסוכנים דרך אותן סביבות.
זהו שיתוף פעולה בהפעלת סוכנים. ההודעה אינה מאשרת שאנתרופיק אימצה את הפלטפורמה לאימון מודלי ה-Frontier שלה.
גם שותפים אחרים מפרסמים פרטים מעשיים. IBM הודיעה על שילוב OpenShell עם כלי זהות לסוכנים ועם HashiCorp Vault, שמנהל סודות ופרטי התחברות. SAP מתארת שילוב בין בידוד טכני לבין הרשאות עסקיות ב-Joule Studio: לא רק האם הסוכן מסוגל לבצע פעולה, אלא האם הפעולה מותרת במסגרת התהליך העסקי.
ההבחנה הזאת חשובה. מערכת יכולה לאכוף במדויק הרשאה שהוגדרה בצורה רחבה מדי. לכן ההגנה הטכנית חייבת להתחבר להחלטה עסקית: למי מותר לעשות מה, באיזה סכום, מול איזה מידע ובאישור של מי.
האם זו תשובה לאמודאי?
במאמרו We Must Pace the Frontier טען דריו אמודאי שיש להתאים את קצב התקדמות היכולות לקצב שבו ניתן להבין, לבדוק ולרסן אותן. הוא הציע מעריכים חיצוניים בעלי גישה מתמשכת למעבדות ותיאום בין חברות וממשלות. הוא גם הבהיר שאינו קורא להפסקה גורפת של האימון וההתקדמות הטכנולוגית.
אנבידיה ממקדת את תשובתה בהאצת עבודת האבטחה: גבולות שנאכפים מחוץ לסוכן, בדיקות חוזרות ובעלות ברורה על הטיפול בכשלים. במסמך ההנדסי שלה היא דורשת ראיות לכך שההגנות פועלות ובדיקות מחודשות לאחר שינויים משמעותיים במודלים, בכלים או בתהליכי העבודה.
אלה אינם פתרונות שסותרים בהכרח זה את זה.
אפשר להפעיל OpenShell ובמקביל להחליט שמודל מסוים עדיין אינו בטוח מספיק להשקה. אפשר להוסיף Sentry ועדיין לדרוש בדיקה חיצונית. עצם קיומה של שכבת הגנה חדשה אינו מכריע את השאלה כמה סיכון נותר מאחוריה.
למשקיעים: אנבידיה מציעה למכור גם את תשתית ההגנה
המשמעות הכלכלית אינה מסתכמת בעוד מוצר אבטחה.
הארכיטקטורה שאנבידיה מקדמת מחברת בין הפעלת סוכנים לבין ניטור, בידוד ואכיפה. אם המבנה הזה יאומץ בהיקף רחב, החברה עשויה ליהנות לא רק מהגידול בחישובי AI, אלא גם מהביקוש לתשתיות שמאפשרות להפעיל אותם תחת מגבלות. זו אפשרות עסקית הנגזרת מהתכנון, לא תחזית הכנסות שפורסמה.
עם זאת, OpenShell אינה מחייבת רכישת BlueField-4. אנבידיה מציינת במפורש שהתוכנה יכולה לפעול גם בתשתיות מקומיות, ארגוניות ובענן ללא הרכיב הזה; Sentry מוסיפה את שכבת ההפרדה החומרתית במערכות המתאימות. לכן אימוץ התוכנה אינו מתורגם אוטומטית למכירת חומרה חדשה.
גם הקוד הפתוח אינו אומר שהאבטחה כולה חינמית. OpenShell מופצת ברישיון Apache 2.0, אבל הגדרת הרשאות, חיבור למערכות הארגון, בדיקות, ניטור ותחקור דורשים עבודה ומשאבים.
כאן עשוי להיווצר מקור הכנסות לספקיות שירותים וסייבר. Palo Alto Networks, למשל, פרסמה לצד ההכרזה שילובים של אבטחת AI עם תשתיות אנבידיה, ובהם הגנת זמן ריצה על BlueField ותוכניות להרחבת ניהול הזהויות וההרשאות של סוכנים. חלק מהרכיבים מוצגים כמוצרים וחלק כתוכניות להמשך, ולא נכון להתייחס לכולם כהכנסות שכבר נוצרו.
המבחן למשקיע יהיה כפול: האם ההגנות מפחיתות אירועים ועצירות עבודה, והאם הן מאפשרות להכניס סוכנים לתהליכים שעד היום היו מסוכנים מדי לאוטומציה. רשימת שותפים ארוכה אינה מספיקה. צריך לראות שימוש מסחרי, עלות הפעלה ותוצאות.
אז יש חיסון?
עדיין לא הוכח.
אנבידיה הציגה תוכנה זמינה, תכנון תשתיתי ושיתופי פעולה ממשיים. היא גם מציגה גישה שניתן לבחון: לא להניח שהמודל תמיד יקבל את ההחלטה הנכונה, אלא לצמצם את הפעולות שיוכל לבצע כאשר יטעה.
אבל המסמכים הפומביים אינם מספקים הוכחה שהמערכת מונעת את כל סוגי החריגות, או שיעור הצלחה כולל שמאפשר להכריז שהבעיה נפתרה. התיעוד עצמו מראה שההגנה תלויה בגבולות שהוגדרו, במצב האכיפה ובתחום שאותו מסוגלות הבדיקות לכסות.
בשלב הזה, הדימוי המדויק יותר אינו חיסון שהופך את הסוכן לחסין, אלא מערך בידוד ופיקוח שנועד להגביל את הנזק כשהוא חורג.
ההכרזה אינה סוף המרוץ לתרופה. היא מציבה מועמד שאפשר להתחיל לבדוק.
והמבחן ברור: לא כמה מהר המערכת מודיעה שהסוכן חרג - אלא האם היא עוצרת אותו לפני שהחריגה הופכת לנזק.

האם אנבידיה מצאה את החיסון? / קרדיט: אילוסטרציה – AI


