אז מה הסיפור עם כל ה-Sandbox escapes האלה, ואיך זה מתקשר ל״חלון הזמן של המגנים״ (״The Defender's Window״).
בשבוע שעבר יצא לנו לבקר באירוע שותפי סייבר של OpenAI. הכנס תואם לא במקרה ליום ההשקה של אסטרה, המודל האחרון שלהם, והחזק ביותר שזמין לציבור הרחב.
מכל הדברים שאפשר לעשות בהשקה, גרג ברוקמן, אחד הפאונדרים של OpenAI, בחר לבלות את רוב יומו בכנס הזה, כדי לדבר על יוזמות הבטיחות והסייבר שלהם. למה הוא בחר לעשות את זה?
הציבור הרחב קיבל לאחרונה הצצה מפחידה למה המודלים האלה יכולים לעשות בתקרית HuggingFace. אני מקווה שלכל מי שקורא.ת את זה כבר ברור שצי של עשרות אלפי סוכנים מצויידים במודלים החדשים ביותר ומסונכרנים בינהם יכולים כבר היום, אם מופעל בידי הישות הלא נכונה, להשבית תשתיות אזרחיות, לרוקן חשבונות בנק, ופוטציאלית דברים גרועים בהרבה יותר (להפיל מטוסים, להפעיל כלי נשק וכיו״ב).
ועכשיו נשאלת השאלה איפה זה פוגש אתכם היום. מודלי הפרונטיר החזקים ביותר הם עדיין מערביים בקוד סגור ובשליטת המעבדות. לא ברור כמה זמן זה ימשך, אבל כל עוד זה ככה, למגנים - צוות הסייבר של הבנק שלכם או של החברה שעוזרת לאבטח אותו - יש לכאורה זמן להתמגן (לסגור חולשות אבטחה שה-AI החכם יותר מוצא וכו׳). זה הבסיס לטענה של המעבדות לטובת סקיוריטי היום (ובאופן די נוח זה טיעון נגד מודלים פתוחים - המתחרים שלהם).
אבל האם זה נכון שיש לנו חלון זמן שכזה, והאם המעבדות בעצמן נותנות דגש לביטחון המשתמשים שלהן? בואו ניקח את הפריצות האחרונות שמצאנו לדוגמה.
בחולשה שמתוארת פה למטה (מצאנו דומות אצל כל המעבדות - נפרסם את מלוא הפרטים הטכניים בימים הקרובים על כל אחת), אנחנו מדגימים איך תוקף יכול להריץ לכם קוד על המחשב (למשל, קוד שסורק את כל המחשב ומחפש סיסמאות, מתקין אמצעי ריגול, שולח מידע פרטי שלכם לשרת מרוחק, ועוד) באמצעות ניצול בעית אבטחה בקלוד קוד - כנראה סוכן הקידוד הנפוץ בעולם.
בואו ניקח את המקרה הזה ונחשוב איך הוא פוגש את ה-Defender's windows: מצד אחד, גילינו את החולשה (ללא שימוש במודלים שלהם), דיווחנו עליה לאנתרופיק, ואלה אישרו ותיקנו אותה. בגדול מגניב, החלון מתקיים.
מצד שני:
1. לאנתרופיק לקח 50 יום בערך להשיק את התיקון לבעיה הזו. היו להם 33 גירסאות להוציא קודם, רובם אודות פיצ׳רים של חווית משתמש. יש דברים שאנחנו לא יודעים (מי יודע, אולי היו המון פרצות אבטחה חמורות יותר שהם עבדו לתקן?). אבל לפחות מבחוץ, ככה לא נראת אופרציה שמתעדפת את ביטחון המשתמשים מעל הכל.
להשוואה, קרסר ו-OpenAI סגרו פרצות בסדר גודל דומה עליהן דיווחנו בתוך פחות משבוע.
2. צריך להבין שאם אנחנו ידענו על החולשה, גורמי ביון - שחלקם במדינות עוינות את המערב - בסיכוי גבוה ידעו עליה גם. 50 יום זו תקופה שערורייתית למדי. מדובר בתיקון שגם מודל מלפני שנתיים היה סוגר ב3 דקות.
3. מן הסתם, כחלק מהריליס פייפליין של קלוד קוד והסוכנים האחרים שנפרצו - קיימת סריקה לבעיות אבטחה במעבדות, והיא משתמשת במודלים החזקים ביותר - כולל אלה שלא זמינים לנו או לאף אחד אחר פרט למעבדות. כלומר יש לנו פה רצף הוכחות גדול מאוד שמדגים שהמודלים האלה בתצורה הנוכחית שלהם ** לא טובים מספיק כדי למצוא את החולשות האלה היום **.
4. החולשה שגילינו בקלוד קוד, היתה קיימת בגירסה מעט שונה גם בקרסר (שאגב תיקנו אותה בשבוע - כבוד). בעבר, על מנת לאתר ולנצל חולשה באפליקציה אחת כשאתה יודע שהיא קיימת באפליקציה אחרת - היית צריך כישורים די רציניים. 99% מהמפתחים לא היו מסוגלים לעשות את זה. היום, הבת 10 שלי יכולה לעשות את זה, ואני אפילו לא צוחק - לוקחים את החולשה הידועה ומבקשים ממודל פתוח כמו GLM לאתר ולנצל אותה באפליקציה אחרת.
ניצול חולשות עבר תיעוש.
5. וזה אולי החלק הכי גרוע בסיפור: יש דרך בסיסית לבודד את הסוכנים מהמחשב שלכם כדי שדברים כאלה לא יקרו - לשים אותם בתוך מכונה וירטואלית שנועדה לבידוד סוכנים. שום דבר לא מושלם, אבל זה וואחד שיפור. זה יכול להיות בענן, זה יכול להיות על המחשב עם פיתרון כמו שלנו או של אחרים. אז למה קלוד קוד ושות׳ רצים לכם על המחשב בלי זה?
הסיבה פשוטה לדעתנו: המעבדות מתעדפות קלות שימוש על פני אבטחה. אם קלוד קוד יכריח אתכם מחר לרוץ בתוך מכונה וירטואלית כזאת, גם אם היא הכי נוחה בעולם (*שיעול*), וואלה - זה פחות כיף לעבוד תחת מגבלות אבטחה. והקרב הכי מדמם בשנים האחרונות הוא על קידוד, לכן אף מעבדה לא תסתכן בפגיעה בחוויית המשתמש ותקריב יוזרים רבים כדי להפוך את החוויה לבטוחה יותר בעבור כל השאר.
אז האם חלון הזמן למגנים עובד? תשפטו בעצמכם בשבועות הקרובים...
🚨 SANDBOX ESCAPE ALERT 🚨
ANTHROPIC: PWNED 🫡
CLAUDE CODE: LIBERATED 🦋
@Accomplish_ai researchers uncovered an massive RCE/ACE vulnerability that we are publishing today, where an untrusted git repo opened in Claude Code can escape the macOS sandbox and execute commands on your computer as your privileged user, also bypassing the permission prompt >>