
אסטרה של OpenAI: הדגם הכי בטוח שהוא גם הכי מסוכן
OpenAI קוראת לדגם החדש שלה "הכי מיושר שיצא לה אי פעם", ומצד שני מודה בגלוי שהוא עלול להיות מסוכן. שני המשפטים האלה מגיעים מאותו מסמך רשמי - וזה סיפור שכדאי להבין לפני שממהרים להתחבר.
- OpenAI השיקה השבוע את GPT-6 אסטרה – הדגם הראשון שלה שחוצה את "הסף הקריטי" ביכולות סייבר, לפי מסגרת הבטיחות הפנימית שלה עצמה.
- במבחן ExploitBench אסטרה קפצה מ-78.5% (בדגם הקודם, GPT-5.6 סול) ל-100%, ובמבחן חריגה מסמכות היא נשארה בגבולות המשימה שהוגדרה לה ב-100% מהמקרים – לעומת 52% בלבד אצל סול.
- אנליסטים שבדקו את הכותרות הגדולות יותר על AGI מזהירים: חלק מהקפיצה נובע משינוי בשיטת הבדיקה עצמה, לא רק ביכולת של הדגם – כלל אצבע טוב לכל כותרת AI "פורצת דרך".
ביום חמישי שעבר OpenAI שחררה את GPT-6 אסטרה לקבוצה מצומצמת של ארגונים. זה הדגם הראשון שלה שעובר את מה שהיא עצמה מגדירה "סף קריטי" ביכולות סייבר, במסגרת בטיחות פנימית שהיא בנתה כדי לדעת מתי דגם נהיה מסוכן מדי לשחרר בלי הגבלות. אז היא שחררה אותו. עם הגבלות. וזה בדיוק הסיפור שמעניין אותי כאן – לא הכותרת "AGI הגיע", אלא מה שקורה כשחברת AI מודה בעצמה שהמוצר שלה יכול לפגוע.
מה זה בכלל "סף קריטי"?
OpenAI מפעילה מסגרת פנימית שנקראת Preparedness Framework, שמסווגת כל דגם חדש לפי רמת סיכון בתחומים כמו סייבר, ביולוגיה ושכנוע. "קריטי" היא הרמה הגבוהה ביותר, וכשדגם מגיע אליה זה מפעיל אוטומטית הגבלות פריסה נוספות. אסטרה היא הדגם הראשון של החברה שמגיע לשם בתחום הסייבר. במילים פשוטות: OpenAI בעצמה מסווגת את היכולת שלו למצוא ולנצל חורי אבטחה כמסוכנת מספיק כדי להצדיק שכבת פיקוח שלמה, ומגבילה גישה ליכולות המתקדמות ביותר שלו לתוכנית בדיקות סגורה בשם Daybreak.
המספרים שמאחורי הכותרת
ולמספרים יש כאן משקל אמיתי. במבחן ExploitBench, שבודק יכולת לנצל חולשות אבטחה קיימות, אסטרה קיבלה ציון של 100%, לעומת 78.5% בלבד בדגם הקודם, GPT-5.6 סול. במבחן המשלים, ExploitGym, הקפיצה הייתה מ-30.3% ל-42.4%. אבל המספר שבאמת מדבר אליי הוא אחר: מבחן חריגה מסמכות, שבודק אם הדגם פועל מעבר לגבולות המשימה שהוגדרה לו. סול חרג מהסמכות שלו ב-48% מהמקרים. אסטרה – באף מקרה. אפס.

הבעיה עם הכותרות שקוראות ל-AGI
ברשתות החברתיות רצו השבוע מספרים אחרים לגמרי – ציון כמעט מושלם במבחן כללי בשם ARC-AGI-3, ומישהו כבר הספיק לכתוב שזאת "תחילת עידן ה-AGI". רק שאלה בדיוק המספרים שאין להם גיבוי מפורט מ-OpenAI עצמה, ואנליסטים שכן בדקו את המתודולוגיה מצאו שחלק מהקפיצה נובע משינוי בתנאי הבדיקה עצמם, לא רק ביכולת של הדגם. סנצ'יט ויר גוגיה, אנליסט ב-Greyhound Research, ניסח את זה כך:
"היכולת של אסטרה לא השתנתה… מה שהשתנה זו הבדיקה. לא הדגם."
גם ליאן ג'יי סו, אנליסטית ב-Omdia, מצננת: "לקרוא לזה AGI זה קצת מרחיק לכת בשלב הזה." אם כתבתי כאן בעבר על איך AI מסביר את עצמו ומשתיק את השיפוט שלנו, זה בדיוק אותו רפלקס: מספר גדול ומרשים לא פוטר אתכם מלשאול איך הוא נמדד.

מה זה אומר לכם, בפועל
גם אם תתעלמו מכל הרעש סביב AGI, יש כאן עובדה אחת שכדאי לקחת אתכם: OpenAI עצמה כותבת, במפורש, ש"עם הכלים והגישה הנכונים, אסטרה יכולה להיות מסוכנת כי היא מסוגלת למצוא חולשות אבטחה לא ידועות ולפתח דרכים חדשות לנצל אותן". זו לא ביקורת מהצד. זו החברה שמוכרת את הדגם, כותבת את זה על עצמה.
לכם, כארגון או כעסק שמחבר סוכני AI לתיבת מייל, ל-CRM, ליומן או לאתר – זה לא סיפור על "OpenAI מסוכנת". זו תזכורת שברגע שדגם ברמת אסטרה קיים בשוק, השאלה החשובה כבר לא "האם ל-AI יש גישה למערכת שלי" אלא "מה בדיוק הוא מורשה לעשות שם, ומי בודק את זה". אמית קומאר ג'ינה, אנליסט ב-Kanerika, אמר את זה טוב: "אתם מאבדים גרנולריות בתוך המערכת המדויקת שרגולטור או מבקר יבקשו לראות." כלומר – אם משהו ישתבש, תצטרכו להראות בדיוק מה הרשיתם ל-AI לעשות, לא רק ש"היה לו גישה".
קחו חמש דקות ותעשו "ביקורת הרשאות" לכל כלי AI שמחובר אצלכם למייל, ליומן, ל-CRM או לאתר. פתחו שיחה עם קלוד או ChatGPT והדביקו את הפרומפט הבא, עם רשימת הכלים שיש לכם בפועל:
אני מפעיל את הכלים הבאים עם גישת AI: [רשימת הכלים, למשל: Gmail, Google Calendar, HubSpot CRM, WordPress]. עבור כל כלי, תן לי טבלה עם: אילו פעולות ה-AI יכול לבצע בו (קריאה בלבד? כתיבה? מחיקה? שליחה בשם שלי?), מה התרחיש הכי גרוע אם הוא יחרוג מהמשימה שהוגדרה לו, ואיזו הרשאה אחת הייתי צריך לצמצם כדי לסגור את הפער.
אם אתם ארגון שמתלבט איך להכניס סוכני AI פנימה בלי לפתוח דלת אחורית בטעות – זה בדיוק סוג הדבר שאנחנו עוזרים למפות ולבנות נכון. אפשר להתחיל כאן.
Claude Docs ו-Slides: קלוד נכנס למשרד שלכם
אנתרופיק לא הוסיפה עוד פיצ'ר - היא מיזגה את קלוד לסביבת עבודה אחת שכותבת מסמכים ובונה מצגות. הנה מה שעובד, מה חסר,…
זום פורצת ל-CRM: איום אמיתי על Salesforce?
זום, שהכרתם כתוכנת שיחות וידאו, הכריזה השבוע על מערכת שמנסה לבלוע את כל מחסנית המכירות שלכם - ממודיעין קונים ועד תחזיות הכנסות.…
קוגניציה שווה 48 מיליארד דולר: הלקח שמעבר לקוד
תוך ארבעה חודשים שווי החברה כמעט הכפיל את עצמו. זה לא רק סיפור מימון — זה תצוגה מקדימה של עולם עבודה שבו…