דלגו לתוכן
אסטרה של OpenAI: הדגם הכי בטוח שהוא גם הכי מסוכן
כלים וטיפים

אסטרה של OpenAI: הדגם הכי בטוח שהוא גם הכי מסוכן

OpenAI קוראת לדגם החדש שלה "הכי מיושר שיצא לה אי פעם", ומצד שני מודה בגלוי שהוא עלול להיות מסוכן. שני המשפטים האלה מגיעים מאותו מסמך רשמי - וזה סיפור שכדאי להבין לפני שממהרים להתחבר.

TL;DR

  • OpenAI השיקה השבוע את GPT-6 אסטרה – הדגם הראשון שלה שחוצה את "הסף הקריטי" ביכולות סייבר, לפי מסגרת הבטיחות הפנימית שלה עצמה.
  • במבחן ExploitBench אסטרה קפצה מ-78.5% (בדגם הקודם, GPT-5.6 סול) ל-100%, ובמבחן חריגה מסמכות היא נשארה בגבולות המשימה שהוגדרה לה ב-100% מהמקרים – לעומת 52% בלבד אצל סול.
  • אנליסטים שבדקו את הכותרות הגדולות יותר על AGI מזהירים: חלק מהקפיצה נובע משינוי בשיטת הבדיקה עצמה, לא רק ביכולת של הדגם – כלל אצבע טוב לכל כותרת AI "פורצת דרך".

ביום חמישי שעבר OpenAI שחררה את GPT-6 אסטרה לקבוצה מצומצמת של ארגונים. זה הדגם הראשון שלה שעובר את מה שהיא עצמה מגדירה "סף קריטי" ביכולות סייבר, במסגרת בטיחות פנימית שהיא בנתה כדי לדעת מתי דגם נהיה מסוכן מדי לשחרר בלי הגבלות. אז היא שחררה אותו. עם הגבלות. וזה בדיוק הסיפור שמעניין אותי כאן – לא הכותרת "AGI הגיע", אלא מה שקורה כשחברת AI מודה בעצמה שהמוצר שלה יכול לפגוע.

מה זה בכלל "סף קריטי"?

OpenAI מפעילה מסגרת פנימית שנקראת Preparedness Framework, שמסווגת כל דגם חדש לפי רמת סיכון בתחומים כמו סייבר, ביולוגיה ושכנוע. "קריטי" היא הרמה הגבוהה ביותר, וכשדגם מגיע אליה זה מפעיל אוטומטית הגבלות פריסה נוספות. אסטרה היא הדגם הראשון של החברה שמגיע לשם בתחום הסייבר. במילים פשוטות: OpenAI בעצמה מסווגת את היכולת שלו למצוא ולנצל חורי אבטחה כמסוכנת מספיק כדי להצדיק שכבת פיקוח שלמה, ומגבילה גישה ליכולות המתקדמות ביותר שלו לתוכנית בדיקות סגורה בשם Daybreak.

המספרים שמאחורי הכותרת

ולמספרים יש כאן משקל אמיתי. במבחן ExploitBench, שבודק יכולת לנצל חולשות אבטחה קיימות, אסטרה קיבלה ציון של 100%, לעומת 78.5% בלבד בדגם הקודם, GPT-5.6 סול. במבחן המשלים, ExploitGym, הקפיצה הייתה מ-30.3% ל-42.4%. אבל המספר שבאמת מדבר אליי הוא אחר: מבחן חריגה מסמכות, שבודק אם הדגם פועל מעבר לגבולות המשימה שהוגדרה לו. סול חרג מהסמכות שלו ב-48% מהמקרים. אסטרה – באף מקרה. אפס.

מנעול פלדה עתיק שנחתך בקו לייזר אדום דק
יכולת פריצה שקופצת מדגם לדגם, לא בהדרגה

הבעיה עם הכותרות שקוראות ל-AGI

ברשתות החברתיות רצו השבוע מספרים אחרים לגמרי – ציון כמעט מושלם במבחן כללי בשם ARC-AGI-3, ומישהו כבר הספיק לכתוב שזאת "תחילת עידן ה-AGI". רק שאלה בדיוק המספרים שאין להם גיבוי מפורט מ-OpenAI עצמה, ואנליסטים שכן בדקו את המתודולוגיה מצאו שחלק מהקפיצה נובע משינוי בתנאי הבדיקה עצמם, לא רק ביכולת של הדגם. סנצ'יט ויר גוגיה, אנליסט ב-Greyhound Research, ניסח את זה כך:

"היכולת של אסטרה לא השתנתה… מה שהשתנה זו הבדיקה. לא הדגם."

גם ליאן ג'יי סו, אנליסטית ב-Omdia, מצננת: "לקרוא לזה AGI זה קצת מרחיק לכת בשלב הזה." אם כתבתי כאן בעבר על איך AI מסביר את עצמו ומשתיק את השיפוט שלנו, זה בדיוק אותו רפלקס: מספר גדול ומרשים לא פוטר אתכם מלשאול איך הוא נמדד.

מד אנלוגי עם מחוג אדום שתקוע באזור האדום
כשהמחוג תקוע על מקסימום, שווה לבדוק מה בדיוק מודדים

מה זה אומר לכם, בפועל

גם אם תתעלמו מכל הרעש סביב AGI, יש כאן עובדה אחת שכדאי לקחת אתכם: OpenAI עצמה כותבת, במפורש, ש"עם הכלים והגישה הנכונים, אסטרה יכולה להיות מסוכנת כי היא מסוגלת למצוא חולשות אבטחה לא ידועות ולפתח דרכים חדשות לנצל אותן". זו לא ביקורת מהצד. זו החברה שמוכרת את הדגם, כותבת את זה על עצמה.

לכם, כארגון או כעסק שמחבר סוכני AI לתיבת מייל, ל-CRM, ליומן או לאתר – זה לא סיפור על "OpenAI מסוכנת". זו תזכורת שברגע שדגם ברמת אסטרה קיים בשוק, השאלה החשובה כבר לא "האם ל-AI יש גישה למערכת שלי" אלא "מה בדיוק הוא מורשה לעשות שם, ומי בודק את זה". אמית קומאר ג'ינה, אנליסט ב-Kanerika, אמר את זה טוב: "אתם מאבדים גרנולריות בתוך המערכת המדויקת שרגולטור או מבקר יבקשו לראות." כלומר – אם משהו ישתבש, תצטרכו להראות בדיוק מה הרשיתם ל-AI לעשות, לא רק ש"היה לו גישה".

המספר שחשוב: 0% מול 48%. ככה הרבה פעמים הדגם הקודם של OpenAI חרג מהסמכות שהוגדרה לו במשימה – ואסטרה לא חרגה אף פעם. זה בדיוק הפער בין "עוזר AI" לבין "סוכן שיכול לגרום נזק בלי שתשימו לב".
נסו את זה היום

קחו חמש דקות ותעשו "ביקורת הרשאות" לכל כלי AI שמחובר אצלכם למייל, ליומן, ל-CRM או לאתר. פתחו שיחה עם קלוד או ChatGPT והדביקו את הפרומפט הבא, עם רשימת הכלים שיש לכם בפועל:

אני מפעיל את הכלים הבאים עם גישת AI: [רשימת הכלים, למשל: Gmail, Google Calendar, HubSpot CRM, WordPress].
עבור כל כלי, תן לי טבלה עם: אילו פעולות ה-AI יכול לבצע בו (קריאה בלבד? כתיבה? מחיקה? שליחה בשם שלי?), מה התרחיש הכי גרוע אם הוא יחרוג מהמשימה שהוגדרה לו, ואיזו הרשאה אחת הייתי צריך לצמצם כדי לסגור את הפער.

אם אתם ארגון שמתלבט איך להכניס סוכני AI פנימה בלי לפתוח דלת אחורית בטעות – זה בדיוק סוג הדבר שאנחנו עוזרים למפות ולבנות נכון. אפשר להתחיל כאן.

שיתוף
גיא אגא
גיא אגא

מלמד AI מעשי בארגונים מובילים, בכנסים ובאקדמיה. מייסד AI Academy — הזרוע המעשית של bestguy.ai ל-AI יצירתי, שיווק ותוכן.

עוד עליי →
→ חזרה לבלוג
עוד מהבלוג

מוכנים לחתוך את הרעש?

בין אם אתם ארגון, צוות או יוצר עצמאי — בואו נמצא בדיוק מה יזיז אתכם קדימה.