
GPT-5.6 מול Claude: המרוץ עבר למחיר, לא לאיכות
OpenAI טוענת שסגרה את הפער מול קלוד במחיר שליש - אבל תלוי איזה מבחן קידוד בוחרים, מקבלים תשובה הפוכה לגמרי. הנה מה שבאמת כדאי לבדוק לפני שמחליפים מודל.
- ב-9 ביולי 2026 השיקה OpenAI את משפחת GPT-5.6 – לונה, טרה וסול – כש-Sol, הדגל, מתומחר ב-5$/30$ למיליון טוקנים (קלט/פלט) לעומת 10$/50$ אצל Claude Fable 5.
- במדד הכללי של Artificial Analysis Sol מפגר בנקודה אחת בלבד אחרי Fable 5 (59 מול 60) – אבל תלוי באיזה מבחן קידוד בוחרים, התמונה מתהפכת לגמרי.
- סיימון וויליסון, שקיבל גישה מוקדמת ל-Sol, מסכם: "מוכשר בהחלט" – אבל לא הרגיש לו טוב יותר מ-Fable במשימות הקידוד המורכבות שהוא בודק.
תשיעי ביולי, שעות הבוקר. OpenAI משחררת בבת אחת שלושה מודלים חדשים – לונה, טרה וסול – וסול, הדגל שבהם, מגיע עם כרזה ברורה: כמעט אותה רמת ביצועים כמו Claude Fable 5, בשליש מהמחיר. זה נשמע כמו הכרעה. זה לא. כי ברגע שיורדים מהמדד הכללי לעבודה בפועל – קידוד, למשל – מקבלים שתי תשובות סותרות, תלוי איזה גוף מדד ואיזה בנצ'מרק הוא בחר להראות.
מה בדיוק OpenAI השיקה
סול הוא הדגל של משפחה בת שלושה מודלים: לונה הזול ביותר (1$ קלט / 6$ פלט למיליון טוקנים), טרה באמצע (2.50$/15$), וסול בראש (5$/30$). לשם השוואה, Claude Fable 5 עולה 10$ קלט ו-50$ פלט למיליון טוקנים – פי שניים עד פי חמישה יותר, תלוי באיזה דגם משווים אליו. שלושת המודלים החדשים קיבלו זמינות מיידית ברגע ההשקה – ChatGPT, Codex, ה-API וגם GitHub Copilot – עם חלון הקשר של מיליון טוקנים ו-128 אלף טוקני פלט מקסימליים.
התזמון לא מקרי. Fable 5 עצמו חזר לזמינות גלובלית רק ב-1 ביולי, אחרי שבועיים וחצי שבהם היה חסום לחלוטין: ב-12 ביוני ממשל ארה"ב הטיל עליו פיקוח יצוא בעקבות דו"ח של חוקרי אמזון שמצאו דרך לעקוף את אמצעי הבטיחות שלו ולגרום לו לייצר קוד שמדגים ניצול פרצת אבטחה. אנתרופיק אימנה מסווג בטיחות חדש שחוסם את השיטה הספציפית הזו ביותר מ-99% מהמקרים, קיבלה אור ירוק, וסול יצא לדרך רק שמונה ימים אחרי שקלוד חזר בכלל לפעול.
המספרים שסותרים אחד את השני
וכאן מתחיל הבלגן. תלוי באיזה מבחן מסתכלים, מקבלים סיפור אחר לגמרי. במדד הכללי של Artificial Analysis, ה-Intelligence Index, Sol מפגר בנקודה אחת בדיוק אחרי Fable 5 (59 מול 60) – כמעט תיקו, אבל בעלות של כ-1.04$ למשימה מול כ-3.12$ אצל קלוד, פחות משליש. באותו מדד עצמו, גם ב-Coding Agent Index של Artificial Analysis, דווקא Sol מוביל עם 80 נקודות, כש-Claude Code מקבל ציון נמוך יותר בעלות גבוהה ב-40% למשימה.
אבל במבחן קידוד אחר לגמרי – SWE-bench Pro, שבודק פתרון תקלות אמיתיות בקוד אמיתי – קלוד מנצח בגדול: 80% מול 64.6% ל-Sol. שני מדדי "קידוד" נותנים שתי אלופות שונות. זו בדיוק הבעיה: כל מעבדה בוחרת להבליט את המדד שבו היא מנצחת, וכשקוראים רק את ההודעה לעיתונות, קל לפספס שיש בכלל מדד שני שאומר ההפך.

כל מעבדה בוחרת להבליט את המדד שבו היא מנצחת – וזה אומר שהמדד הכי פחות שימושי כרגע הוא הממוצע הכללי.
מה זה אומר לכם בפועל
אם אתם ארגון שמריץ הרבה קוד, אוטומציות או סוכני AI מורכבים – אל תתפתו למחיר לבד. פער של 15 נקודות אחוז ב-SWE-bench Pro מתורגם לעוד ועוד סבבי תיקונים, ובסוף זה עולה יותר מהחיסכון במחיר לטוקן. בדיוק כמו שכבר כתבתי כשגרוק 4.5 יצא בזול משמעותית מקלוד לקידוד – מחיר נמוך שדורש עוד סבב תיקון הוא לא חיסכון, הוא הוצאה נדחית שפשוט מגיעה מאוחר יותר.
אבל אם אתם עושים משהו אחר – סיווג טקסטים, חילוץ מידע ממסמכים, טיוטות ראשונות של תוכן שיווקי, תמלול ועיבוד של שיחות – אז דווקא כאן לונה וטרה יכולים לחסוך המון. ברוב המשימות האלה הפער באיכות בין המודלים כמעט ולא מורגש בעין, ואילו הפער במחיר כן, לפעמים פי חמישה. סיימון וויליסון, שכתב על החוויה שלו עם Sol, תמצת את זה טוב: "מוכשר בהחלט" – אבל לא משהו שגרם לו לזנוח את קלוד למשימות הקידוד המורכבות שהוא רגיל אליהן.

לפני שאתם מחליטים אם לעבור למודל זול יותר כדי לחסוך, אל תסתמכו על שום בנצ'מרק שקראתם – גם לא את זה. קחו משימה אחת אמיתית שאתם עושים כל שבוע, תריצו אותה גם ב-ChatGPT (עם Sol) וגם בקלוד, ותשוו לא רק את התוצאה – גם כמה זמן לקח לכם לתקן אותה בסוף.
קח את המשימה החוזרת ביותר שאני מבצע איתך השבוע, ונסח אותה כפרומפט אחד עצמאי - עם כל ההקשר הדרוש - כך שאוכל להריץ אותו במדויק במודל אחר ולהשוות תוצאה מול תוצאה, כולל זמן העריכה שנדרש לי בסוף.
אם אתם ארגון שצריך להחליט אילו מודלים באמת שווים לכם – לא לפי כרזת שיווק אלא לפי המשימות שלכם בפועל – אפשר לדבר איתי על זה כאן.
1.5 מיליארד דולר על ספרים גנובים: הלקח לעסקים עם AI
אנתרופיק שילמה את ההסדר הכי גדול בהיסטוריה על זכויות יוצרים - לא על האימון, אלא על מאגר של שבעה מיליון ספרים גנובים.…
האיחוד האירופי: מ-2 באוגוסט חובה לתייג תוכן AI
בעוד פחות משבועיים נכנס לתוקף חוק שמחייב לתייג כל תוכן שנוצר או נערך בבינה מלאכותית - עם קנס שיכול להגיע ל-15 מיליון…
מהנדסת גוגל לשעבר, בת 25, מנהלת סטודיו AI בשווי מיליארד
צוות זעיר, פלטפורמה קניינית אחת, ושווי חברה שמתחרה באולפנים הכי גדולים בהוליווד. הסיפור של יוטופיי מראה בדיוק לאן הולך תחום הווידאו הגנרטיבי…