דלגו לתוכן
GPT-5.6 מול Claude: המרוץ עבר למחיר, לא לאיכות
חדשות AI

GPT-5.6 מול Claude: המרוץ עבר למחיר, לא לאיכות

OpenAI טוענת שסגרה את הפער מול קלוד במחיר שליש - אבל תלוי איזה מבחן קידוד בוחרים, מקבלים תשובה הפוכה לגמרי. הנה מה שבאמת כדאי לבדוק לפני שמחליפים מודל.

TL;DR

  • ב-9 ביולי 2026 השיקה OpenAI את משפחת GPT-5.6 – לונה, טרה וסול – כש-Sol, הדגל, מתומחר ב-5$/30$ למיליון טוקנים (קלט/פלט) לעומת 10$/50$ אצל Claude Fable 5.
  • במדד הכללי של Artificial Analysis Sol מפגר בנקודה אחת בלבד אחרי Fable 5 (59 מול 60) – אבל תלוי באיזה מבחן קידוד בוחרים, התמונה מתהפכת לגמרי.
  • סיימון וויליסון, שקיבל גישה מוקדמת ל-Sol, מסכם: "מוכשר בהחלט" – אבל לא הרגיש לו טוב יותר מ-Fable במשימות הקידוד המורכבות שהוא בודק.

תשיעי ביולי, שעות הבוקר. OpenAI משחררת בבת אחת שלושה מודלים חדשים – לונה, טרה וסול – וסול, הדגל שבהם, מגיע עם כרזה ברורה: כמעט אותה רמת ביצועים כמו Claude Fable 5, בשליש מהמחיר. זה נשמע כמו הכרעה. זה לא. כי ברגע שיורדים מהמדד הכללי לעבודה בפועל – קידוד, למשל – מקבלים שתי תשובות סותרות, תלוי איזה גוף מדד ואיזה בנצ'מרק הוא בחר להראות.

מה בדיוק OpenAI השיקה

סול הוא הדגל של משפחה בת שלושה מודלים: לונה הזול ביותר (1$ קלט / 6$ פלט למיליון טוקנים), טרה באמצע (2.50$/15$), וסול בראש (5$/30$). לשם השוואה, Claude Fable 5 עולה 10$ קלט ו-50$ פלט למיליון טוקנים – פי שניים עד פי חמישה יותר, תלוי באיזה דגם משווים אליו. שלושת המודלים החדשים קיבלו זמינות מיידית ברגע ההשקה – ChatGPT, Codex, ה-API וגם GitHub Copilot – עם חלון הקשר של מיליון טוקנים ו-128 אלף טוקני פלט מקסימליים.

התזמון לא מקרי. Fable 5 עצמו חזר לזמינות גלובלית רק ב-1 ביולי, אחרי שבועיים וחצי שבהם היה חסום לחלוטין: ב-12 ביוני ממשל ארה"ב הטיל עליו פיקוח יצוא בעקבות דו"ח של חוקרי אמזון שמצאו דרך לעקוף את אמצעי הבטיחות שלו ולגרום לו לייצר קוד שמדגים ניצול פרצת אבטחה. אנתרופיק אימנה מסווג בטיחות חדש שחוסם את השיטה הספציפית הזו ביותר מ-99% מהמקרים, קיבלה אור ירוק, וסול יצא לדרך רק שמונה ימים אחרי שקלוד חזר בכלל לפעול.

המספרים שסותרים אחד את השני

וכאן מתחיל הבלגן. תלוי באיזה מבחן מסתכלים, מקבלים סיפור אחר לגמרי. במדד הכללי של Artificial Analysis, ה-Intelligence Index, Sol מפגר בנקודה אחת בדיוק אחרי Fable 5 (59 מול 60) – כמעט תיקו, אבל בעלות של כ-1.04$ למשימה מול כ-3.12$ אצל קלוד, פחות משליש. באותו מדד עצמו, גם ב-Coding Agent Index של Artificial Analysis, דווקא Sol מוביל עם 80 נקודות, כש-Claude Code מקבל ציון נמוך יותר בעלות גבוהה ב-40% למשימה.

אבל במבחן קידוד אחר לגמרי – SWE-bench Pro, שבודק פתרון תקלות אמיתיות בקוד אמיתי – קלוד מנצח בגדול: 80% מול 64.6% ל-Sol. שני מדדי "קידוד" נותנים שתי אלופות שונות. זו בדיוק הבעיה: כל מעבדה בוחרת להבליט את המדד שבו היא מנצחת, וכשקוראים רק את ההודעה לעיתונות, קל לפספס שיש בכלל מדד שני שאומר ההפך.

שני מגדלי מטבעות אדומים זוהרים בגבהים שונים על רקע כמעט שחור
פער המחיר בין המודלים אמיתי – אבל הוא לא מספר את כל הסיפור

כל מעבדה בוחרת להבליט את המדד שבו היא מנצחת – וזה אומר שהמדד הכי פחות שימושי כרגע הוא הממוצע הכללי.

מה זה אומר לכם בפועל

אם אתם ארגון שמריץ הרבה קוד, אוטומציות או סוכני AI מורכבים – אל תתפתו למחיר לבד. פער של 15 נקודות אחוז ב-SWE-bench Pro מתורגם לעוד ועוד סבבי תיקונים, ובסוף זה עולה יותר מהחיסכון במחיר לטוקן. בדיוק כמו שכבר כתבתי כשגרוק 4.5 יצא בזול משמעותית מקלוד לקידוד – מחיר נמוך שדורש עוד סבב תיקון הוא לא חיסכון, הוא הוצאה נדחית שפשוט מגיעה מאוחר יותר.

אבל אם אתם עושים משהו אחר – סיווג טקסטים, חילוץ מידע ממסמכים, טיוטות ראשונות של תוכן שיווקי, תמלול ועיבוד של שיחות – אז דווקא כאן לונה וטרה יכולים לחסוך המון. ברוב המשימות האלה הפער באיכות בין המודלים כמעט ולא מורגש בעין, ואילו הפער במחיר כן, לפעמים פי חמישה. סיימון וויליסון, שכתב על החוויה שלו עם Sol, תמצת את זה טוב: "מוכשר בהחלט" – אבל לא משהו שגרם לו לזנוח את קלוד למשימות הקידוד המורכבות שהוא רגיל אליהן.

לוח מחוונים מינימליסטי עם מספר מחוגים כל אחד מצביע לכיוון אחר, זוהר אדום על רקע חשוך
שני מבחני קידוד, שתי אלופות שונות
המספר שחשוב: 80% מול 64.6% – הפער בין קלוד ל-Sol במבחן SWE-bench Pro, למרות ש-Sol עולה כשליש מהמחיר. ובמדד קידוד אחר של אותו גוף מחקר, Sol דווקא מוביל.
נסו את זה היום

לפני שאתם מחליטים אם לעבור למודל זול יותר כדי לחסוך, אל תסתמכו על שום בנצ'מרק שקראתם – גם לא את זה. קחו משימה אחת אמיתית שאתם עושים כל שבוע, תריצו אותה גם ב-ChatGPT (עם Sol) וגם בקלוד, ותשוו לא רק את התוצאה – גם כמה זמן לקח לכם לתקן אותה בסוף.

קח את המשימה החוזרת ביותר שאני מבצע איתך השבוע, ונסח אותה כפרומפט אחד עצמאי - עם כל ההקשר הדרוש - כך שאוכל להריץ אותו במדויק במודל אחר ולהשוות תוצאה מול תוצאה, כולל זמן העריכה שנדרש לי בסוף.

אם אתם ארגון שצריך להחליט אילו מודלים באמת שווים לכם – לא לפי כרזת שיווק אלא לפי המשימות שלכם בפועל – אפשר לדבר איתי על זה כאן.

שיתוף
גיא אגא
גיא אגא

מלמד AI מעשי בארגונים מובילים, בכנסים ובאקדמיה. מייסד AI Academy — הזרוע המעשית של bestguy.ai ל-AI יצירתי, שיווק ותוכן.

עוד עליי →
→ חזרה לבלוג
עוד מהבלוג

מוכנים לחתוך את הרעש?

בין אם אתם ארגון, צוות או יוצר עצמאי — בואו נמצא בדיוק מה יזיז אתכם קדימה.