כש-OpenAI שחררו את
OpenAI's GPT-5.5 family (Thinking, Pro, and the GPT-5.5 Instant default) at $5/$30 per 1M tokens, with leads on agentic and shell-driven work
הכי מתאים ל: General knowledge workers needing a capable all-in-one assistant, Developers wanting quick code generation with GPT Image and Codex integration
אמ;לק: GPT-5.5 הוא מודל הדגל של OpenAI, יצא ב-23 באפריל 2026, במחיר 5$ קלט / 30$ פלט למיליון טוקנים (כפול מ-GPT-5.4). ביום ההשקה הוא הוביל את מדד Artificial Analysis Intelligence Index עם ציון 60, והוא מוביל בעבודת סוכנים ובאוטומציה שמבוססת טרמינל כמו Terminal-Bench 2.0 (82.7%). אבל Claude Opus 4.7 עדיין מנצח אותו ב-6 מתוך 10 בנצ'מארקים משותפים, ממציא תשובות הרבה פחות (36% מול 86% ב-AA-Omniscience), ועולה 5$ פחות לכל מיליון טוקני פלט. נכון ליוני 2026, הכתר כבר עבר ל-Opus 4.8 (Claude Fable 5 הוביל לרגע קצר בתחילת יוני, אבל Anthropic השביתו אותו ב-12 ביוני בעקבות הנחיית בקרת ייצוא של ממשלת ארה"ב). אם אתם עושים עבודת סוכנים ארוכה, GPT-5.5 מצדיק את המחיר. אם אתם צריכים היסק עמוק או דיוק עובדתי, הוא לא.
הנה העניין עם הצהרות מסוג "המודל הכי חכם עד היום": תוקף המדף שלהן נמדד בשבועות. אז זה לא מאמר היפ של השקה. אני הולך לעבור איתכם על מה GPT-5.5 באמת עולה, איפה הוא מנצח בכנות, איפה בודקים עצמאיים תפסו אותו נופל, והאם הקפיצה במחיר הגיונית לסוג העבודה שאתם עושים.
אם בא לכם קודם את מפת המשפחה כולה, המדריך למשפחת GPT-5.4 מכסה את המודל ש-OpenAI בדיוק הכפילו עליו את המחיר.
מה זה GPT-5.5 בעצם
GPT-5.5 הוא משפחת מודל החזית של OpenAI, שהוכרזה ב-23 באפריל 2026. הוא מגיע בשלושה טעמים שאתם באמת תפגשו: GPT-5.5 Thinking (סוס העבודה של ההיסק, ב-ChatGPT וב-API), GPT-5.5 Pro (וריאנט מאמץ יותר ל-Pro ול-Enterprise), ו-GPT-5.5 Instant (ברירת המחדל המהירה שהחליפה בשקט את GPT-5.3 Instant ב-ChatGPT ב-5 במאי 2026).
Thinking ו-Pro עלו לאוויר ב-ChatGPT וב-Codex כבר ביום ההשקה. ה-API בא יום אחרי, ב-24 באפריל, כש-OpenAI מסבירים שעיכבו אותו 24 שעות בגלל "אמצעי הגנה שונים". GitHub Copilot קיבל גישה באותו יום של ה-API. שם הקוד הפנימי, אם אתם אוספים טריוויה, היה "Spud".
טענה אחת חוזרת כמעט בכל סקירה עצמאית: GPT-5.5 הוא מודל הבסיס הראשון שאומן מחדש מאפס מאז GPT-4.5, כשכל סדרת 5.1 עד 5.4 היא ליטוש על אותם משקלים. שני סוקרים (NewforTech ו-Awesome Agents) קובעים את זה בלי היסוס.
אבל אני רוצה לסמן את זה בזהירות. ההכרזה של OpenAI עצמם אף פעם לא משתמשת במילה "אימון מחדש", ופער של שישה שבועות מ-GPT-5.4 יהיה מהיר בצורה חריגה לאימון מלא מאפס. אז תתייחסו לזה כקריאה הרווחת של ההשקה, לא כעובדה הנדסית מאומתת.
טיפ: אם אתם משתמשים ב-ChatGPT רק בצורה מזדמנת, אתם כנראה כבר על GPT-5.5 Instant בלי לדעת. הוא הפך לברירת מחדל לכל המשתמשים ב-5 במאי 2026. משתמשים בתשלום יכולים להמשיך לבחור GPT-5.3 Instant מבורר המודלים עוד 3 חודשים לפני ש-OpenAI מוציאים אותו לגמלאות, אז תבדקו את הבורר עכשיו אם הפרומפטים שלכם פתאום מרגישים אחרת.
תמחור GPT-5.5: המציאות של 5$/30$
בואו נדבר על כסף, כי כאן GPT-5.5 הופך לשנוי במחלוקת. GPT-5.5 הרגיל רשום ב-5$ קלט / 30$ פלט למיליון טוקנים. זו הכפלה נקייה של 2.50$/15$ של GPT-5.4.
GPT-5.5 Pro יושב בליגה אחרת לגמרי: 30$ קלט / 180$ פלט. מצבי Batch ו-Flex רצים בחצי מחיר; Priority רץ פי 2.5. תווית מחיר כפולה נשמעת אכזרית. אבל יש פה פרט אחד שמרכך את זה, ונקודה-נגד אחת שמחזירה את הכאב בדיוק לאיפה שהיה.
למה הקפיצה במחיר היא לא ממש פי 2 בפועל
תכל'ס, התווית של פי 2 מטעה. בואו נפשט: יש כאן שתי נקודות שמרככות את התמונה, ואחת שמחזירה אותה לאחור.
Artificial Analysis גילו ש-GPT-5.5 (ב-xhigh) משתמש בערך ב-40% פחות טוקני פלט כדי להריץ את מדד האינטליגנציה שלהם לעומת מה ש-GPT-5.4 צרך. ומכיוון שטוקני הפלט הם החצי היקר, יעילות הטוקנים הזו בולעת את רוב העלייה במחיר.
השורה: הרצת מדד AA על GPT-5.5 עולה בערך 20% יותר מ-GPT-5.4, לא 100% יותר. OpenAI נשענים על הנרטיב הזה של "פחות טוקנים" גם הם, במיוחד למשימות Codex. תכל'ס, זה הגיון אמיתי: אתם משלמים יותר לטוקן, אבל שורפים פחות טוקנים, אז החשבונית הסופית עולה הרבה פחות מכפליים.
סיפור היעילות לא תמיד מחזיק. Tessl הריצו 1,742 בדיקות עם מיומנויות הנדסיות טעונות בתוך הפרומפט, ומדדו את GPT-5.5 ב-0.49$ להרצה מול GPT-5.4 ב-0.30$, פרמיה של 63%. והציון? 89.4 מול 89.3. בתוך טעות עיגול. ברגע שפרומפטים של מיומנויות נכנסים לתמונה, אתם יכולים לשלם 63% יותר על אותה תשובה בדיוק.
איך תמחור GPT-5.5 משתווה למתחרים
כאן התמחור נהיה לא נעים ל-OpenAI. Claude Opus 4.7 משתווה ל-GPT-5.5 בקלט (5$) אבל גובה 5$ פחות בפלט (25$ מול 30$), והוא משחרר גם חלון הקשר של מיליון טוקנים. כלומר GPT-5.5 הוא המודל היקר יותר בפלט, בזמן שהוא נגרר אחרי Opus ברוב בנצ'מארקי ההיסק. Gemini 3.1 Pro חותך מתחת לשניהם: 2$ קלט / 12$ פלט.
Claude Opus 4.7 prices output $5 cheaper at $5/$25, hallucinates far less, and leads GPT-5.5 on 6 of 10 shared reasoning and code-review benchmarks
הכי מתאים ל: Knowledge workers doing deep document analysis and long-form writing, Developers who need precise instruction-following for complex multi-step tasks
| מודל | קלט / 1M | פלט / 1M | הקשר | יצא |
|---|---|---|---|---|
| GPT-5.5 | 5.00$ | 30.00$ | ~1M | 23 באפריל 2026 |
| GPT-5.5 Pro | 30.00$ | 180.00$ | ~1M | 23 באפריל 2026 |
| Claude Opus 4.7 | 5.00$ | 25.00$ | 1M | (קודם) |
| Gemini 3.1 Pro | 2.00$ | 12.00$ | 1M+ | (קודם) |
יש דרך חכמה יותר לקרוא את זה מאשר תעריפי הכותרת. Artificial Analysis הראו ש-GPT-5.5 בהגדרת מאמץ "medium" מגיע לאותו ציון במדד AA כמו Opus 4.7 במאמץ "max", ובערך רבע מהעלות (בערך 1,200$ מול 4,800$ להרצת המדד המלא). שימושי.
אבל Gemini 3.1 Pro מגיע לאותו שוויון בערך 900$. אז אפילו הקריאה שהכי מחמיאה ל-GPT-5.5 לא הופכת אותו למוביל בעלות. Gemini עדיין שם.
Gemini 3.1 Pro undercuts both on price at $2/$12 and reaches frontier-parity on the AA Index for the lowest cost of the three
הכי מתאים ל: Google Workspace users wanting native AI inside Docs, Gmail, and Sheets, Researchers needing citation-backed outputs via NotebookLM
טיפ: תורידו את מאמץ ההיסק ל-"medium" לפני שאתם רצים למודל זול יותר. GPT-5.5 ב-medium השתווה ל-Opus 4.7 ב-max על מדד AA, בערך ברבע מהעלות, בבדיקות עצמאיות. אתם קונים פלט ברמת חזית בלי לשלם מחירי מאמץ של דגל, ואתם שומרים על הכלים של OpenAI שכבר חיברתם.
ביצועים: איפה GPT-5.5 באמת מנצח
ביום ההשקה, Artificial Analysis שמו את GPT-5.5 (ב-xhigh) בראש מדד האינטליגנציה שלהם עם ציון 60, ושברו שוויון משולש מול Anthropic ו-Google. החציון על פני 141 המודלים שהם עוקבים אחריהם הוא 33, אז זה שטח חזית אמיתי. שלוש נקודות זה יתרון, לא מחיקה, אבל זה היה יתרון.
הסיפור הברור יותר הוא איפה GPT-5.5 מנצח, ויש לזה צורה מאוד ספציפית. התוצאה החזקה שלו בפער הוא Terminal-Bench 2.0 עם 82.7%, פער של 13 נקודות מעל Opus 4.7 (69.4%) ו-Gemini 3.1 Pro (68.5%). הבנצ'מארק הזה בודק זרימות עבודה אמיתיות בשורת הפקודה: תכנון, איטרציה, ותיאום כלים על פני שלבים רבים.
GPT-5.5 מוביל גם ב-BrowseComp (84.4%), ב-OSWorld-Verified (78.7%, בעצם שוויון), וב-CyberGym (81.8%). רואים את הדפוס? הניצחונות של GPT-5.5 מתקבצים סביב שימוש ארוך-טווח בכלים, אוטומציה מבוססת טרמינל, ומשימות שימוש במחשב. העבודה שבה מודל צריך להמשיך ללכת שלבים רבים בלי לאבד את החוט.
המנכ"ל של Cursor, Michael Truell, ניסח את זה יפה: "נשאר על המשימה הרבה יותר זמן בלי לעצור מוקדם". וזו בדיוק הנקודה: בעבודת סוכנים, מודל שמתעייף באמצע ומפסיק לבד שורף לכם זמן ניפוי באגים יותר ממודל קצת פחות חכם שפשוט מסיים את העבודה.
רווחים בהקשר ארוך ובהיסק מופשט
שני תחומים השתפרו הרבה לעומת GPT-5.4. זיכרון בהקשר ארוך בערך הוכפל: זיהוי MRCR v2 עם 8 מחטים בטווח 512K עד מיליון טוקנים קפץ מ-36.6% ל-74.0%. וב-ARC-AGI-2, מבחן ההיסק המופשט, GPT-5.5 מוביל עם 85.0% מול 75.8% של Opus 4.7 ו-77.1% של Gemini.
אבל שימו לב לכוכביות. ב-ARC-AGI-1, Gemini עדיין מנצח (98.0% מול 95.0%). וב-Graphwalks parents במיליון טוקנים, Opus עדיין מכה את GPT-5.5 (72.0% מול 58.5%). אפילו הניצחונות מגיעים עם שכנים שמפסידים. אל תקנו את הכותרת "מוביל בהקשר ארוך" כאמת גורפת: זה תלוי בדיוק באיזה מבחן, ובאיזה אורך הקשר, אתם מסתכלים.
טיפ: אם העומס שלכם הוא אוטומציית טרמינל או לולאות סוכן רב-שלביות, תריצו פיילוט של 20 משימות על GPT-5.5 לפני שאתם מתחייבים. היתרון ב-Terminal-Bench 2.0 (82.7% מול 69.4%) הוא המקום היחיד שבו הפרמיה במחיר משתלמת הכי בבירור, ופיילוט קטן אומר לכם תוך אחר צהריים אם זה מחזיק לכלים הספציפיים שלכם.
איפה GPT-5.5 נופל
עכשיו החלק שפוסטי ההשקה דילגו עליו. שלושה ממצאים עצמאיים צריכים לגרום לכם לעצור לפני שאתם הופכים את GPT-5.5 לברירת מחדל לעבודת ידע רצינית.
ראשון, הזיות. בבנצ'מארק הפרטי AA-Omniscience של Artificial Analysis, GPT-5.5 (ב-xhigh) רושם את הדיוק הגבוה ביותר שהם מדדו אי פעם (57%), אבל בשיעור הזיות של 86%. תשוו את זה ל-Opus 4.7 ב-36% ו-Gemini 3.1 Pro ב-50%.
במילים פשוטות: כש-GPT-5.5 לא יודע תשובה, הוא הרבה יותר נוטה להמציא אחת מאשר המתחרים שלו. ההכרזה של OpenAI עצמם אף פעם לא מתייחסת למספר הזה. וזה דפק לי את האמון: מודל שמדבר בביטחון מוחלט גם כשהוא טועה הוא בדיוק המודל המסוכן לעבודה עובדתית.
שני, לוח הבנצ'מארקים הוא לא הסוויפ שהכותרות רמזו. על פני 10 בנצ'מארקים משותפים של OpenAI ו-Anthropic, Opus 4.7 מוביל ב-6: SWE-Bench Pro (64.3% מול 58.6%), HLE עם כלים ובלי כלים, GPQA Diamond, MCP Atlas, ו-FinanceAgent v1.1.
GPT-5.5 מוביל ב-4. אז בעבודה עתירת היסק ובעבודה ברמת ביקורת קוד, המודל שאתם באמת רוצים הוא לעיתים קרובות Opus.
שלישי, סקירות פנים-מול-פנים מתפצלות חזק תלוי במדד. Tom's Guide הריצו השוואה ב-7 קטגוריות ו-GPT-5.5 הפסיד את כל ה-7 ל-Opus 4.7, שיבחו את המהירות שלו אבל ביקרו את ההזיות. ZDNET, לעומת זאת, נתנו לו 93 מתוך 100 על פני 10 סבבים, וגרעו נקודות "רק על התלהבות יתר". מתודולוגיית הסוקר מנדנדת את התוצאה, אז קחו כל פסק דין בודד עם גרגר מלח, כולל שלנו.
GPT-5.5: מה עובד ומה לא
מה עובד
- הכי טוב בבדיקה בעבודת סוכנים וטרמינל: Terminal-Bench 2.0 ב-82.7%, יתרון של 13 נקודות
- זיכרון בהקשר ארוך בערך הוכפל מול GPT-5.4 (74.0% ב-MRCR בטווח 512K-1M)
- בערך פי 1.5 מהיר מקצה לקצה לעומת GPT-5.4 בבדיקה העצמאית של Tessl (89.5 שניות מול 135.4 שניות להרצה)
- יעילות טוקנים מרככת את הקפיצה במחיר ל-~20% יותר, לא 100%, על מדד AA
- יכולת הגנת סייבר חזקה: UK AISI כינו אותו אולי המודל החזק ביותר שבדקו במשימות מומחה
מה לא
- שיעור הזיות של 86% ב-AA-Omniscience, הרבה מעל Opus 4.7 (36%) ו-Gemini 3.1 Pro (50%)
- נגרר אחרי Opus 4.7 ב-6 מתוך 10 בנצ'מארקים משותפים, כולל SWE-Bench Pro ברמת ביקורת קוד ב-5.7 נקודות
- פלט ב-30$ זה 5$ יותר מ-Opus 4.7 ו-18$ יותר מ-Gemini 3.1 Pro
- הטענה "אימון מלא ראשון מאפס" מדווחת על ידי סוקרים, לא מאומתת על ידי OpenAI
- צוות התקיפה של AISI מצא ג'יילברייק אוניברסלי תוך 6 שעות, ותיקון ההגנה הסופי מעולם לא אומת במלואו
GPT-5.5 Instant: החלפת ברירת המחדל שלא בחרתם בה
ב-5 במאי 2026, OpenAI החליפו את מודל ברירת המחדל של ChatGPT ל-GPT-5.5 Instant לכולם, ודילגו לגמרי על "GPT-5.4 Instant". לפי ההערכות הפנימיות של OpenAI, Instant חותך טענות מומצאות ב-52.5% בפרומפטים בעלי סיכון גבוה (רפואה, משפט, פיננסים) וב-37.3% בשיחות שמשתמשים סימנו כשגויות.
HealthBench עלה מ-49.6 ל-51.4. AIME 2025 קפץ מ-65.4 ל-81.2.
מאחורי הקלעים, Instant מנתב אוטומטית: לכל פרומפט נתון, הוא מחליט אם לענות עם GPT-5.3 Instant הקליל או להסלים ל-GPT-5.5 Thinking. יש גם פאנל חדש של "memory sources" שמראה אילו צ'אטים, קבצים או פריטי Gmail מהעבר עיצבו תשובה מותאמת אישית, עם פקדים למחוק או לתקן כל אחד מהם.
שתי הסתייגויות כנות פה. כל מספר של Instant למעלה הוא הערכה פנימית של OpenAI מול הקודם שלהם עצמם: אין בנצ'מארק עצמאי, ואין השוואה ל-Google או ל-Anthropic. ופאנל ה-memory sources מודה שהוא "אולי לא יראה כל גורם שעיצב תשובה", מה שמנהל אבטחה ב-HiddenLayer הזהיר שיוצר יומן הקשר שני שיכול להתנגש עם נתיבי הביקורת שארגונים כבר מנהלים. שימושי, אבל לא התמונה המלאה.
יכולת הסייבר שאף אחד לא ציפה לה
זו התוצאה שבאמת הפתיעה אותי. מכון אבטחת ה-AI הבריטי (UK AI Security Institute) בדק את GPT-5.5 על משימות סייבר ברמת מומחה ונתן לו ציון של 71.4%, לפני ה-Mythos Preview המוגבל של Anthropic (68.6%), GPT-5.4 (52.4%), ו-Opus 4.7 (48.6%). AISI כתבו ש"במדד הזה, GPT-5.5 אולי המודל החזק ביותר שבדקנו".
זרקור אחד הופך את זה למוחשי. באתגר הנדסה לאחור שלקח לבן אדם מומחה בערך 12 שעות עם כלים מקצועיים, GPT-5.5 עם סוכן בסיסי במכולת Kali Linux פתר אותו ב-10 דקות ו-22 שניות תמורת 1.73$ בשימוש API, בלי עזרה אנושית. הוא אבחן טבלאות העתקה, בנה אמולטור, תפס באג קריאה/כתיבה מוחלף שהוא עצמו עשה, ופתר את הסיסמה באילוצים.
זה חותך לשני הכיוונים, ו-AISI אמרו את זה. צוות התקיפה שלהם מצא ג'יילברייק אוניברסלי תוך 6 שעות שעבד על כל שאילתת סייבר זדונית ש-OpenAI נתנו להם. OpenAI תיקנו אותו, אבל AISI לא יכלו לאמת את התיקון הסופי בגלל בעיית קונפיגורציה בגרסה שהם קיבלו. אז היכולת אמיתית, וגם שאלת הבטיחות הפתוחה.
איך GPT-5.5 משתווה דווקא עכשיו
הנה בדיקת הרעננות שכיסוי ההשקה לא יכול לתת לכם. GPT-5.5 היה המודל המוביל ב-23 באפריל. נכון ליוני 2026, הוא כבר לא.
Anthropic שחררו את Claude Opus 4.8 ב-28 במאי, והוא יושב מעל GPT-5.5 על מדד Artificial Analysis (56 מול 55). Anthropic אומנם שחררו לזמן קצר את Claude Fable 5, מודל ממחלקת Mythos, בתחילת יוני, אבל ב-12 ביוני הם השביתו את הגישה ל-Fable 5 ול-Mythos 5 לכל הלקוחות בעולם בעקבות הנחיית בקרת ייצוא של ממשלת ארה"ב שסימנה חשש לג'יילברייק. אז Fable 5 הוא לא משהו שאתם יכולים לבחור היום. Opus 4.8 כן, והוא המודל שלקח את הכתר. התווית "המודל הכי חכם עד היום" החזיקה בערך חמישה שבועות.
GPT-5.5 עדיין מודל הדגל הנוכחי של OpenAI. שמועה על GPT-5.6 ליוני 2026 רצה (שווקי החיזוי נתנו לזה סיכוי גבוה), אבל נכון לכתיבת שורות אלה OpenAI לא הוציאו הכרזה רשמית, אז GPT-5.5 נשאר המודל שאתם באמת בוחרים היום. לתמונה הרחבה יותר, ראו את הכיסוי שלנו של כלי AI, את מרכז השוואת המודלים, ואיך המתחרים שלו מתמודדים עם סוכני מרחב עבודה.
| תרחיש שימוש | הבחירה הטובה | למה |
|---|---|---|
| אוטומציית טרמינל / לולאות סוכן ארוכות | GPT-5.5 | 82.7% ב-Terminal-Bench 2.0, יתרון של 13 נקודות, נשאר על המשימה יותר זמן |
| ביקורת קוד עמוקה / היסק | Claude Opus 4.7 | מוביל ב-6 מתוך 10 בנצ'מארקים, שיעור הזיות הרבה יותר נמוך |
| עבודת ידע עובדתית | Claude Opus 4.7 | 36% הזיות מול 86% של GPT-5.5 ב-AA-Omniscience |
| העלות הנמוכה ביותר בשוויון חזית | Gemini 3.1 Pro | ~900$ להרצת מדד AA מול ~1,200$ של GPT-5.5 |
| שימוש מזדמן ב-ChatGPT | GPT-5.5 Instant | כבר ברירת המחדל שלכם, תשובות קצרות יותר, פחות הזיות מ-5.3 |
שאלות נפוצות
כמה GPT-5.5 עולה?
GPT-5.5 עולה 5$ למיליון טוקני קלט ו-30$ למיליון טוקני פלט דרך ה-API, כפול מ-2.50$/15$ של GPT-5.4. GPT-5.5 Pro יקר בהרבה: 30$/180$. מצבי Batch ו-Flex רצים בחצי תעריף. ב-ChatGPT, GPT-5.5 Thinking זמין ב-Plus ומעלה, ו-GPT-5.5 Instant הוא ברירת המחדל החינמית.
האם GPT-5.5 טוב יותר מ-Claude Opus 4.7?
תלוי במשימה. GPT-5.5 מנצח בעבודת סוכנים ועבודה מבוססת טרמינל כמו Terminal-Bench 2.0. Opus 4.7 מוביל ב-6 מתוך 10 בנצ'מארקים משותפים, ממציא הרבה פחות (36% מול 86% ב-AA-Omniscience), ועולה 5$ פחות למיליון טוקני פלט. להיסק עמוק ולדיוק עובדתי, Opus הוא הבחירה הבטוחה יותר.
האם GPT-5.5 עדיין המודל המוביל?
לא, כבר לא. GPT-5.5 הוביל את מדד Artificial Analysis Intelligence Index עם ציון 60 כשיצא ב-23 באפריל 2026, אבל Claude Opus 4.8 (28 במאי) עקף אותו מאז (56 מול 55). Claude Fable 5 הוביל לזמן קצר בתחילת יוני, אבל Anthropic השביתו אותו לכל הלקוחות ב-12 ביוני בעקבות הנחיית בקרת ייצוא של ממשלת ארה"ב, אז הוא לא זמין כרגע. GPT-5.5 נשאר מודל הדגל הנוכחי של OpenAI, בלי GPT-5.6 שהוכרז רשמית נכון ליוני 2026.
מה זה GPT-5.5 Instant?
GPT-5.5 Instant הוא מודל ברירת המחדל המהיר שהחליף את GPT-5.3 Instant ב-ChatGPT ב-5 במאי 2026. הוא מנתב אוטומטית בין מודל קליל ל-GPT-5.5 Thinking לכל פרומפט, נותן תשובות קצרות יותר, ו(לפי ההערכות הפנימיות של OpenAI) חותך הזיות ב-52.5% בפרומפטים בעלי סיכון גבוה לעומת GPT-5.3 Instant.
האם GPT-5.5 ממציא הרבה?
בבנצ'מארק AA-Omniscience, כן: GPT-5.5 (ב-xhigh) רושם שיעור הזיות של 86%, הרבה מעל Opus 4.7 (36%) ו-Gemini 3.1 Pro (50%). הוא נוטה יותר לפברק תשובה מאשר להודות שהוא לא יודע. תאמתו כל דבר עובדתי שהוא נותן לכם, במיוחד בתחומים בעלי סיכון גבוה.
ההמלצה שלנו
הכי טוב לעבודת סוכנים וטרמינל: GPT-5.5, כי הציון של 82.7% ב-Terminal-Bench 2.0 וההתנהגות של "נשאר על המשימה יותר זמן" מצדיקים את הפרמיה לאוטומציה רב-שלבית.
הכי טוב להיסק ולדיוק: Claude Opus 4.7, כי הוא מוביל ב-6 מתוך 10 בנצ'מארקים משותפים וממציא בשיעור של 36% מול 86% של GPT-5.5.
הכי טוב בתמורה בשוויון חזית: Gemini 3.1 Pro, כי הוא משתווה למובילי המדד בעלות הנמוכה ביותר מבין השלושה: 2$/12$.
הצעד הבא שלכם: תריצו פיילוט של 20 משימות של GPT-5.5 על זרימת הסוכנים האמיתית שלכם במאמץ "medium". אם העבודה שלכם מבוססת טרמינל ורב-שלבית, הפרמיה משתלמת. אם היא עתירת היסק או עובדות, נתבו ל-Opus 4.7 ושמרו בכיס את 5$ החיסכון בפלט. מתי בפעם האחרונה פיילוט קטן אחד לימד אתכם יותר מכל בנצ'מארק שקראתם?
