אם אתם עוקבים אחר התחרות בין גוגל, OpenAI ואנת'רופיק (Anthropic) בתחום הבינה המלאכותית, אתם בטח כבר יודעים שכל אחת מהחברות מנסה להציג מודל כמה שיותר מתקדם, כזה שמצליח להתמודד עם משימות מורכבות במיוחד. כעת, גוגל מכריזה על Gemini 4 Argon, מודל AI חדש שלטענתה מסוגל לבצע משימות ממושכות ומורכבות, לכתוב קוד מורכב, לערוך מחקר מעמיק, לסייע בהגנת סייבר וליצור תוכן מקורי. אבל אל תמהרו לחפש אותו באפליקציה, החברה מגבילה כרגע את הגישה אליו בגלל החשש שיכולות הסייבר שלו ינוצלו לרעה.
אחת היכולות המעניינות שהמודל החדש מציע היא היכולת לייצר עד מיליון טוקנים בתשובה אחת, לעומת 64 אלף טוקנים בדור הקודם. כלומר, אתם יכולים לקבל מהמודל תשובות ארוכות ומפורטות במיוחד, בלי להיתקל באותה מגבלת פלט שהייתה קיימת בדור הקודם. מדובר בשינוי משמעותי למי שמשתמש בסוכני AI כדי לכתוב קוד, לנתח מסמכים או לבצע משימות ארוכות שמורכבות ממספר שלבים.
ההשקה מגיעה אחרי שגוגל ביטלה את התוכניות להשקת Gemini 3.5 Pro והתמקדה ב- Gemini 3.8 Flash. כעת, היא מציגה גם שמות חדשים למודלים שלה, ומנסה להציע יכולות מתקדמות במגוון רחב של שימושים, ולא רק בשיחות עם הצ'אטבוט.
הביצועים מרשימים במיוחד
במבחני הביצועים שפרסמה גוגל, Gemini 4 Argon הציג תוצאות מעניינות במיוחד בתחום פיתוח התוכנה. במבחן DeepSWE v1.1, שבודק את היכולת של סוכני AI להתמודד עם משימות קידוד מורכבות, הוא השיג ציון של 77.9%. לשם השוואה, Claude Opus 5.5 של אנת'רופיק הגיע ל- 74.2%, ו- GPT-6 Astra של OpenAI השיג 74.1%.
גם בתחום האוטומציה המודל מציג תוצאות גבוהות, עם ציון של 51.3% במבחן AutomationBench של Zapier.
המודל Argon מוביל ב- 13 מתוך 19 מבחני הביצועים, כאשר הפערים הגדולים ביותר נרשמו במשימות כמו ניתוח נתונים פיננסיים, מחקר וניתוח מסמכים מורכבים. במבחן המשפטי של Harvey הוא השיג 19.6%, כמעט פי 3 מהמתחרה הכי קרוב, ובמבחן הפיננסי של Vals הוא מקדים את כולם בכמעט 7 נקודות.
| תחום | מבחן | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|---|
| עבודה מקצועית | Vals Index | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench (Score) | 51.3% | 41.4% | 31.4% | 42.5% | |
| Vals Finance Agent v2 | 65.4% | 53.5% | 58.9% | 58.6% | |
| Harvey's Legal Agent Benchmark | 19.6% | 5.4% | 6.7% | 3.8% | |
| קוד וסוכנים | DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% | |
| Vibe Code Bench | 91.9% | 89.6% | 90.3% | 90.3% | |
| Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% | |
| הנדסת ML | PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% |
| מדע ומתמטיקה | Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% |
| LABBench 2 | 88.8% | 85.4% | 68.6% | 73.1% | |
| RiemannBench | 76.0% | 72.0% | 65.6% | 69.6% | |
| הקשר ארוך | GraphWalks (Up to 128k, BFS F1) | 99.7% | 98.7% | 91.4% | 90.6% |
| GraphWalks (256k to 1M, BFS F1) | 84.2% | 71.8% | 65.0% | 66.8% | |
| שימוש במחשב | Agent's Last Exam (Pass rate) | 39.5% | 34.2% | — | 38.2% |
| OSWorld-2.0 (Offline subset, Partial score) | 69.2% | 72.6% | — | — | |
| הבנה מולטימודלית | Chartography | 71.6% | 71.0% | 46.2% | 66.3% |
| LVBench | 91.7% | 87.5% | 79.7% | 83.7% | |
| אבטחת סייבר | CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% |
מקור: Google
גוגל הודיעה כי היא כבר משתמשת ב- Gemini 4 Argon בעבודה השוטפת שלה, ואלפים מעובדיה נעזרים בו כדי לייעל תהליכים. אחד השימושים המעניינים שהיא הציגה הוא ניתוח נתוני ביצועים במרכזי הנתונים של החברה, שבמסגרתו הצליחו סוכני AI המבוססים על המודל החדש לפנות יותר מ- 300 טרה-בייט של זיכרון. בגוגל מעריכים שהחיסכון הכולל עשוי להגיע ל- 500 טרה-בייט עד פטה-בייט אחד. וכן, מדובר בכמות זיכרון גדולה במיוחד.
המודל מסייע גם בהמרת קוד משפות C ו- C++ לשפת Rust, שנחשבת ליעילה יותר מבחינת ניהול זיכרון. במקרה של ספריית libgav1, סוכני Argon החליפו 32 אלף שורות קוד, ויצרו מפענח וידאו שפועל במהירות גבוהה פי 2.7 מגרסת Rust הקודמת. די מגניב.
גוגל לא קיפחה כאן גם את נושא הסייבר. Gemini 4 Argon השיג ציון של 68% במבחן CWE-bench v1, שבודק יכולת לאתר ולתקן חולשות אבטחה. בעקבות התוצאות המפתיעות, החברה מתכננת להעניק למומחי אבטח מורשים גישה לגרסה של המודל ללא מגבלות.
המודל Gemini 4 Argon צפוי להגיע בקרוב למנויי Google AI Ultra וללקוחות שמשלמים על שימוש בממשק ה- API. מחיר ההשקה יעמוד על 2 דולרים למיליון טוקנים נכנסים ו- 10 דולרים למיליון טוקנים יוצאים, ובהמשך יעלה ל- 4 ו- 20 דולרים, בהתאמה.
נכון לרגע כתיבת שורות אלה, המודל זמין אך ורק לבודקים מורשים ולמומחי סייבר במסגרת תוכנית Fairwind של גוגל, שנועדה לבדוק יכולות סייבר.
שאלות ותשובות על Gemini 4 Argon
מה זה Gemini 4 Argon ?
זהו מודל הבינה המלאכותית המתקדם ביותר של גוגל כרגע, והראשון שמקבל שם שונה במסגרת שיטת השמות החדשה של החברה. הוא מחליף את Gemini 3.5 Pro, שגוגל החליטה בסוף לוותר עליו, ונבנה במיוחד למשימות ארוכות הכוללות שלבים רבים ודורשות חשיבה מעמיקהנלפני שהוא עונה.
מה התכונות הבולטות של Gemni 4 Argon ?
התכונה הבולטת ביותר של המודל החדש היא היכולת לכתוב עד מיליון טוקנים בתשובה אחת, פי 15 בערך מ- 64 אלף הטוקנים שהיו קודם. מעבר לזה, הוא השתפר בכתיבת קוד, הסקת מסקנות ובעבודה עם טקסט, תמונה ווידאו ביחד.
במה Gemini 4 Argon טוב יותר מהמתחרים ?
לפי הנתונים של גוגל, הוא עוקף את Claude Opus 5.5 ואת GPT-6 Astra במבחן הקוד DeepSWE, עם 77.9% לעומת 74.2% ו- 74.1%. הוא גם מוביל במבחן האוטומציה של Zapier, חולק את המקום הראשון במבחן תיקון חולשות אבטחה CWE-bench, ומציג תוצאות מרשימות במבחנים של מחקר פיננסי ומשפטי. רק קחו בחשבון שאלה מספרים שגוגל פרסמה ולא נבדקו על ידי גורמים נוספים.
מתי אפשר יהיה להשתמש ב- Gemini 4 Argon ?
גוגל מציינת שהוא יגיע "בקרוב", ולא מספקת תאריך מדויק. כרגע הוא פתוח רק לבודקים מורשים ולצוותי הגנת סייבר דרך תוכנית Fairwind. הראשונים שיהנו ממנו יהיו מנויי Google AI Ultra ולקוחות API משלמים.
כמה עולה להשתמש ב- Gemini 4 Argon ?
מפתחים שמשתמשים ב- API ישלמו בהתחלה 2 דולר למיליון טוקנים של קלט ו- 10 דולר למיליון טוקנים של פלט, עם הנחה של 95% על קלט שנשמר במטמון. לאחר תקופה ההשקה, המחיר יקפוץ ל- 4 ו- 20 דולר בהתאמה. משתמשים פרטיים יקבלו גישה למודל החדש רק דרך המנוי ל- Google AI Ultra, שהוא המסלול היקר ביותר של החברה.
למי Gemini 4 Argon מתאים ?
קהל היעד של המודל החדש הוא בעיקר מפתחים וחברות שמריצות סוכני AI למשימות ארוכות, כמו כתיבה והמרה של קוד, מחקר מעמיק וניתוח מסמכים. גם צוותי אבטחת מידע, אנליסטים פיננסיים ועורכי דין יכולים ליהנות מהיכולות שלו.
האם Gemini 4 Argon בטוח לשימוש ?
גוגל מסרה כי לפני שתפיץ את המודל לקהל הרחב, היא תבצע בדיקות בטיחות מקיפות כדי לצמצם את הסיכון לשימוש לרעה, במיוחד בתחום הסייבר. בנוסף, החברה בודקת אם הוא יכול להתמודד עם מתקפות של הזרקת פרומפטים, שנועדו לגרום למודל לפעול בניגוד להנחיות שקיבל.







