{"id":981002,"date":"2026-10-01T19:43:36","date_gmt":"2026-10-01T11:43:36","guid":{"rendered":"https:\/\/ztylezman.com\/?p=981002"},"modified":"2026-10-02T06:02:36","modified_gmt":"2026-10-01T22:02:36","slug":"gemini-4-argon-1m-tokens","status":"publish","type":"post","link":"https:\/\/ztylezman.com\/en\/gadgets-en-2\/gemini-4-argon-1m-tokens\/","title":{"rendered":"Gemini 4 Argon Raises Output Cap to 1 Million Tokens"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">Gemini 4 Argon increases its single-output limit to <strong>1 million tokens<\/strong>, but Google DeepMind said initial access is restricted to selected cybersecurity teams rather than general users.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Gemini 4 Argon: Quick take<\/h2>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Argon can <strong>output up to 1 million tokens at once<\/strong>, which refers to generated model output, not the number of input words.<\/li>\n\n\n\n<li>Google DeepMind&#8217;s comparison table shows Argon placed first alone in 13 of 19 benchmark tasks, and tied for first in one other task, according to Google DeepMind.<\/li>\n\n\n\n<li>Google has not announced a date when Gemini 4 Argon will be available to ordinary users; early access goes to trusted teams under the Fairwind program, Google said.<\/li>\n<\/ul>\n\n\n\n<h2 class=\"wp-block-heading\">One million tokens, not one million words<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Argon\u2019s headline specification is the raised single-output cap, from 64,000 tokens to <strong>1,000,000 tokens<\/strong>, Google DeepMind said. In practical terms, a token is a unit the model uses to process text, and tokens do not map directly to words.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Google gave work-focused examples for Gemini 4 Argon, such as assisting with large code refactors and multi-step research tasks, and said partners used Argon to scan software for security issues. Those examples come from Google and partners including the security firm Wiz, and they illustrate intended use cases more than everyday consumer gains.<\/p>\n\n\n<div class=\"wp-block-image\">\n<figure class=\"aligncenter size-large\"><a href=\"https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-1m-output-tokens-860x570-1.jpg\" rel=\"attachment wp-att-980973\"><img decoding=\"async\" width=\"860\" height=\"570\" src=\"https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-1m-output-tokens-860x570-1.jpg\" alt=\"Infographic showing Gemini 4 Argon raised single-output limit from 64,000 tokens to 1,000,000 tokens\" class=\"wp-image-980973\" srcset=\"https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-1m-output-tokens-860x570-1.jpg 860w, https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-1m-output-tokens-860x570-1-300x199.jpg 300w, https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-1m-output-tokens-860x570-1-768x509.jpg 768w, https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-1m-output-tokens-860x570-1-150x99.jpg 150w, https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-1m-output-tokens-860x570-1-450x298.jpg 450w\" sizes=\"(max-width: 860px) 100vw, 860px\" \/><\/a><figcaption class=\"wp-element-caption\">Google said Gemini 4 Argon raised its single-output limit from 64,000 tokens to 1,000,000 tokens. Source: Google DeepMind<\/figcaption><\/figure>\n<\/div>\n\n\n<h2 class=\"wp-block-heading\">Benchmarks: 13 first places, 5 tests lost<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">According to a benchmark table published by Google DeepMind, Gemini 4 Argon scored 77.9 percent on the long-form software engineering test DeepSWE v1.1, ahead of GPT-6 Astra at 74.1 percent and Claude Opus 5.5 at 74.2 percent, Google DeepMind reported.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">But scores vary by test: Argon scored 55.0 percent on FrontierSWE v2, behind GPT-6 Astra at 65.5 percent. Google DeepMind cautioned that some Argon results were computed internally, while other models\u2019 numbers were taken from public leaderboards or vendor submissions, and not every model was re-run under identical conditions.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">An independent evaluator, Artificial Analysis, gave Argon and GPT-6 Astra the same composite index score of 53 points, and noted Argon lagged on certain terminal and coding benchmarks. That independent assessment reinforces that Gemini 4 Argon has notable strengths, but is not dominant across every measure.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">When will ordinary users get access?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Google said Gemini 4 Argon is initially available to trusted cybersecurity teams selected under the Fairwind program. Google plans to expand access to paying API customers and Google AI Ultra subscribers later, but gave no date for broad public availability.<\/p>\n\n\n<div class=\"wp-block-image\">\n<figure class=\"aligncenter size-large\"><a href=\"https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-fairwind-access-860x570-1.jpg\" rel=\"attachment wp-att-980974\"><img decoding=\"async\" width=\"860\" height=\"570\" src=\"https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-fairwind-access-860x570-1.jpg\" alt=\"Graphic indicating Gemini 4 Argon is first rolled out to trusted security teams under Fairwind\" class=\"wp-image-980974\" srcset=\"https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-fairwind-access-860x570-1.jpg 860w, https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-fairwind-access-860x570-1-300x199.jpg 300w, https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-fairwind-access-860x570-1-768x509.jpg 768w, https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-fairwind-access-860x570-1-150x99.jpg 150w, https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-fairwind-access-860x570-1-450x298.jpg 450w\" sizes=\"(max-width: 860px) 100vw, 860px\" \/><\/a><figcaption class=\"wp-element-caption\">Gemini 4 Argon is being rolled out first to selected cybersecurity personnel under the Fairwind program. Source: Google DeepMind<\/figcaption><\/figure>\n<\/div>\n\n\n<p class=\"wp-block-paragraph\">That staged rollout means most consumers cannot yet try Gemini 4 Argon themselves, so early impressions will rely on published scores and partner case studies rather than hands-on comparisons, Google said.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">API pricing and what it means for developers<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Google listed introductory API prices: <strong>$2 per million input tokens and $10 per million output tokens<\/strong> during the promotional period, and $4 and $20 respectively after the promotion ends, Google said. The company did not specify when the promotional period ends.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Those rates mean a sustained heavy workload using Gemini 4 Argon could become costly for teams that generate very large outputs. Google positioned Argon for lengthy code tasks and multi-step research, and the pricing reflects that target use case, Google said.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Google DeepMind\u2019s 19-test comparison<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">The following summary is based on a Google DeepMind chart comparing Gemini 4 Argon with peer models across 19 tasks. In that chart, green shading marks the top score in each task, and &#8220;not listed&#8221; means the table did not report a particular model\u2019s number, Google DeepMind said.<\/p>\n\n\n<div class=\"wp-block-image\">\n<figure class=\"aligncenter size-large\"><a href=\"https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-benchmark-comparison-860x570-1.jpg\" rel=\"attachment wp-att-980975\"><img decoding=\"async\" width=\"860\" height=\"570\" src=\"https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-benchmark-comparison-860x570-1.jpg\" alt=\"Bar chart comparing Gemini 4 Argon, GPT-6 Astra and Claude Opus 5.5 across multiple AI tests\" class=\"wp-image-980975\" srcset=\"https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-benchmark-comparison-860x570-1.jpg 860w, https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-benchmark-comparison-860x570-1-300x199.jpg 300w, https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-benchmark-comparison-860x570-1-768x509.jpg 768w, https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-benchmark-comparison-860x570-1-150x99.jpg 150w, https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-benchmark-comparison-860x570-1-450x298.jpg 450w\" sizes=\"(max-width: 860px) 100vw, 860px\" \/><\/a><figcaption class=\"wp-element-caption\">Gemini 4 Argon leads on several tests, while GPT-6 Astra scores higher on FrontierSWE v2, and CWE-bench v1 is a tie. Source: Google DeepMind<\/figcaption><\/figure>\n<\/div>\n\n\n<div style=\"overflow-x:auto;-webkit-overflow-scrolling:touch;\">\n<table style=\"border-collapse:collapse;min-width:780px;width:100%;\">\n<caption style=\"text-align:left;padding:10px 0;\">Gemini 4 Argon \u8207\u4e09\u6b3e\u6a21\u578b\u8dd1\u5206\u6bd4\u8f03\uff0c\u8cc7\u6599\u4f86\u6e90\uff1aGoogle DeepMind<\/caption>\n<thead>\n<tr>\n<th scope=\"col\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u7bc4\u7587<\/th>\n<th scope=\"col\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u6e2c\u8a66\u9805\u76ee<\/th>\n<th scope=\"col\" style=\"border:1px solid #ddd;padding:8px;text-align:right;\">Gemini 4 Argon<\/th>\n<th scope=\"col\" style=\"border:1px solid #ddd;padding:8px;text-align:right;\">GPT-6 Astra<\/th>\n<th scope=\"col\" style=\"border:1px solid #ddd;padding:8px;text-align:right;\">Claude Fable 5.1<\/th>\n<th scope=\"col\" style=\"border:1px solid #ddd;padding:8px;text-align:right;\">Claude Opus 5.5<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u5c08\u696d\u5de5\u4f5c<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">Vals Index<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>68.9%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">63.1%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">65.8%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">67.0%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u5c08\u696d\u5de5\u4f5c<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">AutomationBench\uff08\u5206\u6578\uff09<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>51.3%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">41.4%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">31.4%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">42.5%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u5c08\u696d\u5de5\u4f5c<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">Vals Finance Agent v2<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>65.4%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">53.5%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">58.9%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">58.6%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u5c08\u696d\u5de5\u4f5c<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">Harvey&#8217;s Legal Agent Benchmark<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>19.6%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">5.4%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">6.7%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">3.8%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u7a0b\u5f0f\u958b\u767c<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">DeepSWE v1.1<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>77.9%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">74.1%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">67.4%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">74.2%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u7a0b\u5f0f\u958b\u767c<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">FrontierSWE v2<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">55.0%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>65.5%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">56.3%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">62.3%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u7a0b\u5f0f\u958b\u767c<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">Vibe Code Bench<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>91.9%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">89.6%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">90.3%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">90.3%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u7a0b\u5f0f\u958b\u767c<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">Terminal-bench 4.0<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">57.4%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">58.2%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">57.9%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>66.4%<\/strong><\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u6a5f\u5668\u5b78\u7fd2\u5de5\u7a0b<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">PostTrainBench<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">45.3%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">44.3%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">40.2%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>49.3%<\/strong><\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u79d1\u5b78\u53ca\u6578\u5b78<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">Terminal-Bench Science 0.1<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">57.6%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>68.1%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">52.6%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">63.3%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u79d1\u5b78\u53ca\u6578\u5b78<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">LABBench 2<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>88.8%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">85.4%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">68.6%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">73.1%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u79d1\u5b78\u53ca\u6578\u5b78<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">RiemannBench<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>76.0%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">72.0%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">65.6%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">69.6%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u9577\u7bc7\u5167\u5bb9\u7406\u89e3<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">GraphWalks\uff08\u6700\u591a 12.8 \u842c Token\uff09<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>99.7%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">98.7%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">91.4%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">90.6%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u9577\u7bc7\u5167\u5bb9\u7406\u89e3<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">GraphWalks\uff0825.6 \u842c\u81f3 100 \u842c Token\uff09<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>84.2%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">71.8%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">65.0%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">66.8%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u96fb\u8166\u64cd\u4f5c<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">Agent&#8217;s Last Exam\uff08\u901a\u904e\u7387\uff09<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>39.5%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">34.2%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">\u672a\u5217\u51fa<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">38.2%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u96fb\u8166\u64cd\u4f5c<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">OSWorld-2.0\uff08\u96e2\u7dda\u6e2c\u8a66\u90e8\u5206\u5f97\u5206\uff09<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">69.2%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>72.6%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">\u672a\u5217\u51fa<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">\u672a\u5217\u51fa<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u5716\u50cf\u53ca\u5f71\u7247\u7406\u89e3<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">Chartography<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>71.6%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">71.0%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">46.2%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">66.3%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u5716\u50cf\u53ca\u5f71\u7247\u7406\u89e3<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">LVBench<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>91.7%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">87.5%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">79.7%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">83.7%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u7db2\u7d61\u4fdd\u5b89<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">CWE-bench v1<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>68.0%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>68.0%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">58.0%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">67.0%<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<\/div>\n\n\n\n<p class=\"wp-block-paragraph\"><small>Note: The above summary follows Google DeepMind&#8217;s published comparisons for 19 tasks. Some Argon results were computed by Google DeepMind, and other models\u2019 figures may come from public leaderboards or vendor reports. Test settings vary by task; see Google DeepMind&#8217;s official evaluation methodology for details: <a href=\"https:\/\/deepmind.google\/models\/evals-methodology\/gemini-4-argon\/\" target=\"_blank\" rel=\"noopener noreferrer\">https:\/\/deepmind.google\/models\/evals-methodology\/gemini-4-argon\/<\/a>.<\/small><\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Gemini 4 Argon increases single-output capacity to 1 million tokens, but Google DeepMind says initial access is limited to selected security teams and partners.<\/p>\n","protected":false},"author":2,"featured_media":980972,"comment_status":"closed","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"inline_featured_image":false,"footnotes":""},"categories":[5012],"tags":[4700,39213,47719,4184,37524,35048,11179,47716,14012,4591,47684,24427,47730,47720,47717],"class_list":["post-981002","post","type-post","status-publish","format-standard","has-post-thumbnail","category-gadgets-en-2","tag-ai","tag-api","tag-argon","tag-astra","tag-claude","tag-cybersecurity","tag-deepmind","tag-fairwind","tag-gemini","tag-google","tag-gpt-6","tag-models","tag-software-engineering-benchmarks","tag-token","tag-wiz"],"raw_content":"<!-- wp:paragraph -->\n<p>Gemini 4 Argon increases its single-output limit to <strong>1 million tokens<\/strong>, but Google DeepMind said initial access is restricted to selected cybersecurity teams rather than general users.<\/p>\n<!-- \/wp:paragraph -->\n\n<!-- wp:heading -->\n<h2 class=\"wp-block-heading\">Gemini 4 Argon: Quick take<\/h2>\n<!-- \/wp:heading -->\n\n<!-- wp:list -->\n<ul class=\"wp-block-list\"><!-- wp:list-item -->\n<li>Argon can <strong>output up to 1 million tokens at once<\/strong>, which refers to generated model output, not the number of input words.<\/li>\n<!-- \/wp:list-item -->\n\n<!-- wp:list-item -->\n<li>Google DeepMind's comparison table shows Argon placed first alone in 13 of 19 benchmark tasks, and tied for first in one other task, according to Google DeepMind.<\/li>\n<!-- \/wp:list-item -->\n\n<!-- wp:list-item -->\n<li>Google has not announced a date when Gemini 4 Argon will be available to ordinary users; early access goes to trusted teams under the Fairwind program, Google said.<\/li>\n<!-- \/wp:list-item --><\/ul>\n<!-- \/wp:list -->\n\n<!-- wp:heading -->\n<h2 class=\"wp-block-heading\">One million tokens, not one million words<\/h2>\n<!-- \/wp:heading -->\n\n<!-- wp:paragraph -->\n<p>Argon\u2019s headline specification is the raised single-output cap, from 64,000 tokens to <strong>1,000,000 tokens<\/strong>, Google DeepMind said. In practical terms, a token is a unit the model uses to process text, and tokens do not map directly to words.<\/p>\n<!-- \/wp:paragraph -->\n\n<!-- wp:paragraph -->\n<p>Google gave work-focused examples for Gemini 4 Argon, such as assisting with large code refactors and multi-step research tasks, and said partners used Argon to scan software for security issues. Those examples come from Google and partners including the security firm Wiz, and they illustrate intended use cases more than everyday consumer gains.<\/p>\n<!-- \/wp:paragraph -->\n\n<!-- wp:image {\"id\":980973,\"sizeSlug\":\"large\",\"linkDestination\":\"media\",\"align\":\"center\"} -->\n<figure class=\"wp-block-image aligncenter size-large\"><a href=\"https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-1m-output-tokens-860x570-1.jpg\" rel=\"attachment wp-att-980973\"><img src=\"https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-1m-output-tokens-860x570-1.jpg\" alt=\"Infographic showing Gemini 4 Argon raised single-output limit from 64,000 tokens to 1,000,000 tokens\" class=\"wp-image-980973\"\/><\/a><figcaption class=\"wp-element-caption\">Google said Gemini 4 Argon raised its single-output limit from 64,000 tokens to 1,000,000 tokens. Source: Google DeepMind<\/figcaption><\/figure>\n<!-- \/wp:image -->\n\n<!-- wp:heading -->\n<h2 class=\"wp-block-heading\">Benchmarks: 13 first places, 5 tests lost<\/h2>\n<!-- \/wp:heading -->\n\n<!-- wp:paragraph -->\n<p>According to a benchmark table published by Google DeepMind, Gemini 4 Argon scored 77.9 percent on the long-form software engineering test DeepSWE v1.1, ahead of GPT-6 Astra at 74.1 percent and Claude Opus 5.5 at 74.2 percent, Google DeepMind reported.<\/p>\n<!-- \/wp:paragraph -->\n\n<!-- wp:paragraph -->\n<p>But scores vary by test: Argon scored 55.0 percent on FrontierSWE v2, behind GPT-6 Astra at 65.5 percent. Google DeepMind cautioned that some Argon results were computed internally, while other models\u2019 numbers were taken from public leaderboards or vendor submissions, and not every model was re-run under identical conditions.<\/p>\n<!-- \/wp:paragraph -->\n\n<!-- wp:paragraph -->\n<p>An independent evaluator, Artificial Analysis, gave Argon and GPT-6 Astra the same composite index score of 53 points, and noted Argon lagged on certain terminal and coding benchmarks. That independent assessment reinforces that Gemini 4 Argon has notable strengths, but is not dominant across every measure.<\/p>\n<!-- \/wp:paragraph -->\n\n<!-- wp:heading -->\n<h2 class=\"wp-block-heading\">When will ordinary users get access?<\/h2>\n<!-- \/wp:heading -->\n\n<!-- wp:paragraph -->\n<p>Google said Gemini 4 Argon is initially available to trusted cybersecurity teams selected under the Fairwind program. Google plans to expand access to paying API customers and Google AI Ultra subscribers later, but gave no date for broad public availability.<\/p>\n<!-- \/wp:paragraph -->\n\n<!-- wp:image {\"id\":980974,\"sizeSlug\":\"large\",\"linkDestination\":\"media\",\"align\":\"center\"} -->\n<figure class=\"wp-block-image aligncenter size-large\"><a href=\"https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-fairwind-access-860x570-1.jpg\" rel=\"attachment wp-att-980974\"><img src=\"https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-fairwind-access-860x570-1.jpg\" alt=\"Graphic indicating Gemini 4 Argon is first rolled out to trusted security teams under Fairwind\" class=\"wp-image-980974\"\/><\/a><figcaption class=\"wp-element-caption\">Gemini 4 Argon is being rolled out first to selected cybersecurity personnel under the Fairwind program. Source: Google DeepMind<\/figcaption><\/figure>\n<!-- \/wp:image -->\n\n<!-- wp:paragraph -->\n<p>That staged rollout means most consumers cannot yet try Gemini 4 Argon themselves, so early impressions will rely on published scores and partner case studies rather than hands-on comparisons, Google said.<\/p>\n<!-- \/wp:paragraph -->\n\n<!-- wp:heading -->\n<h2 class=\"wp-block-heading\">API pricing and what it means for developers<\/h2>\n<!-- \/wp:heading -->\n\n<!-- wp:paragraph -->\n<p>Google listed introductory API prices: <strong>$2 per million input tokens and $10 per million output tokens<\/strong> during the promotional period, and $4 and $20 respectively after the promotion ends, Google said. The company did not specify when the promotional period ends.<\/p>\n<!-- \/wp:paragraph -->\n\n<!-- wp:paragraph -->\n<p>Those rates mean a sustained heavy workload using Gemini 4 Argon could become costly for teams that generate very large outputs. Google positioned Argon for lengthy code tasks and multi-step research, and the pricing reflects that target use case, Google said.<\/p>\n<!-- \/wp:paragraph -->\n\n<!-- wp:heading -->\n<h2 class=\"wp-block-heading\">Google DeepMind\u2019s 19-test comparison<\/h2>\n<!-- \/wp:heading -->\n\n<!-- wp:paragraph -->\n<p>The following summary is based on a Google DeepMind chart comparing Gemini 4 Argon with peer models across 19 tasks. In that chart, green shading marks the top score in each task, and \"not listed\" means the table did not report a particular model\u2019s number, Google DeepMind said.<\/p>\n<!-- \/wp:paragraph -->\n\n<!-- wp:image {\"id\":980975,\"sizeSlug\":\"large\",\"linkDestination\":\"media\",\"align\":\"center\"} -->\n<figure class=\"wp-block-image aligncenter size-large\"><a href=\"https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-benchmark-comparison-860x570-1.jpg\" rel=\"attachment wp-att-980975\"><img src=\"https:\/\/ztylezman.com\/wp-content\/uploads\/2026\/10\/ztylezman.com_gemini-4-argon-benchmark-comparison-860x570-1.jpg\" alt=\"Bar chart comparing Gemini 4 Argon, GPT-6 Astra and Claude Opus 5.5 across multiple AI tests\" class=\"wp-image-980975\"\/><\/a><figcaption class=\"wp-element-caption\">Gemini 4 Argon leads on several tests, while GPT-6 Astra scores higher on FrontierSWE v2, and CWE-bench v1 is a tie. Source: Google DeepMind<\/figcaption><\/figure>\n<!-- \/wp:image -->\n\n<!-- wp:html -->\n<div style=\"overflow-x:auto;-webkit-overflow-scrolling:touch;\">\n<table style=\"border-collapse:collapse;min-width:780px;width:100%;\">\n<caption style=\"text-align:left;padding:10px 0;\">Gemini 4 Argon \u8207\u4e09\u6b3e\u6a21\u578b\u8dd1\u5206\u6bd4\u8f03\uff0c\u8cc7\u6599\u4f86\u6e90\uff1aGoogle DeepMind<\/caption>\n<thead>\n<tr>\n<th scope=\"col\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u7bc4\u7587<\/th>\n<th scope=\"col\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u6e2c\u8a66\u9805\u76ee<\/th>\n<th scope=\"col\" style=\"border:1px solid #ddd;padding:8px;text-align:right;\">Gemini 4 Argon<\/th>\n<th scope=\"col\" style=\"border:1px solid #ddd;padding:8px;text-align:right;\">GPT-6 Astra<\/th>\n<th scope=\"col\" style=\"border:1px solid #ddd;padding:8px;text-align:right;\">Claude Fable 5.1<\/th>\n<th scope=\"col\" style=\"border:1px solid #ddd;padding:8px;text-align:right;\">Claude Opus 5.5<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u5c08\u696d\u5de5\u4f5c<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">Vals Index<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>68.9%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">63.1%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">65.8%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">67.0%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u5c08\u696d\u5de5\u4f5c<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">AutomationBench\uff08\u5206\u6578\uff09<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>51.3%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">41.4%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">31.4%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">42.5%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u5c08\u696d\u5de5\u4f5c<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">Vals Finance Agent v2<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>65.4%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">53.5%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">58.9%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">58.6%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u5c08\u696d\u5de5\u4f5c<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">Harvey's Legal Agent Benchmark<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>19.6%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">5.4%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">6.7%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">3.8%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u7a0b\u5f0f\u958b\u767c<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">DeepSWE v1.1<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>77.9%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">74.1%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">67.4%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">74.2%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u7a0b\u5f0f\u958b\u767c<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">FrontierSWE v2<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">55.0%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>65.5%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">56.3%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">62.3%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u7a0b\u5f0f\u958b\u767c<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">Vibe Code Bench<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>91.9%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">89.6%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">90.3%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">90.3%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u7a0b\u5f0f\u958b\u767c<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">Terminal-bench 4.0<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">57.4%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">58.2%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">57.9%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>66.4%<\/strong><\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u6a5f\u5668\u5b78\u7fd2\u5de5\u7a0b<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">PostTrainBench<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">45.3%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">44.3%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">40.2%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>49.3%<\/strong><\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u79d1\u5b78\u53ca\u6578\u5b78<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">Terminal-Bench Science 0.1<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">57.6%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>68.1%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">52.6%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">63.3%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u79d1\u5b78\u53ca\u6578\u5b78<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">LABBench 2<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>88.8%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">85.4%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">68.6%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">73.1%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u79d1\u5b78\u53ca\u6578\u5b78<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">RiemannBench<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>76.0%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">72.0%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">65.6%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">69.6%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u9577\u7bc7\u5167\u5bb9\u7406\u89e3<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">GraphWalks\uff08\u6700\u591a 12.8 \u842c Token\uff09<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>99.7%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">98.7%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">91.4%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">90.6%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u9577\u7bc7\u5167\u5bb9\u7406\u89e3<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">GraphWalks\uff0825.6 \u842c\u81f3 100 \u842c Token\uff09<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>84.2%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">71.8%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">65.0%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">66.8%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u96fb\u8166\u64cd\u4f5c<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">Agent's Last Exam\uff08\u901a\u904e\u7387\uff09<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>39.5%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">34.2%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">\u672a\u5217\u51fa<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">38.2%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u96fb\u8166\u64cd\u4f5c<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">OSWorld-2.0\uff08\u96e2\u7dda\u6e2c\u8a66\u90e8\u5206\u5f97\u5206\uff09<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">69.2%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>72.6%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">\u672a\u5217\u51fa<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">\u672a\u5217\u51fa<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u5716\u50cf\u53ca\u5f71\u7247\u7406\u89e3<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">Chartography<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>71.6%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">71.0%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">46.2%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">66.3%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u5716\u50cf\u53ca\u5f71\u7247\u7406\u89e3<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">LVBench<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>91.7%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">87.5%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">79.7%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">83.7%<\/td>\n<\/tr>\n<tr>\n<th scope=\"row\" style=\"border:1px solid #ddd;padding:8px;text-align:left;\">\u7db2\u7d61\u4fdd\u5b89<\/th>\n<td style=\"border:1px solid #ddd;padding:8px;\">CWE-bench v1<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>68.0%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;background-color:#d9f4dd;\"><strong>68.0%<\/strong><\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">58.0%<\/td>\n<td style=\"border:1px solid #ddd;padding:8px;text-align:right;\">67.0%<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<\/div>\n<!-- \/wp:html -->\n\n<!-- wp:paragraph -->\n<p><small>Note: The above summary follows Google DeepMind's published comparisons for 19 tasks. Some Argon results were computed by Google DeepMind, and other models\u2019 figures may come from public leaderboards or vendor reports. Test settings vary by task; see Google DeepMind's official evaluation methodology for details: <a href=\"https:\/\/deepmind.google\/models\/evals-methodology\/gemini-4-argon\/\" target=\"_blank\" rel=\"noopener noreferrer\">https:\/\/deepmind.google\/models\/evals-methodology\/gemini-4-argon\/<\/a>.<\/small><\/p>\n<!-- \/wp:paragraph -->\n\n<!-- wp:paragraph -->\n<p><\/p>\n<!-- \/wp:paragraph -->","_links":{"self":[{"href":"https:\/\/ztylezman.com\/en\/wp-json\/wp\/v2\/posts\/981002","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/ztylezman.com\/en\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/ztylezman.com\/en\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/ztylezman.com\/en\/wp-json\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/ztylezman.com\/en\/wp-json\/wp\/v2\/comments?post=981002"}],"version-history":[{"count":1,"href":"https:\/\/ztylezman.com\/en\/wp-json\/wp\/v2\/posts\/981002\/revisions"}],"predecessor-version":[{"id":981003,"href":"https:\/\/ztylezman.com\/en\/wp-json\/wp\/v2\/posts\/981002\/revisions\/981003"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/ztylezman.com\/en\/wp-json\/wp\/v2\/media\/980972"}],"wp:attachment":[{"href":"https:\/\/ztylezman.com\/en\/wp-json\/wp\/v2\/media?parent=981002"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/ztylezman.com\/en\/wp-json\/wp\/v2\/categories?post=981002"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/ztylezman.com\/en\/wp-json\/wp\/v2\/tags?post=981002"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}