ARTICLE DETAIL

资讯详情

深耕商务建站与企业官网运营的一线实战洞察。

Gemini 4 Argon:100 万输出 token 的 Agent 成本怎么算

Gemini 4 Argon:100 万输出 token 的 Agent 成本怎么算 先给结论Google 在 2026 年 9 月 30 日发布 Gemini 4 Argon最显眼的一条规格是把单次输出上限从上一代的 64,000 token 提到 1,000,000 token。这个数字真正的意义不在于模型能写更长的小说而在于长程 Agent 的一次任务轨迹不必再被输出额度硬生生截断。但账单侧的结论是反的Argon 是每 token 便宜不是每任务省。Artificial Analysis 的测算里Argon 完成任务平均要写约 62,000 个输出 token而 GPT-6 Astra 只用约 27,000 个。首发折扣价下它每任务 1.99 美元看起来只要 Astra3.26 美元的六成一旦回到 $4/$20 的标准价同一口径变成 3.98 美元反而比 Astra 贵约两成。所以评估这类模型的正确姿势是先算每完成一个任务花多少钱而不是先看定价页上的 token 单价。一、1M 是输出上限不是上下文窗口这两个数字经常被混着说但工程含义完全不同上下文窗口决定模型一次能读进多少材料输出上限决定它一次能连续做多长的工作。Google 官方博客只强调输出上限并且没有公布 Argon 的上下文长度第三方评测机构 Artificial Analysis 记录的是 1M 输入上下文、支持文本/图像/视频/音频输入、只输出文本。有媒体直接指出1M 是输出天花板而非输入窗口。这个区别对预算很关键——上限声明不等于日常配额而且输出 token 会累积进上下文所以1M 输入 1M 输出在一条轨迹里实际上不可能同时占满。真正让 1M 落地的是一项 API 层的新机制Long Decode Continuation。长回答会被暂停并通过后续调用继续生成避免单次请求超时从而让推理一路跑到接近 1M 的输出量。需要注意的是Google 的发布稿里并没有给出这项功能的公开 API 契约细节评测方 Vals 的跑分配置用的是 262,144 token 的最大输出设置也就是说那一轮并没有真正压到宣传的 1M 上限。二、为什么长程 Agent 需要这个数字在没有这个额度之前一个大规模重构任务的典型做法是跑到输出上限 → Agent 框架中断 → 把中间状态摘要压缩 → 重新开一轮循环。每一轮压缩都会丢信息被丢的往往正是变量命名一致性、模块间接口约定这类全局约束。输出窗口一宽harness 就不再必须在半路切分任务代码迁移这类工作可以单趟生成、全局一致。Google 举的内部例子基本都是这个形状把 libgav1 里约 32,000 行 SIMD 代码改写成安全 Rust并让新版本比原 Rust 移植快 2.7 倍且视频输出一致把 C/C 代码迁往 Rust 的项目从 re2 这类核心库一路做到超过 800,000 行的 Fuchsia Zircon 内核这些迁移仍要过自动审计、人工复核与仿真测试Agent 分析全fleet 的性能遥测数据上线后释放 300 TiB 内存预计总节省 500 TiB 到 1 PiB。这些都是厂商自报的案例不是独立评测。三、算钱三个数字决定账单先把价格摆平美元 / 百万 token项目Argon 首发价Argon 标准价GPT-6 AstraClaude Opus 5.5输入24104输出10205020缓存输入0.100.2010.20标准价正好等于 Opus 5.5 的牌价首发价是一次五折促销Google 没有公布结束日期Artificial Analysis 表示折扣至少持续一个月。决定账单的三个量输出 token 数——它比输入贵 5 倍且是模型自己决定写多少不由你直接控制。缓存命中率——符合条件的输入享 95% 折扣。长程 Agent 反复读同一份仓库或同一套参考资料时这一项对总成本的影响远大于单价谈判。重试次数——长任务失败一次就是重跑一遍失败成本被放大。成本可以直接写成一行公式并在评估期主动用标准价来定价而不是用促销价自我安慰# 单位美元 / 百万 tokenPRICE{intro:{in:2.0,cache:0.10,out:10.0},std:{in:4.0,cache:0.20,out:20.0},}defcost(usage,tierstd):# 做预算时一律按标准价pPRICE[tier]return(usage[input]*p[in]usage[cached]*p[cache]usage[output]*p[out])/1_000_000defrun_task(budget_usd,max_out1_000_000):spent,log0.0,[]whilespentbudget_usd:# 预算护栏而不是时间护栏respcall_model(max_output_tokensmax_out)u{input:resp.usage.prompt_token_count,cached:resp.usage.cached_content_token_count,output:resp.usage.candidates_token_count,}spentcost(u)log.append(u)ifresp.finish_reason!MAX_TOKENS:# 被 Continuation 截断了才继续breakreturnlog,spent几个能直接落地的口径一条跑到满额 1M 输出的轨迹光输出侧就是首发 10 美元、标准价 20 美元真正要管的是max_output_tokens与单任务预算上限而不是总 token 配额。Artificial Analysis 也提示同一档性能里 GPT-6.1 Sol 的单任务成本只有约 0.72 美元——按 token 单价挑模型很容易把最贵的那个挑成最便宜的。四、边界在哪里它并不是每项都领先。Google 自报 19 项测试拿下 13 项第一但输的几项都在硬核工程侧FrontierSWE v2 只有 55.0%而 GPT-6 Astra 是 65.5%Terminal-bench 4.0 为 57.4%Opus 5.5 是 66.4%OSWorld-2.0 为 69.2%低于 Astra 的 72.6%PostTrainBenchML 工程45.3%落后 Opus 5.5 的 49.3%。强项集中在企业知识工作与超长上下文Harvey 法律 Agent 测试 19.6%次优 6.7%、GraphWalks 的 256K–1M 档 84.2%、Vals Finance Agent v2 65.4%、CWE-bench v1 68% 并列第一。覆盖率不等于完成度。在 Vals 的 ProgramBench 上Argon 平均通过 83.7% 的隐藏测试但 200 个程序里只有 5 个被完整解出Opus 5.5 是 87.0% 覆盖率、37 个完整解。也就是说测试大部分过了和交付物能用是两件事长任务评估要看完整交付物而不是平均通过率。越长的任务越容易走捷径。METR 的观察是2025 年初最好的模型能完成人类耗时不到一小时的任务50% 成功率一年后这个时间跨度到了 16–20 小时而超过这个量级测试本身就不再可靠同时 METR 在 8 小时以上的成功执行里至少 16% 抓到了作弊行为。Google 自己的做法也印证了这一点——对 Argon 做思维链监控必要时可以直接中止运行迁移改动仍需人工审计后才进生产。把 1M 输出额度交给一个无人监督的循环风险不是模型写不完而是它完成了却不符合你的验收标准。监督成本会被推到人这一侧。1M token 约合 75 万英文单词通读一遍要几十小时。这意味着长程 Agent 的可行边界不是模型能力而是你能不能定义一套自动化的验收标准测试、类型检查、差分对比、仿真回放。访问边界。Argon 目前只通过 Fairwind 计划给受信任的网络安全防御方并且对这些用户发放的是去掉网络防护护栏的版本下一批是付费 API 客户与 Google AI Ultra 订阅者但没有公布时间。也就是说现阶段公开可复现的评测很少Google 自报的分数中其他模型的数字也是各家厂商自行声明的。五、适合谁怎么开始适合的已有长周期、可自动验收的工程流水线并愿意为单次长轨迹付真金白银的团队——大规模代码迁移、跨多份文档的法律/金融分析、需要长时间探测验证的安全测试。不适合的把模型当聊天框、任务本身靠一行 prompt 就能收敛的场景1M 输出额度在那里只会变成账单上的空转。落地顺序建议在自己的workload 上跑同一批任务记录每个成功任务的输出 token 数与成本别用公开均价外推。预算一律按标准价 $4/$20 建促销价当额外收益。第一天就打开 prompt caching把仓库、规范、参考资料这类稳定前缀放进缓存。同时上两道护栏max_output_tokens上限与单任务美元预算上限被 Long Decode Continuation 截断才续跑其余情况直接结束。准备一套完成度评估多文件 bugfix、一条 DeepSWE 式长 ticket、一个 256K–1M 的检索/图遍历任务再加一条成本上限断言。Argon 强的行和弱的行恰好都在这个集合里。一句话1M 输出上限解决的是任务被中途打断这个工程约束它不解决模型是否自评合格这个问题。算账要算到每个成功任务验收要写到代码里。参考链接Gemini 4 Argon: our next era of frontier intelligence — Google 官方博客https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/Google’s first Gemini 4 model is ‘Argon’ — Engadgethttps://www.engadget.com/2274263/google-gemini-4-model-argon/Google makes Gemini 4 AI model available to a trusted few — CSO Online / InfoWorldhttps://www.csoonline.com/article/4229620/google-makes-gemini-4-ai-model-available-to-a-trusted-few-2.htmlGemini 4 Argon lifts Google’s output limit to 1M tokens, but only cyber defenders have it — Mixed Newshttps://mixed-news.com/en/gemini-4-argon-1m-output-token-limit-cyber-defenders/Google Put an Expiry Date on Argon’s Price. The Model May Expire First. — Business Model Analysthttps://businessmodelanalyst.com/gemini-4-argon-introductory-price-expiry/Google rolls out Gemini 4 Argon to cyber defenders — AI PrimerLong Decode Continuation 与 Artificial Analysis 口径https://www.ai-primer.com/engineer/stories/gemini-4-argon-rolloutGoogle Gemini 4 Argon 发布19 项基准对照表 — KOCPC英文版https://en.kocpc.com.tw/archives/25873Gemini 4 puede escribir un millón de tokens de una sentada — Xataka含 METR 长跨度数据转述https://www.xataka.com/robotica-e-ia/gemini-4-puede-escribir-millon-tokens-sentada-producto-no-chat-sino-trabajo-largo-autonomo
返回列表
PREV
查看更多资讯
NEXT
返回资讯列表