Qwen3.8-Max 一发布,Qoder 顺手送 2,800 次免费调用 封面

Qwen3.8-Max 一发布,Qoder 顺手送 2,800 次免费调用

Qoder 1 周年送福利:2800 次免费Qwen3.8-Max调用,非高峰再叠 50% 折扣。

Qwen3.8-Max 一发布,Frontend Code Arena 的榜首就从 Claude 系手里裂了条缝。1668 分排第 4,跟第 1 的 Claude Opus 5 (Max) 差不到 40 分;Kimi K3 和 Claude Opus 5 (High) 卡在它前面,差距都在 10 分以内。

(截止发文,2026 年 8 月)

Frontend Code Arena 排行榜,Qwen3.8-Max 第 4

先说清楚,这是个什么模型

总参 2.4T,稀疏 MoE + 混合注意力,激活 95B,上下文 1M。阿里这次不跟你聊聊天,聊的是"干活":从一个空文件夹出发,10 天自我演化出一个能跑的真实项目;芯片设计优化连跑 500+ 轮;电商策略规划铺满 365 天。视觉不是外挂,是规划—执行—自我修正的反馈环。下周 Qwen3.8-Max 和 27B 都会开源。

Qwen 官方发布推文:2.4T 参数、下周开放权重、能力主打

跑分:编程和视觉是真强,长时程还得等复现

官方一图流在 16 项里拿了 9 个 SOTA。最硬的在两块:编程(SWE-Pro 67.7、Terminal-Bench 86.6、PaperBench 93.0,较上代 +28.2)和视觉推理(CharXiv 93.5、BabyVision 82.0 无工具、OSWorld 86.1 电脑操作第一)。Agent 长时程那几项(JobBench、CoWorkBench、Agents' Last Exam)也压在 Claude Opus 5 头上。

但要注意两点,别当真:一是这些全是阿里自测,没公开方法论,Artificial Analysis 和 LMArena 的独立复现还没出来;二是"10 天自主编程""365 天策略"这类长时程声称,目前只能看官方演示,社区复现不了。"逼近 Fable 5"这句 slogan,到现在也没被第三方证实。

Qwen3.8-Max 官方 benchmark 一图流:16 项 9 个 SOTA

从 preview 到正式版,补的是稳定性

7 月 WAIC 先放的 preview 版,第三方 xbench 平均分只有 68.0,比上代 Qwen3.7-max 的 70.8 还低——典型的"上限高、均分落"。独立架构评估里它 80/100,略输 Kimi K3 的 83,不过 44 次工具调用零失败,agent 可靠性其实不错。

正式版主要把这两块补了:视觉 BabyVision 从 64.95% 跳到 82.0%;把 preview 的波动压下去,换成一图流里的一串 SOTA。arena 也从社区偷偷追踪的"frontier range",变成今天明牌的第 4。

价格:国内 ¥12/M,国际是 Opus5 的 4 折

国内千问平台:输入 ¥12、输出 ¥36、缓存命中 ¥1.5(每百万 tokens)。国际价 $2/$6,只有 Claude Opus 5 的 40% 和 24%。闭源 API 卷到这个价,Anthropic 真该重新算账了。

当然,¥36 的输出价比 Kimi K3(约 ¥11/M)还是贵三倍——国产模型内部,价格差也已经拉开了。

顺手薅:Qoder 送 2,800 次免费调用

Qwen3.8-Max 上线当天,阿里自家 AI 编程 IDE Qoder 借着 1 周年送福利:2,800 次免费调用,非高峰再叠 50% 折扣。更新 Qoder → 使用面板领取 → 直接拿 Qwen3.8-Max 跑代码。链接:https://docs.qoder.com/events/qwen-max

Qoder 官方推文:Qwen3.8-Max 上线 + 2800 次免费调用 + 50% 折扣

收尾

2.4T 参数、arena 第 4、国内 ¥12/M、下周开源——阿里一次把四张牌摊开。从 preview 的"信号"到正式版的"分数",补得不算慢。但我更在意下周:27B 开源后,社区能不能把"10 天自我演化"复现出来。开源接不接得住闭源,才是这波的真问题。

关注智纪探索,给你带来最新 AI 资讯和 Agent 使用技能。