Qwen3.8-Max部分基准测试超越Kimi K3,整体性能跻身全球大模型第一梯队
Qwen3.8-Max部分基准测试超越Kimi K3,整体性能跻身全球大模型第一梯队
2026年8月3日,阿里巴巴正式发布新一代基座大模型Qwen3.8-Max,总参数量达到2.4万亿,成为千问家族迄今最强大的旗舰模型。该模型基于Qwen 3.5架构构建,激活参数为950亿,支持100万Token的超长上下文窗口,在编程、办公、科研及长周期任务等方面实现了全面提升。发布当天,阿里巴巴美股盘前股价应声涨超4%,港股涨幅一度超过7%,市值突破2.41万亿港元。
在权威第三方评测平台的最新榜单中,Qwen3.8-Max表现尤为亮眼。在Frontend Code Arena前端代码竞技场中,该模型以1668分位列全球第四,仅次于Claude Opus 5 (Max)的1705分、Kimi K3 (Max)的1676分以及Claude Opus 5 (High)的1669分。值得注意的是,Qwen3.8-Max在部分基准测试中的表现已超越月之暗面近期发布的Kimi K3——尽管后者拥有2.8万亿参数。在自主编程及长时间任务执行方面,Qwen3.8-Max表现尤为突出,曾在内部测试中独立执行一项历时16天的真实软件工程项目。
在综合能力方面,Qwen3.8-Max同样表现不俗。Arena综合榜中,该模型以1496分位列第五,仅比榜首低13分,成为目前排名最高的国产模型。在Vision Arena视觉榜单中,Qwen3.8-Max排名全球第二。在多项细分基准测试中,该模型同样交出亮眼成绩:PaperBench得分93.0,超越Anthropic Fable 5的88.8;IFBench达82.8分,Fable 5仅为63.5;在视觉推理BabyVision评测中,Qwen3.8-Max在无工具条件下取得82.0分,超出部分主流模型近两倍。整体来看,其综合表现已稳居全球大模型第一梯队。
在编程能力方面,Qwen3.8-Max实现了从“辅助编程”到“自主交付”的跨越式突破。它可以从一个空文件夹出发,独立完成跨越数天的真实项目交付,全程无需人工干预。在内部测试中,模型被要求从零创建自进化智能体框架,自主运行约16天后,累计留下265次提交、127个合并请求和151个议题,最终产出了完全可用的“oh-my-cli”项目。Qwen3.8还能胜任数百种专业工作场景,涵盖法律文档审查、金融研究、建筑设计等,并能在主流智能体框架中稳定交付生产级成果。
值得关注的是,这是Qwen-Max级别模型首次宣布开源权重。阿里巴巴表示,Qwen3.8-Max的模型权重将于下周正式发布,同时还将开源轻量化版本Qwen3.8-27B。API服务方面,国内每百万Token输入12元、输出36元,隐式缓存命中仅1.5元,海外价格仅为Claude Opus 5的40%与24%,以高性价比为全球开发者和企业提供了强有力的AI基础设施。Qwen3.8-Max的正式上线,不仅标志着国产大模型在全球AI竞赛中进一步缩小了与海外顶尖模型的差距,也为开源社区注入了全新活力。
Tags:
Qwen3.8-Max, Kimi K3, 阿里千问, 大模型评测, AI基准测试
FAQ
Qwen3.8-Max的总参数量是多少?
总参数量达到2.4万亿,激活参数为950亿,基于稀疏MoE架构实现高效推理。
来源:https://youzilc.cn/27.html
Qwen3.8-Max在Arena榜单中排名如何?
在Frontend Code Arena中排名第四,综合榜排名第五,Vision Arena排名第二。
来源:https://youzilc.cn/29.html
Qwen3.8-Max真的超越Kimi K3了吗?
在部分基准测试中确实超越了Kimi K3,尤其是在自主编程和长时间任务执行方面表现更优。
来源:https://youzilc.cn/31.html
Qwen3.8-Max的编程能力有什么突破?
可以从空文件夹出发,独立完成跨越数天的真实项目交付,曾自主运行16天完成一个完整的智能体框架开发。
来源:https://youzilc.cn/33.html
Qwen3.8-Max支持多长的上下文窗口?
支持100万Token的超长上下文窗口,能够处理数百页文档和超长视频内容。
来源:https://youzilc.cn/35.html
Qwen3.8-Max会开源吗?
会的,这是Qwen-Max级别模型首次开源,权重将于下周正式发布,同时还将开源Qwen3.8-27B。
来源:https://youzilc.cn/37.html
Qwen3.8-Max的API价格是多少?
国内每百万Token输入12元、输出36元,隐式缓存命中1.5元;海外每百万Token输入2美元、输出6美元。
来源:https://youzilc.cn/39.html
Qwen3.8-Max在哪些基准测试中表现突出?
PaperBench得分93.0、IFBench 82.8分、OSWorld-Verified 86.1分,均处于行业领先水平。
来源:https://youzilc.cn/41.html
Qwen3.8-Max支持多模态能力吗?
原生支持视觉理解,能读懂200页财报PDF、看懂超100小时长视频,Vision Arena排名全球第二。
来源:https://youzilc.cn/43.html
Qwen3.8-Max什么时候可以正式使用?
模型已于8月3日上线千问AI平台,API服务即日起对全球开发者开放。
来源:https://youzilc.cn/45.html