华潮新闻网
科技

阿里巴巴发布千问3.8-MAX 2.4万亿参数模型 性能比肩Anthropic Fable5

来源:华潮新闻网
阿里巴巴发布千问3.8-MAX 2.4万亿参数模型 性能比肩Anthropic Fable5

8月3日,阿里巴巴旗下千问团队正式推出千问3.8-Max。这款模型总参数量达2.4万亿,激活参数为95B,是千问家族至今规模最大、能力最强的成员。这也是千问首次将Max级别模型开源,其权重将于下周在Hugging Face和ModelScope等开源社区发布。

定价策略方面,通过阿里云旗下的千问AI平台调用API:输入成本为2.0美元/百万tokens,输出6.0美元/百万tokens,隐式缓存费用为0.25美元/百万tokens。

基准测试数据显示,千问3.8-Max在编程智能体和通用智能体等多项指标上,与Anthropic Fable5表现相当,部分领域甚至实现超越。具体来看,PaperBench得分93.0,高于Fable5的88.8;CoWorkBench得分74.8,与Fable5的75.9十分接近;WideSearch得分81.9,与Fable5的81.2持平。

性能层面,千问3.8-Max在多项核心指标上与Claude Fable 5持平或胜出。多模态表现同样亮眼。需注意的是,千问团队在注释中指出,Fable 5的部分结果可能包含回退机制。

**编程能力:从空文件夹到生产级交付**

千问团队选取三个真实案例,测试了该模型的自主编程能力,全程无需人工介入。

案例一:十天级自动编程。模型从零构建oh-my-cli项目,自主运行约16天,累计完成265次commits、127个PR及151个issues。它将用户反馈、社区实践与自测结果统一纳入工程循环,实现了需求自动领取、代码生成、测试验证的完整闭环。

案例二:复现并超越论文。模型独立工作约125小时,编写约7,600行代码,执行超过1,100步操作,进行33轮GPU训练,完整复现了《Unified Data Selection for LLM Reasoning》论文的六项主要结论。随后进入“自我进化”阶段,提出并测试18种改进方案,最终在竞赛级数学基准AIME24上,比原方法再提升2.7分。

案例三:24小时击败87%人类队伍。模型参加WWW2025多模态对话意图识别挑战赛,在526支人类队伍中,经45次提交迭代,准确率从0.60升至0.853,成功击败458支队伍。

**办公与长程任务:数百职业场景的生产级验证**

千问团队在数百种高价值职业场景中,测试了千问3.8-Max的实际交付能力。

在E-Commerce Bench(365天电商经营模拟基准)中,千问3.8-Max以¥416,252(4.16倍回报)胜出,领先第二名GLM 5.2达38%,较上一代千问3.7-Max提升152%。

**芯片设计:500轮交互,面积缩减81%**

在芯片设计优化任务中,千问3.8-Max展示了长程自主规划能力。

任务目标是优化一个G CD/RSA密码硬件加速器的逻辑门数量。模型在无参考设计、无人工干预条件下,历经约500轮交互、71次评估,跨越13个关键里程碑,将初始设计从8,298门优化至678门,在所有参评模型中表现最优。

物理实现层面,芯片面积从106×106 µm²收缩至46×46 µm²,布线长度从33,369 µm降至4,187 µm,并在500 MHz频率下实现时序闭合,整体芯片面积缩减81%。

**多模态能力:视觉贯穿执行全流程**

千问3.8-Max的视觉能力不止于“看懂图片”,而是作为持续反馈回路贯穿任务执行。

模型在执行过程中会持续观察中间产物——检查页面布局、物体方向、动画效果——发现问题后自主定位偏差并修正。千问团队将此定义为“原生视觉反馈回路”。

基准测试方面,千问3.8-Max在OSWorld-Verified得分86.1,超过Fable5的85.0;AndroidWorld得分85.3,接近Fable5的88.8;ParametricCAD Bench得分91.5,超过Fable5的87.5。

为便于开发者接入,千问团队同步推出千问-MM-Plugins,为不同智能体框架提供图像与视频处理、多模态记忆、视觉工具调用等扩展支持。

**开放接入:支持Claude Code、Codex等主流框架**

千问3.8-Max现已通过千问AI平台提供API服务,支持OpenAI兼容协议和Anthropic兼容协议,可直接与Claude Code、Codex、Qoder CLI、千问 Code、OpenClaw等主流开发工具集成。

API支持reasoning_effort参数调节推理深度:xhigh(默认,适合复杂任务)、medium(平衡准确性与速度)、low(优化速度与成本)。

模型权重将于下周在Hugging Face和ModelScope开源,届时千问3.8-27B也将同步开源。

相关推荐