首页 > 生活分享 > 免费教学 > 阿里首个万亿参数模型屠榜SOTA,碾压DeepSeek V3.1

阿里首个万亿参数模型屠榜SOTA,碾压DeepSeek V3.1

发布时间:2025-09-06 22:06:13

阿里迄今为止,参数最大的模型诞生了!

昨夜,Qwen3-Max-Preview(Instruct)官宣上线,超1万亿参数性能爆表。

直接用成绩说话——

在全球主流权威基准测试中,Qwen3-Max-Preview狂揽非推理模型「C」位,直接碾压Claude-Opus 4(Non-Thinking)、Kimi-K2、DeepSeek-V3.1。

甚至,它把自家Qwen3-235B-A22B-Instruct-2507狂甩身后,堪称「AI卷王本王」。

· 知识推理评测(SuperGPQA)拿下64.6分

· 数学推理评测(AIME25)拿下80.6分,断崖式领先

· 竞争性编程评测(LiveCodeBench V6)拿下57.5分

· 复杂问题解决和人类偏好对齐评测(Arena-Hard v2)拿下86.1分,优势巨大

· 被称为「无法被操控的」评测(LiveBench)拿下79.3分

惊艳的性能表现再次证明了,Scaling仍然有效,参数越大模型性能越强。

总的来说,Qwen3-Max-Preview有以下几大亮点:性能更强、知识更广、更擅长对话、任务处理、指令遵循。

新模型可支持100+语言,还针对RAG、工具调用进行优化。

模型一出,全网立即开始了实测。

@karminski-牙医实测中,Qwen3-Max-Preview前端能力明显超越DeepSeek-V3.1。

比如,在一个杯子流体模拟中,Gemini 2.5在倾倒前杯子底部有严重bug,DeepSeek-V3.1杯子中物体倒出的状态(最后有一条线)不对,而Qwen3-Max-Preview比较符合物理常识。

Qwen3-Max-Preview还能完美生成一个骑自行车的鹈鹕SVG、一键直出精美前端网页,一张照片做出像素花园。

目前,模型已正式上线阿里云百炼平台,可通过API直接调用。同时,Qwen Chat也同步上线新模型,支持免费使用。

在百炼平台上,最大支持256k上下文,依token数阶梯计费:

· 0-32k token:输入0.006元/千token;输出0.024元/千token

· 32k-128k token:输入0.01元/千token;输出0.04元/千token

· 128k-252k token:输入0.015元/千token;输出0.06元/千token

免费教学更多>>

特斯拉Robotaxi车队规模达200辆 全新奔驰S级即将发布,CEO称其为车型历史上最大更新之一 重庆国资出手,入股一家做“机器人大脑”的公司 美国多家汽车经销商完成所有权变更 涉及八州十余宗交易 不占领市场,却要占领“生态位”:雷诺的中国新活法 小米前高管创业,获高瓴、智元等数千万投融 马自达押油电混动:下一代纯电推迟至2029年 2025越南车市大反转,“丰田们”的时代变了 特斯拉凭借激进定价策略巩固韩国电动汽车市场领先地位 上市即爆款!全面升级的荣耀Power 2销量不俗,10080mAh+240万跑分 微信等APP狂吃手机存储:1TB份额占比翻倍 64GB要绝迹了 2026,不犯错,就是车企最大的赢面 iPhone阵容调整,库克卸任倒计时 一心当网红的魏建军,长城汽车面对仅132万辆的年销量,犯愁了没? “撞名”蔚来?星途全新系列亮相 加95号省油?实测打脸:油耗更高,钱包更瘪! 量产大灯上身,“新世代”X5呼之欲出 人形机器人概念刺激汽车行业 目标320万辆,奇 瑞今年开始“求稳” 零跑新车A10预告图公布 广汽与阿里云将在全栈AI领域展开合作 宇树科技公布机器人交互控制新专利 阿里独家掷投,原力灵机再获数亿元融资 曝安世半导体客户正商谈应对方案,以规避中欧芯片争端影响 亏损2.068亿美元,法拉第未来发布2025年Q3财报 特斯拉上海超级工厂第500万个电池包下线 2025年1-9月ADAS供应商装机量排行榜:多强竞争、自主供应商强势突围 比亚迪领跑东南亚、吉利奇 瑞深耕独联体市场丨2025年9月,中国车企出口新动态 北京人形机器人创新中心XR-1模型通过具身智能国标 北汽极狐全新MPV亮相,全新设计风格,外观很霸气,侧滑门