阿里发布Qwen3-Coder:480B MoE编程模型,支持1M上下文与自主Agent编码

7月23日,阿里通义团队正式发布Qwen3-Coder-480B-A35B-Instruct模型。该模型采用480B总参数、35B激活的MoE架构,原生支持256K上下文,可扩展至1M token,在Agentic Coding、Browser-Use、Tool-Use三类基准测试中多项指标达开源SOTA,性能对标Claude Sonnet-4。

模型配套开源CLI工具Qwen Code,支持‘一条命令接管整个代码仓库’,能自主完成需求理解、任务拆解、代码编写、测试执行与缺陷修复全流程。其Agentic Coding能力使模型可调用Git、浏览器、终端等工具,在代码仓库中作为自主Agent行动。

定价方面,每百万Tokens输入与输出价格分别为4元和16元,平均成本为Claude 4的1/3;阿里云百炼平台同步提供128K–1M长上下文五折限时优惠。模型完全开源且允许免费商用。

实测显示,模型可一次性生成符合围棋基本规则(含吃子、禁着点)的对战小游戏,但初始版本缺失胜负判定与倒计时功能;经二次提示后补充局势分析、输赢判断及认输按钮,但未实现‘打劫’等高级规则。在HTML+CSS+SVG梦幻黄网页任务中,模型准确实现径向渐变、粒子漂移、气泡淡入淡出、发光文字及点击交互,但因对‘梦幻’语义理解偏差导致全局模糊。

三体运动任务测试中,模型依据详细Prompt生成实时引力模拟代码,并通过Chrome浏览器工具后台自动验证所有功能项(含重力滑杆、速度倍率、轨迹开关、重置按钮),确认全部满足后进入最终演示。该过程体现其多工具协同与自我验证能力,但在复杂数学建模与实时动画精度上仍存在提升空间。

训练方法上,团队采用Agent RL强化学习,将多轮交互、工具调用与错误处理能力深度集成于模型本体,而非后期插件。预训练使用7.5万亿token数据,其中70%为代码;利用Qwen2.5-Coder清洗低质量代码数据,保障训练质量。后训练阶段引入执行驱动强化学习,针对单测、脚本、小工具等‘难写易验’任务自动生成百万级测试用例,以执行成功率作为奖励信号。

团队构建支持2万个并发编程环境的工业化训练系统,模拟真实CI/CD流程,在SWE-Bench Verified基准中取得开源模型第一。该训练范式显著提升调试能力,使模型具备自我测试与修复能力,降低用户编程经验门槛。

当前AI编程工具普及的核心瓶颈在于调试依赖人工,而Qwen3-Coder通过自主测试闭环缓解该问题。其成本优势叠加开源策略,正推动AI编程从辅助工具向自主Agent跃迁。编程能力被视为AI Agent与物理世界交互的关键底层技术,Qwen3-Coder在性能、成本与开放性三维度重构行业标准。

免责声明:本文内容由开放的智能模型自动生成,仅供参考。

最新文章
Copyright © DoNews 2000-2026 All Rights Reserved
京ICP备2025120072号