游乐游手机版
首页/科技数码/文章详情

32B 模型横扫 SWE 任务,这款代码智能体模型有点东西

时间:2025-07-16 14:02
(PHP中文网报道)2025年不仅是智能体全面爆发的一年,也是AI在软件工程领域开启新纪元的起点。以人工智能为核心的自动化开发正以前所未有的速度重塑传统开发模式。昆仑万维今日正式发

32b 模型横扫 swe 任务,这款代码智能体模型有点东西

(PHP中文网报道)2025年不仅是智能体全面爆发的一年,也是AI在软件工程领域开启新纪元的起点。以人工智能为核心的自动化开发正以前所未有的速度重塑传统开发模式。

昆仑万维今日正式发布全球首个开源代码智能体Skywork-SWE-32B,该模型通过“轻量化参数”实现仓库级别的修复逻辑重构。

这是一场开源生态对抗闭源霸权的重要突破——Skywork-SWE-32B使得企业仅需消费级显卡即可部署AI工程师,大幅降低使用门槛。

在SWE-bench-Verified测试中(基于OpenHands代码辅助平台),该模型将修复准确率提升至47.0%,不仅超越了所有参数规模小于32B的开源模型,更逼近闭源模型Claude v3.7(56.0%)的性能极限。

摆脱闭源限制后,AI的角色也从“辅助工具”跃迁为“协作伙伴”,标志着软件工程真正迈入由智能体驱动的新时代。

目前,开发者已经可以在Hugging Face平台上下载这位“开源工程师”。

技术报告:https://www.php.cn/link/bb8054b490d695da02c573c665824b88

博客地址:https://www.php.cn/link/98be175f18ff12118f056c7e448ade23

模型权重:https://www.php.cn/link/1f3ecb87f576752202975d3e0b868bdc

01

SWE任务:对智能体能力的终极考验

对于有经验的程序员来说,软件工程(Software Engineering, SWE)任务远比一般代码生成更具挑战性。将大型语言模型作为智能体应用于真实软件工程项目,并非只是简单地执行“写代码”的指令。

即便是人类开发者,在面对陌生项目时,首次Bug修复成功率也不足70%。

如今,把一个SWE任务交给智能体模型,就相当于要求一位“AI工程师”在极短时间内快速适应新团队、接手庞大且不熟悉的遗留系统,准确理解一份描述模糊的Bug报告,找出根本问题,设计出符合团队规范且不影响其他功能的修复方案,并一次性提交正确的代码修改。

这样的“AI工程师”堪称稀缺资源。

远超传统代码生成的技术门槛

与传统意义上的代码生成相比,SWE任务对模型能力的要求可谓天差地别。任何一个环节的能力短板,都可能导致智能体在面对复杂工程现实时无从下手。

来源:https://www.php.cn/faq/1391886.html
上一篇日本企业与早稻田大学等机构达成合作,开发纯本土国产人形机器人 下一篇xAI 美国数据中心获得空气排放许可:限制涡轮机运行,减缓当地居民担忧
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
年国家能源局充换电服务业用电量增速48.8%
科技数码 · 2026-06-29

年国家能源局充换电服务业用电量增速48.8%

2025年全社会用电量达103682亿千瓦时,同比增长5 0%。充换电服务业用电增速高达48 8%,信息传输与软件服务业增速17 0%。第三产业和居民用电对增长贡献率合计占一半。中国成为全球首个年度用电量超10 4万亿千瓦时的国家。

追风者 GLACIER ONE 360 S25 液冷散热器新品上市 联体风扇售价429元
科技数码 · 2026-06-29

追风者 GLACIER ONE 360 S25 液冷散热器新品上市 联体风扇售价429元

追风者冰川360S25液冷散热器售价429元,三联一体风扇便捷安装,冷头小体积纯铜底座噪音18dB,风扇转速300-2000RPM、风量75CFM、静压2 96mmAq,五年质保漏液包赔。

三星Galaxy Watch8用户反馈谷歌后台组件异常
科技数码 · 2026-06-29

三星Galaxy Watch8用户反馈谷歌后台组件异常

三星GalaxyWatch8、Watch5Pro、Watch6及Watch7用户反映,GooglePlayServices后台耗电异常,电量占比最高达99 97%,远超正常水平,严重影响续航。目前故障原因不明,谷歌尚未发布官方声明。

罗永浩批苹果iOS 27创新不足 盼新CEO改进
科技数码 · 2026-06-29

罗永浩批苹果iOS 27创新不足 盼新CEO改进

罗永浩批评苹果iOS27创新不足,称仅有双iPhone同号、音量分离等数十项细节改进,认为库克时代缺乏突破性创新,股市虽好但消费者只能被迫接受挤牙膏式升级。

年国产车出口710万辆,两家车企销量破百万
科技数码 · 2026-06-29

年国产车出口710万辆,两家车企销量破百万

2025年国产汽车出口总量达710万辆,同比增长21%。奇瑞以134万辆居首,比亚迪105万辆次之,上汽乘用车出口占比60%最高,长城出口51万辆。吉利、长安等主流品牌同步增长,小鹏、零跑等新兴品牌海外拓展加速。