DefiRWA

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 16|回复: 0

Qwen3.8-27B:262K上下文,DeepSWE得分42.2

[复制链接]

1190

主题

1201

帖子

4006

积分

版主

Rank: 7Rank: 7Rank: 7

积分
4006
发表于 2026-8-15 08:31:58 | 显示全部楼层 |阅读模式
8月,阿里 Qwen 团队开放 Qwen3.8-27B 权重。它是 27B 参数的稠密多模态模型,目标是让开发者在一台高性能工作站或服务器上部署更强的编码和 Agent 模型。模型支持文本、图像和视频输入,原生上下文为 262,144 个 Token,托管服务可扩展到 100 万 Token。


一、模型卡给出的关键数据

在 Qwen 官方模型卡中,Qwen3.8-27B 的 SWE-bench Pro 得分为 61.7,DeepSWE v1.1 为 42.2,QwenSWEBench 为 79.0,CoWorkBench 为 70.7,LiveCodeBench v6 为 90.3;OSWorld-Verified 为 84.3,WebArena-Verified 为 64.8,Vision2Web 为 62.9。相比上一代 27B 模型,DeepSWE 提升尤其明显,但不同基准的定义、工具和运行方式并不相同,不能把这些分数直接等同于真实项目交付率。

Qwen3.8-27B 还支持 reasoning_effort 调节。官方特别提醒,长流程 Agent 任务中,降低思考强度不一定缩短总耗时,因为分析不足可能带来更多重试,反而增加延迟和 Token 消耗。这一点对本地部署很重要:用户同时承担电费、硬盘和内存成本,不能只比较模型参数大小。


二、262K 上下文怎么用更实际

262K 足以放入大型代码仓库说明、接口文档和多轮操作记录,但不等于每次都要塞入全部历史。官方的 YaRN 方案可扩展到 1M,不过静态 YaRN 可能影响短文本表现,建议只在长文档、长视频或超长代码库中启用。更稳妥的是把日志、依赖清单和测试报告分块检索,让模型先看摘要,再定位具体文件。


三、本地 Agent 的落地建议

第一,先用 BF16 或受信任的量化版本建立基线,记录显存、内存、首 Token 延迟和连续任务成功率。第二,保留隔离的代码沙箱,禁止模型直接读取云密钥或修改生产权限。第三,把终端、浏览器、文件编辑拆成可审计的工具调用,每次都输出变更摘要和测试结果。第四,视觉能力只在截图、图表和视频任务中启用,文本任务不要为了“多模态”而增加复杂度。

Qwen3.8-27B 的意义不在于取代云端最强模型,而在于把较强的编程、多模态和 Agent 能力带到本地。它更适合作为数据不出域、任务可重复、预算可预测的工程底座;真正决定效果的,仍是工具权限、长任务管理和回归测试。

数据来源:Qwen 官方 Hugging Face 模型卡《Qwen3.8-27B》,2026年8月;Qwen 官方模型卡中列出的基准结果(数据为发布时点)。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

QQ|货物清仓|Archiver|手机版|小黑屋|倒数|舒尔特|好邻卡|RWA+DeFi|融资计划|内购渠道|Github|Web4

GMT+8, 2026-9-5 11:00 , Processed in 0.073470 second(s), 20 queries .

Powered by Discuz! X3.4

Copyright © 2001-2023, Tencent Cloud.