TECH
千问 3.5 深度技术解读:原生多模态 Agent 的架构、成本与落地路径
基于阿里官方发布页、模型卡与论文,对 Qwen3.5 系列的模型谱系、关键架构、训练方法、评测结果与工程接入策略做系统拆解。
先说结论
Qwen3.5 这次更像一次体系升级,而不是单点迭代。核心变化不在“参数更大”,而在于把多模态理解、推理模式和工具调用能力放进同一套模型与产品框架中。
对工程团队最直接的价值是三件事:同一套 API 能覆盖更多任务、thinking/non-thinking 可以做分层路由、开源与商业模型有了更清晰的协同空间。对于正在做图文理解、复杂推理和 Agent 编排的团队,这一代值得尽快做基准验证。
发布时间线
先把时间线放在前面,避免混淆。
Qwen 官方博客 Qwen3.5: Towards Native Multimodal Agents 首发时间是 2025-09-23,后续有更新(2025-10-31、2026-01-27)。
到 2026-02-16,阿里云 Model Studio 文档已明确 qwen-plus 升级到 qwen3.5-plus(qwen-plus-latest 自动指向新版本)。2026-02-17,Hugging Face Qwen3.5-397B-A17B 模型卡更新了架构和基准细节。
三条信息合起来看,这次发布不是一次性公告,而是模型、云端产品和开源信息同步推进。
四个关键变化
1) 多模态与 Agent 能力从“外挂”走向“内生”
过去不少方案是“文本主模型 + 视觉模块 + 工具层”分离。Qwen3.5 的方向是把图像、视频、推理和工具能力放在同一体系内。工程上的意义很直接:跨模型桥接逻辑会减少,链路一致性更容易维护。
2) Thinking / Non-thinking 分层可以直接用于生产路由
并非所有请求都需要深度思考。Qwen3.5 提供了天然的双模式:难题走 thinking,常规请求走 non-thinking。这样做能更实际地平衡准确率、时延和成本,而不是把所有请求都交给同一种推理强度。
3) Hidden Layout 路线已经公开落地
Qwen3.5-397B-A17B 模型卡公开了关键参数:总参数约 396.8B,激活参数约 17.4B;共 89 层,其中 28 层全注意力、61 层局部窗口注意力,局部层交替使用 Gated Attention 与 Gated DeltaNet。
这种混排的价值在于:把全局建模能力留在关键层,同时让更多层用高效结构处理长序列,目标是守住长上下文和多模态场景下的效率上限。
4) 产品分层更容易映射业务分层
Max / Plus / Turbo / Coder,加上开源 VL / Omni 路线,基本形成了“高价值在线请求、离线批处理、私有部署”三类场景的选型基础。相比“一个模型覆盖全部任务”,这种分层更符合真实工程治理。
架构拆解
从公开资料看,Qwen3.5 的技术路线有三个值得注意的点。
第一,输入组织层面强调 2D-MRoPE、动态像素分配(DPA)与动态 FPS 视频采样。它的重点不是把视觉 token 简单拼进文本窗口,而是先把多模态序列组织好。
第二,训练顺序(官方博客披露)是:文本底座预训练与文本 SFT -> 图文联合训练 -> 长链推理强化 -> 工具使用强化。这个顺序本质上是先稳住通用推理,再强化可执行能力。
第三,公开论文脉络(Qwen3 技术报告、Gated DeltaNet、Gated Attention)能解释其架构方向。需要说明的是,截至 2026-02-17,尚未检索到覆盖整个 Qwen3.5 系列的独立 arXiv 总报告。
基准怎么读
模型卡里的几个核心数字是:上下文 262,144 tokens、视觉 token 128K 量级,以及 AIME25 92.9、LiveCodeBench v6 67.0、MMMU-Pro 74.1、BFCL v3 70.8。
这些分数适合做候选模型初筛,但不建议直接当作最终决策依据。真实收益仍取决于任务分布、容错要求、工具链复杂度和预算上限。跨模型比较时,评测口径与接口限制也需要单独核对。
价格与接入
按 2026-02-17 查到的阿里云 Model Studio 文档,qwen3.5-plus 关键价格口径如下:
| 项目 | 价格 |
|---|---|
| 输入(缓存未命中,<=128K) | 0.80 元/百万 tokens |
| 输入(缓存未命中,>128K) | 2.40 元/百万 tokens |
| 输入(缓存命中,<=128K) | 0.20 元/百万 tokens |
| 输入(缓存命中,>128K) | 0.60 元/百万 tokens |
| 输出(non-thinking) | 8.00 元/百万 tokens |
| 输出(thinking) | 16.00 元/百万 tokens |
最大上下文 131,072,最大输出 65,536。
落地时可优先采用这条策略:默认 non-thinking 保证吞吐与时延;高难推理或工具规划失败重试时切 thinking;把缓存命中率与上下文裁剪作为核心降本抓手。
落地建议
适合现在推进试点的团队,通常具备这些条件:已经在跑多模态或工具调用链路、具备模型路由能力、能够并行维护闭源 API 与开源模型栈。
建议暂缓全面接入的场景也比较明确:仍处于单轮问答阶段、缺少任务级评测闭环、没有 token 治理和缓存策略。这个阶段直接上长上下文重负载,成本与稳定性风险都偏高。
取证方式
本文仅使用官方一手资料:Qwen 博客、阿里云文档、Hugging Face 模型卡和相关论文页面,未使用二手转述。
同时需要强调:截至 2026-02-17,尚未检索到覆盖整个 Qwen3.5 家族的独立 arXiv 总报告。文中关于架构路线的判断,主要基于模型卡和公开论文链路,因此涉及跨模型领先性的结论,仍建议在自有任务集上复验。
一手来源
- Qwen 官方博客:https://qwen.ai/blog/qwen3.5
- 阿里云 Model Studio(Qwen-Plus / Qwen3.5-Plus):https://www.alibabacloud.com/help/en/model-studio/getting-started/models
- Hugging Face 官方模型卡(Qwen3.5-397B-A17B):https://huggingface.co/Qwen/Qwen3.5-397B-A17B
- Qwen3 技术报告(arXiv:2505.09388):https://arxiv.org/abs/2505.09388
- Gated Delta Networks(arXiv:2412.06464):https://arxiv.org/abs/2412.06464
- Gated Attention for LLMs(arXiv:2505.06708):https://arxiv.org/abs/2505.06708
评论