前缀续写,通俗来说就是基于已给定的文本前缀继续自动生成后续内容;Partial Mode 也是这一机制,会沿着现有前缀自然补全内容,尽可能让模型输出与前文顺畅衔接、语义连贯且不显突兀。详细参考阿里云百炼模型平台官网解读:https://www.aliyun.com/product/bailian

工作原理
启用 Partial Mode 时,核心在于正确配置 messages 数组。你需要将数组最后一条消息的角色设置为 assistant,并在对应的 content 字段中填入希望模型继续补写的前缀文本,同时为这条消息增加 "partial": true 参数。常见的 messages 结构如下所示:
配置完成后,模型就会从指定前缀出发,继续生成后续文本内容。
支持的模型
Qwen-Max 系列Qwen-Plus 系列(非思考模式)Qwen-Flash 系列(非思考模式)Qwen-Coder 系列Qwen-VL 系列 — qwen-vl-max 和 qwen-vl-plus 支持思考模式;qwen3-vl-plus 和 qwen3-vl-flash 仅支持非思考模式Qwen-Turbo 系列(非思考模式)Qwen 开源系列 — Qwen3.5 MoE/dense 模型支持思考模式;Qwen3.5-35B-A3B、Qwen3 和 Qwen3-VL 开源模型仅支持非思考模式需要注意的是,思考模式不支持前缀续写功能。对于支持非思考模式的模型,建议直接使用非思考模式;或者选择本身仅支持非思考模式的模型系列,以确保 Partial Mode 可以正常使用。详细参考阿里云通义大模型官网:https://www.aliyun.com/product/tongyi
