在 Codex 中,应根据当前上下文的实际 token 用量选择合适模型:≤1200 时使用 gpt-5.4-mini,1201–3800 时使用 gpt-5.5,>3800 时建议先执行 /fork,再切换到 deepseek-coder:33b,同时也可以通过 codex_config.yaml 配置自动路由,实现按上下文长度自动匹配模型。

当你在 Codex 中处理不同类型、不同复杂度的任务时,模型必须与当前上下文长度需求相匹配。比如大型代码重构通常需要更大的上下文窗口,而简单的变量重命名、局部修改则只需轻量模型。如果模型选择不当,不仅会造成 token 浪费,还可能导致响应质量下降,甚至任务执行失败。
判断当前上下文真实长度
首先执行 /status 命令,查看当前会话已经消耗的 token 数量以及剩余可用空间。要注意,这里的数字并不是你输入的字符数,而是 Codex 实际打包进入上下文的全部内容总量,其中包括 AGENTS.md 规则、最近 3 个文件的完整内容、上一轮执行结果,以及工具说明等信息。
接着打开项目根目录下的 【.codexignore】 文件,确认是否已经排除 node_modules、__pycache__、build 等高 token 占用目录。如果这个文件没有正确配置,/status 显示的“剩余空间”很可能会虚高 40% 以上,影响你对模型选择的判断。
然后运行 /compact 强制压缩对话历史。这个操作会丢弃中间推理草稿,仅保留最终结论和关键约束,通常可以立即释放 15%~30% 的上下文空间,有助于提升后续任务的稳定性。
按长度区间选择对应模型
根据 /status 返回的“当前已用 token”数值,可按以下区间直接切换对应模型:
已用 ≤ 1200 tokens → 执行 /model gpt-5.4-mini。该模型上下文窗口为 4096,主要针对短逻辑任务进行优化,具有响应速度快、使用成本低的优势,但不支持跨文件引用,更适合轻量级代码处理场景。
1201~3800 tokens → 执行 /model gpt-5.5。这是 Codex 的默认主力模型,窗口为 200 万 token,不过在实际单次推理时会受到 worktree 隔离限制,稳定可用范围大约为 12 万 token,比较适合模块级重构和中等复杂度开发任务。
一旦已用 token 超过 3800,就不建议继续硬撑当前线程:应先执行 /fork 新建分支,再到新线程中运行 /model deepseek-coder:33b。DeepSeek 最新标称上下文为 128K,但在 Codex 的实际调度环境中,通常较稳定的承载范围在 96K 左右,前提是 base_url 已正确指向本地 Ollama 的 http://localhost:11434/v1。
自动路由配置(永久生效)
编辑 【codex_config.yaml】 文件,在末尾添加 model_routing 规则块:
model_routing:
- context_threshold: 1200
对应的 target_model 设置为 "gpt-5.4-mini"
- context_threshold: 3800
对应的 target_model 切换为 "gpt-5.5"
- context_threshold: 0
默认兜底的 target_model 设置为 "deepseek-coder:33b"
其中,threshold 设置为 0 代表兜底模型,也就是说,只要超过前两档阈值,系统就会自动选择它。需要注意的是,这项配置仅会在新启动的会话中生效,已经存在的会话仍需手动执行 /reload 或直接重启 Codex。
保存后执行 /reload 重新加载配置。之后再次发送指令时,Codex 会在调用模型前自动计算当前上下文长度,并匹配最合适的模型,无需每次手动输入 /model,能够明显提升使用效率与模型调度准确性。
