实验 1-1 · 上下文的关键作用

基于真实 API 证据的对照验证 — 5 种上下文配置下的 Agent 解题表现
Experiment: 1-1 证据模式: real_api 模型: deepseek-v4-flash Provider: deepseek 创建: 2026-09-14 23:48 UTC

核心结论速览

任务:将 Q1–Q4 多币种营收统一折算为 USD,求年度总额与季度均值(保留两位小数),强制使用工具观测值、禁止自行估算汇率。
一句话结论:完整上下文(full)下模型准确给出 $9,602,895.73 / $2,400,723.93; 一旦抽掉「历史」或「工具结果」,模型陷入重复调用直至迭代上限仍无终态;抽掉「推理」则精度崩塌(仅报 9.60M); 抽掉「工具定义」模型干脆不动工具、也不编造数字 —— 上下文各组件缺一则系统性失效。
1/5
完全正确的臂 (full)
2/5
卡死无终态 (no_history / no_tool_results)
1/5
退化 (no_reasoning 精度丢失)
0
编造数字 (无臂伪造汇率)

五臂结果对照

相同任务、相同模型,仅改变注入的上下文组件。Outcome 来自分析器判定。

行为指标对比

迭代轮数、工具调用次数、重复调用次数、是否撞迭代上限 —— 量化「缺上下文」的代价。
迭代轮数 (max=5)
工具动作次数
重复工具动作次数
撞迭代上限 / 终态
full 完整 no_history no_reasoning no_tool_calls no_tool_results

full 臂 · 真实换算轨迹

3 次迭代完成:并行 3 次货币转换 → code_interpreter 汇总。汇率取自工具观测值。
Q1
$2,500,000.00
已为 USD
→
Q2 · EUR→USD
$2,282,608.70
×1.087
→
Q3 · GBP→USD
$2,278,481.01
×1.2658
→
Q4 · JPY→USD
$2,541,806.02
×0.0067
$9,602,895.73
年度总额 (Annual Total)
$2,400,723.93
季度均值 (Quarterly Avg)
对照:no_reasoning 臂给出 $9.60 million / $2.40 million —— 因推理被剥离,换算只用百万量级近似(2.28 而非 2,282,608.70),精度从「分」退化为「百万」,且未保留两位小数格式。

上下文契约 (Context Contract) 校验

每个臂需满足其独有的上下文契约,全部 5 臂 passed = true,证明消融是干净、可对比的。

手稿行为主张 · 实证对齐

实验设计意图 vs 真实观察结果。所有手稿主张均被实际数据支撑。
数据来源:chapter1/context/validation/latest.json · schema_version 1.1 · 由灵爪基于真实 API 轨迹生成