实验 1-1 · 上下文的关键作用
基于真实 API 证据的对照验证 — 5 种上下文配置下的 Agent 解题表现
Experiment: 1-1
证据模式: real_api
模型: deepseek-v4-flash
Provider: deepseek
创建: 2026-09-14 23:48 UTC
核心结论速览
任务:将 Q1–Q4 多币种营收统一折算为 USD,求年度总额与季度均值(保留两位小数),强制使用工具观测值、禁止自行估算汇率。
一句话结论:完整上下文(full)下模型准确给出 $9,602,895.73 / $2,400,723.93;
一旦抽掉「历史」或「工具结果」,模型陷入重复调用直至迭代上限仍无终态;抽掉「推理」则精度崩塌(仅报 9.60M);
抽掉「工具定义」模型干脆不动工具、也不编造数字 —— 上下文各组件缺一则系统性失效。
2/5
卡死无终态 (no_history / no_tool_results)
1/5
退化 (no_reasoning 精度丢失)
五臂结果对照
相同任务、相同模型,仅改变注入的上下文组件。Outcome 来自分析器判定。
行为指标对比
迭代轮数、工具调用次数、重复调用次数、是否撞迭代上限 —— 量化「缺上下文」的代价。
full 完整
no_history
no_reasoning
no_tool_calls
no_tool_results
full 臂 · 真实换算轨迹
3 次迭代完成:并行 3 次货币转换 → code_interpreter 汇总。汇率取自工具观测值。
→
Q2 · EUR→USD
$2,282,608.70
×1.087
→
Q3 · GBP→USD
$2,278,481.01
×1.2658
→
Q4 · JPY→USD
$2,541,806.02
×0.0067
$9,602,895.73
年度总额 (Annual Total)
$2,400,723.93
季度均值 (Quarterly Avg)
对照:no_reasoning 臂给出 $9.60 million / $2.40 million —— 因推理被剥离,换算只用百万量级近似(2.28 而非 2,282,608.70),精度从「分」退化为「百万」,且未保留两位小数格式。
上下文契约 (Context Contract) 校验
每个臂需满足其独有的上下文契约,全部 5 臂 passed = true,证明消融是干净、可对比的。
手稿行为主张 · 实证对齐
实验设计意图 vs 真实观察结果。所有手稿主张均被实际数据支撑。