核心结论速览
在 Apple Silicon(macOS arm64)本地以 Ollama 运行 qwen3:0.6b(Q4_K_M 量化,751.63M 参数),验证两件事:模型能否正确完成「并行工具调用」任务,以及提示缓存能否显著压低首 token 延迟。
一句话结论:本地 0.6B 小模型在 raw 协议下完整通过 6 项工具调用 Gate,正确并行调用两个工具、参数精确匹配 Vancouver、收到结果后正常终止;
解码速度稳定 ~269 token/s(远超 100 token/s 基线);提示缓存命中使首 token 延迟(TTFT)从 0.50s 降至 0.088s,加速 5.65×,5/5 配对全部命中更快 —— 本地 Agent 服务在延迟与正确性上均达标。
模型与环境
被测实例、运行宿主与推理服务版本,用于复现实验。
工具调用实验(Tool Calling)
任务:用户要求询问 Vancouver 当前时间与天气,并「调用两个工具」。系统提示明确要求时间工具传入 IANA 时区 America/Vancouver,温度工具用 celsius。
解析出的工具调用
从 raw 响应中解析并归一化的两次调用(并行发起)。
6 项正确性 Gate 检查
每一项均为通过(True)方判定实验有效。
两轮推理性能
TTFT=首 token 延迟,Wall=端到端耗时,Decode=解码速度(token/s)。第二轮因已有上下文与缓存,TTFT 显著更低。
TTFT 首 token 延迟 (s) · 越低越好
第一轮(工具调用)
第二轮(合成回答)
提示缓存实验(Prompt Caching)
5 组配对:缓存命中 vs 未命中 TTFT (s)
命中 (hit)
未命中 (miss)
最终判定
综合工具调用与提示缓存两部分的自动化判定。