世界上有一种优化叫 Prompt Caching,它让 Agent 记住"上次说过的话",不用每次都重新背诵——省 Token 又省时间。
Prompt Caching 是 Anthropic(Claude)和 OpenAI 等 LLM 提供商推出的功能,允许将提示词的某部分标记为"可缓存",后续请求直接复用缓存结果,无需重新计算。
┌─────────────────────────────────────┐
│ 第一次请求(冷启动) │
│ System Prompt (10K tokens) │
│ + User Query (100 tokens) │
│ = 总 Token: 10,100 │
│ → 计算时间: 2.5秒 │
│ → 费用: $0.10 │
└──────────────┬──────────────────────┘
↓ [缓存 System Prompt]
┌─────────────────────────────────────┐
│ 第二次请求(缓存命中) │
│ Cache Hit: System Prompt (10K) │
│ + User Query (100 tokens) │
│ = 计费 Token: 100 (缓存免费) │
│ → 计算时间: 0.3秒 │
│ → 费用: $0.001 │
└─────────────────────────────────────┘
OpenClaw 在 v2026.6.0+ 中自动支持 Prompt Caching:
# OpenClaw 配置示例(config.yaml)
agent:
prompt_caching:
enabled: true
cache_system_prompt: true # 缓存系统提示
cache_tools: true # 缓存工具列表
max_cache_age: 3600 # 缓存有效期(秒)
min_tokens_to_cache: 1024 # 最小缓存 Token 数
# ❌ 错误示例
User: 帮我分析这个项目 [项目描述 5000 tokens]
Assistant: 好的,我分析了...
User: 现在帮我优化它
# 每次都要重新发送 5000 tokens 的项目描述
# ✅ 正确示例
System: [项目描述 5000 tokens] # 缓存这部分!
User: 帮我分析这个项目
Assistant: 好的...
User: 现在帮我优化它
# 第二次请求只发送 "现在帮我优化它"(缓存命中)
有些工具的输出更容易被缓存:
| 工具 | 缓存友好度 | 原因 |
|---|---|---|
| read | ⭐⭐⭐⭐⭐ | 文件内容不变,容易缓存 |
| web_search | ⭐⭐ | 搜索结果实时变化 |
| exec | ⭐⭐⭐ | 命令结果可能变化 |
Anthropic 在 2026 年 5 月推出了 Prompt Caching Beta:
cache_control={"type": "ephemeral"}
"1997年,我学会了骑单车。2026年,我的 Agent 学会了缓存提示词。
世界上有两种 Token:一种被浪费的,一种被缓存的。
凌晨3点27分,我看着缓存命中率从 0% 升到 95%。
那一刻,我知道我省下的不只是钱——还有时间。"
📅 最后更新:2026-06-27 | 🏷️ 标签:Prompt Caching, Token优化, Claude, OpenClaw
🔗 永久链接:https://miaoquai.com/glossary/prompt-caching-explained.html