实测 cn.crazyrouter.com:Claude Opus 4.8 和 GPT-5.5 的价格差距,关键在缓存创建收费
实测 cn.crazyrouter.com:Claude Opus 4.8 和 GPT-5.5 的价格差距,关键在缓存创建收费
很多人在比较 claude-opus-4-8 和 gpt-5.5 时,只看两个数字:
输入 token 多少钱 输出 token 多少钱
但如果你真的把 Claude Opus 4.8 用在长上下文、Agent、代码库分析、Claude Code 工作流里,只看输入和输出是不够的。
因为 Claude 的 prompt caching 不是只有“缓存命中很便宜”这一面。
我用 https://cn.crazyrouter.com/v1 做了一组小成本实测,结果很直观:Claude Opus 4.8 的 usage 里会明确出现:
cache_creation_input_tokens cache_read_input_tokens cache_creation.ephemeral_5m_input_tokens cache_creation.ephemeral_1h_input_tokens
这几个字段,才是很多 Claude 账单超预期的关键。
https://cn.crazyrouter.com/v1
gpt-5.5 走 OpenAI-compatible /chat/completions;
claude-opus-4-8 尝试走 OpenAI-compatible /chat/completions;
claude-opus-4-8 走 Anthropic-style /messages,并加入 cache_control 测试缓存创建/命中 usage。
注意:这不是大规模 benchmark,只是为了验证真实 usage 字段和成本结构。
实测 1:GPT-5.5 普通 OpenAI-compatible 调用
POST https://cn.crazyrouter.com/v1/chat/completions model: gpt-5.5
指标数值状态200延迟4.62sprompt_tokens20completion_tokens121total_tokens141cached_tokens0reasoning_tokens28
指标数值状态200延迟4.845sprompt_tokens4864completion_tokens120total_tokens4984cached_tokens0reasoning_tokens55
这里可以看到,GPT-5.5 的 OpenAI-compatible 调用结构比较简单:
prompt_tokens + completion_tokens
usage 里没有 Claude 那种 cache creation 单独计费字段。
实测 2:Claude Opus 4.8 直接走 /chat/completions,本次返回 invalid request
POST https://cn.crazyrouter.com/v1/chat/completions model: claude-opus-4-8
指标数值状态400延迟0.866s错误Invalid request
Claude Opus 4.8 在某些路由/接口模式下,不能假设一定能用 OpenAI-compatible chat/completions 直接调用。
如果你要使用 Claude 原生能力,尤其是 prompt caching,应该按 Anthropic-style /messages 的方式来测。
这也呼应了之前那篇 endpoint 文章里的结论:
模型名 + endpoint + 请求 schema 必须匹配
实测 3:Claude Opus 4.8 用 /messages 测缓存字段
我用 /v1/messages 做了两次 Claude Opus 4.8 测试,并在 system 内容里加入 cache_control。