长上下文模型 API、百万 token、大文档分析
长上下文能让你省掉一整套检索管线,但它不免费:输入 token 无论是否命中缓存都要计费,一个 20 万 token 的请求成本相当于数百次普通请求的输出。前缀重复的场景正是平台缓存感知路由发挥价值的地方——把提示词中稳定的部分(系统指令、文档)放在前面、易变的部分放在后面,对同一前缀的重复调用会明显更便宜。
价格单位:美元 / 百万 token · ¥6.6 = $1
56
54
37
4
19
12
57