llmburn.

Agent 循环成本仿真 /agent-loop

为什么多轮 agent 对话越来越贵?因为第 t 轮要重发整个上下文:无缓存时累计 input 是 O(n²) 抛物线;前缀缓存把它压成线性;截断/压缩让它封顶但出现锯齿。而上下文跨过分档阈值的那一刻,单轮成本还会阶跃(橙色虚线)。

Loading pricing catalog…

为什么是非线性(给页面的答案)

  1. 二次增长(主因):第 t 轮的 prompt 含前 t−1 轮的全部历史,累计 input ≈ O(n²)。
  2. 档位跃变(放大器):ctx 跨过 272K 等阈值后,整个 prompt 按高价档重算 → 曲线一阶不连续。
  3. 缓存命中率衰减:TTL 过期或前缀失效时,命中率从 ~90% 骤降到 0。
  4. 压缩/截断锯齿:截断让成本封顶,但每次淘汰后重回缓存冷启动。
  5. 重试被放大:重试的往往是最贵的那一轮(本图未含重试)。