首页 / 文章 / 我烧光了所有代币,只为研究如何节省代币
← 返回
AI技术

我烧光了所有代币,只为研究如何节省代币

✍️ zhirenhun 📅 2026/7/20 👁 159 阅读 ⏱ 18 分钟
我烧光了所有代币,只为研究如何节省代币

我烧光了所有代币,只为研究如何节省代币

Bartosz Kotrys·2026年7月17日

下载PNG

2026年7月19日登上Hacker News首页

在Quesma,我们正在研究AI代理的经济学:智能编码的真实成本是多少,以及你能做些什么。为此,我运行了自己的深度研究系统——一个由代理组成的流水线,用于构建一个我真正可以信赖的知识库。这个系统的第一个版本在30分钟内就烧光了我Claude Max 5x计划的全部限额。这篇文章讲述了我如何仅用已有的订阅服务解决成本和信任问题,以及你如何构建同样的系统。

我的目标是理解所谓的代币经济学的全貌。我想知道存在哪些监控系统,团队如何管理他们的AI支出,以及哪些优化工具和实践在论文和现实世界中真正有效。

我以常规方式开始,使用/deep-research。我提出了一个宽泛的开放性问题,然后让它运行。大约30分钟的研究后,我达到了限额,不得不等待几个小时让它重置。而且我没有任何结果。这次运行启动了111个代理,并排队了123个待验证的声明,但只有25个在达到限额前得到了验证,最终的合成从未执行。

所以,我亲身体会到了这一点。这有点好笑:从第一天起,我不得不在研究如何优化代币的同时,就开始优化代币。边做边学。


使用我已付费的每一项订阅服务

如果Claude Fable 5在30分钟后耗尽,而/deep-research消耗了这么多代币却没有给我任何结果,我该如何让研究更有效?我开始思考我已经拥有并付费的工具。Claude、Codex和Antigravity:3个订阅,理论上相当于3倍的代币,无需额外付费。如果我同时使用所有这些工具,并共享记忆,会怎样?

由于我已经在使用claude-mem插件,我将其扩展以支持本地的Codex和Antigravity,这样所有3个工具都可以在会话期间使用共享记忆。一个工具学到的东西,其他工具也能使用。


深度研究管线:多模型编排流程

更便宜的模型作为子代理

我的默认设置是Claude Code,所以我用它作为主框架。在手动进行研究时,我发现了一种模型编排模式,这正是我当时所需要的。我们并不需要所有任务都用Fable:Claude Opus 4.8、Claude Sonnet 5、GPT-5.5和Gemini 3.1 Pro对于许多任务来说已经是出色的模型。

Claude Code 作为 AI Agent 架构框架

Claude Code作为框架:原生Claude代理、Codex和Antigravity作为无头子代理,所有代理共享claude-mem

所以我检查了一些基准测试和成本分析,主要是针对终端和代理工作的Terminal-Bench、针对端到端软件工程的SWE-bench Pro,以及用于总体性能和价格概览的Artificial Analysis。我没有将任何一个视为最终真理;基准测试衡量的是它们自己的东西,而且数字每个月都在变化。我只需要一个粗略的起点,了解谁擅长什么,并且从一开始,使用多个不同的模型就是实验的一部分;我预计在实际运行后无论如何都会调整分工:

  • 角色:发现,模型:Claude Sonnet 5,选择原因:在代理基准测试中表现强劲,且足够便宜,可以批量运行
  • 角色:验证,模型:Claude Opus 4.8,选择原因:最准确的Claude工作模型;检查比搜索需要更高的准确性
  • 角色:判断与规划,模型:Claude Fable 5,选择原因:最昂贵的模型,因此只负责规划、分解和解决争议
  • 角色:小任务,模型:Claude Haiku 4.5,选择原因:便宜且快速,适合提取和格式化,但对于多步骤工作来说太弱
  • 角色:运行工具,模型:Codex (GPT-5.5),选择原因:在终端基准测试中非常强大;克隆、安装、运行和检查工具
  • 角色:第二意见,模型:Antigravity (Gemini 3.1 Pro),选择原因:不同的模型家族,因此没有相同的盲点

这个分工不是我的第一个版本;当实际运行暴露出弱点时,我调整了几次,回退规则也来自那些失败。

这里最棒的是,我准备了Codex和Antigravity作为Claude子代理使用,由Fable编排,利用了两者的无头特性。为什么这很酷?因为代币是从Codex和Antigravity的订阅中扣除的,所以我没有额外付费,但立即拥有了更多可用的智能。

整个技巧是一个小的Bash脚本,我的Claude代理可以像调用其他命令一样调用它:

# run-cli: 调用其他供应商的CLI作为无头子代理
# 用法: run-cli <codex|antigravity> "<提示>"
VENDOR="$1"; PROMPT="$2"
case "$VENDOR" in
  codex)       OUT="$(codex exec --sandbox read-only "$PROMPT")" ;;
  antigravity) OUT="$(agy --model "Gemini 3.1 Pro (High)" -p "$PROMPT")" ;;
esac
echo "$OUT"
echo "$OUT" | claude-mem-save -s "$VENDOR" # 保存到共享记忆(我本地扩展的claude-mem)

这个包装器还会监控输出中的“使用限制”和“信用额度不足”消息,并返回一个特殊的退出码,这正是自动回退到Claude模型的工作原理:编排器看到信号后,改用Claude代理完成工作。

另一件非常重要的事情是按角色固定模型,因为子代理默认继承其父模型的设置,这正是我在30分钟内烧光Fable限额的原因。

使用这种技术,我能够连续运行研究的时间大约是仅使用Fable时的10倍,衡量标准很简单,就是在我三个订阅中的任何一个达到限额之前,代理能持续工作多久。之前是30分钟的研究,现在变成了几个小时,而且没有多花一分钱。当Codex或Antigravity达到其自身限额时,框架会自动回退到Claude模型,因此研究不会停止。


减少幻觉

成本只是第一个问题,第二个问题是信任。在我的研究框架之前,当所有事情都由Fable完成时,我有时会得到看起来可靠但实际上不真实的发现。例如,仓库的许可证信息错误、没有来源的节省数据,或者引用的页面上并不存在的数字。为了减少幻觉,我在研究框架中实施了明确的规则,每个发现都必须通过这些规则才能被分享。其中一些规则:

  • 谁发现了一个声明,谁就永远不会去验证它;由不同的模型或代理检查链接、引用和数字。
  • 没有URL和主要来源的引用,任何内容都不会进入知识库。
  • 永远不要陈述源页面中不包含的数字。

这个列表不是预先设计的。它是在研究过程中逐渐增加的,因为每次验证发现一类新的错误时,规则就会被添加回提示中。而且,只有不断调整,这样的框架才能真正有效,所以要审查发现,标记无用的内容,并反馈回去。


/deep-research放在最后

解决了成本和信任问题后,最后一块是引发这一切的/deep-research工具。它仍然在流水线中,但作为最后一步,而不是第一步。每天结束时,我会对已经通过验证的发现运行它,这样它就不是盲目地研究,而是遍历现有的发现,深化它们,消除混乱,并尝试填补框架遗漏的空白。这样它使用的代币也更少,因为它处理的是一个固定的声明列表,而不是探索整个互联网。最近一次运行使用了61个代理,耗时22分钟。与第一天相比,当时111个代理在大约30分钟内烧光了整个限额,却从未生成报告。同样的工具,只是任务小得多。

Claude Code 作为 AI Agent 架构框架

流水线一览:发现、验证、判断、运行工具、深度验证,然后输出到wiki。


结果:一个我可以信赖的知识库

所有通过验证的内容都会进入我在Obsidian中维护的一个LLM wiki,灵感来自Karpathy的LLM wiki模式:链接的原子笔记、执行扫描的代理,以及我来制定规则。一周下来,它已经包含了数百条关于定价、工具、基准测试和实践的已验证笔记。

Claude Code 作为 AI Agent 架构框架

到目前为止,已有数百条关于定价、工具和基准测试的笔记。

自动化检查本身并不足够。有一次,我的分类规则悄悄拒绝了 Headroom——一个拥有 56k 星标的项目,也是同类中最大的项目之一。Agent 们做了一切正确的事:验证确认项目是合法的,声明检查也正确标记出其标题中的节省数字未经质量控制。但我的规则说“未经验证的声明意味着不得入库”,于是这个半个行业都在使用的项目在我的知识库中消失了。直到两天后,当我问“我们怎么会错过这个?”时才注意到。修复方法是制定一条新规则:拒绝声明,而不是拒绝项目。Agent 可以执行搜索和检查,但没有任何 Agent 会告诉你,你自己的规则才是那个 bug。

如果你想构建一个高质量的知识库,人工验证和研究补充是强制性的。仅靠 AI 的研究质量可能非常差。仅靠人工的研究又太慢。最佳方式是混合模式:Agent 承担繁重的研究工作,但它们运行在一个由人类精心设计并持续改进的流水线上。人类还要验证结果并填补空白。


知识库中的一些发现

代币经济学这个话题比我预期的要大得多。以下是其中已有内容的一小部分样本,这些发现最让我惊讶:

  • 你的测试框架可能与你的模型同等重要。 在 Terminal-Bench 上,同一个模型在不同测试框架间的代币消耗差异约为 66 倍,而更精简的配置得分反而更高,而非更低。另一项研究测量到,仅改变测试框架,同一模型的得分波动约为 54 个百分点。我们在检查向 AI Agent 说“你好”的真实成本时,也亲身经历了一个小规模的类似情况。
  • 上下文压缩可能使你的账单翻倍,而非节省。 压缩听起来像是压缩,所以很容易认为它总是好的,但它并非免费:模型必须总结你的历史记录,而这次总结调用也会消耗代币。它还可能导致 Agent 仍需要的文件被驱逐,于是 Agent 重新读取文件,上下文再次填满,压缩再次触发。一个记录在案的回归测试展示了这个循环有多糟糕:在测试框架调整其压缩阈值后,每次会话的压缩次数从 4 次增加到 12-26 次,相同任务上的代币使用量从 8900 万增加到 1.6 亿至 1.85 亿。
  • 一次会话中的工具变更会静默地重新计费所有内容。 缓存读取的成本约为基础输入价格的 0.1 倍,但缓存失效是按层级进行的(先是工具,然后是系统,最后是消息)。在会话中间添加或重新排序单个工具模式,整个缓存前缀都会按全价重新计费。你不会收到任何错误,只会看到一张更大的账单。
  • 你的代币计数器不等于你的账单。 在一个记录在案的案例中,计算出的每月 3.60 美元最终变成了每月 25-40 美元的账单,这 7-11 倍的差距来自于上下文累积、重试放大、框架开销以及简单的代币估算从未捕获到的评估调用。

我们的框架将其中大多数标记为中等置信度,通常有 1 或 2 个可靠来源,我们保持这种可见性,而不是假装问题已经解决。


在你烧掉下一个限额之前

如果你今天正在把限额消耗在深度研究上,试着颠倒顺序。廉价模型负责发现,精确模型负责验证,深度研究放在最后。同时,检查一下你已经为多少智能付费了。几个订阅,每个模型有明确的角色,比盲目使用一个前沿模型能给你带来更多。

如果你正在构建自己的研究流水线,或者你的 AI 账单增长速度超过使用量,我们非常希望听到你的声音。加入 Hacker News 或 LinkedIn 上的讨论。

敬请期待未来的文章和发布。

订阅

document.addEventListener(`DOMContentLoaded`,function(){document.querySelectorAll(`.newsletter-form`).forEach(e=>{e.addEventListener(`submit`,async function(t){t.preventDefault();let n=new FormData(e);await fetch(e.action,{method:`POST`,body:n,mode:`no-cors`});let r=e.querySelector(`#mce-EMAIL`);r.value=``,alert(`Thanks! Check your email to confirm your subscription.`)})})});

或者

通过 RSS 订阅


原文出处:https://quesma.com/blog/custom-deep-research-pipeline/

🧑‍💻

zhirenhun

一个热爱技术的程序员,喜欢分享前沿AI知识和开发经验。

← 上一篇
我是如何构建一个常驻Telegram的个人AI助手的
下一篇 →
我将 Rust 热路径加速 27 倍,以及我拒绝合并的 AI 修复方案

📌 相关推荐

停止相信仅文本代理排行榜:来自 Cua-Bench 和 Factorio 的教训
2026/8/26
Agent Memory 有两种不同含义,回答引擎给出的却是错误的那一种
2026/8/26
LLM的止境:AI辅助VAPT流水线的确定性评分
2026/8/22
← 返回文章列表