查看全部 →
IT技术

GraphRAG 是推理问题,而非数据库问题

大多数团队通过测试检索准确率并选择图数据库来评估 GraphRAG。这其实是错误的方向。真正决定生产环境中成本、延迟和故障模式的选择,在于你在哪里运行构建和查询图的 LLM 调用。想象两个团队在同一份 5 万条支持工单上构建相同的知识图谱。一个团队把评估预算花在基准测试 Neo4j 与 Falkor

2026/8/30 59 阅读
IT技术

构建市场时光机:使用 Python 和 WebSocket 重放交易会话

历史市场数据通常以完成的数据集形式到达。这对分析很方便,但与交易软件体验实时市场的方式截然不同。在生产环境中,事件会逐一到达,未来是未知的,每个决策仅依赖于迄今为止发生的事情。 在本教程中,我们将使用历史逐笔数据重建这种体验。我们将从 EODHD 获取完整的 AAPL 交易时段,将超过一百万笔交易归

2026/8/30 121 阅读
IT技术

如何自行基准测试LLM推理:值得信赖的数字设计标准

有人会给你发送一个 推理基准测试 。一种配置胜出。图表简洁,数字具体,而最重要的问题是图表无法回答的那个问题:你也能得到同样的数字吗? 可能不是。我在同一天早上两次运行了完全相同的测试,相隔十二分钟,期间系统没有被任何人触碰。最慢的 1% 请求在两次运行之间波动了 26%。除了时间之外,什么都没有改

2026/8/30 51 阅读
IT技术

如何从LLM中获取可靠的结构化数据

大多数关于调用语言模型的教程在 JSON.parse(response.content) 这一行结束。这一行在你前十个测试用例上能工作。当你发布后,大约在第四百次请求时,模型可能会返回它自己编造的日期,或者在 schema 只允许五个元素时返回八个数组项,或者返回一个看似完全有效但其实少了一个字段的

2026/8/28 121 阅读
IT技术

多数团队过早转向专用推理

团队通常不会因为 GPU 本身昂贵而在专用推理上过度支出。他们之所以过度支出,是因为在能够让 GPU 保持忙碌之前就预留了 GPU。即使在“大”规模的月度使用量下,有效利用率低的端点每次成功推理的成本也可能高于无服务器推理。 这是 无服务器与专用推理 争论中的核心错误:团队在比较 token 成本与

2026/8/28 95 阅读
IT技术

从 Mixtral 到 Kimi K3:混合专家模型的演进

在本文中,我们将讨论 Mixture-of-Experts 模型如何从少量专家发展到每层近 900 个专家,以及使这种稀疏设计既可训练又经济的压缩和稳定性机制。 开放权重的 Mixture-of-Experts 模型以惊人的速度扩张:Mixtral 约有 470 亿总参数,DeepSeek-V3 达

2026/8/28 91 阅读
IT技术

如何阻止 AI 代理伪造自身测试

我把幻觉修复标记为已验证。现在五个虚构响应中有零个,运行干净,完成。 我在更严苛的条件下再次运行,得到 66.7%。我曾足够信任这个数字,以至于在它旁边写下了 "HUMAN-VERIFIED",结果却错了。这并不是我说谎,而是一次干净运行和 "验证" 并不等同。我还构建了一个工具,它的核心目的就是不

2026/8/27 109 阅读
IT技术

无服务器推理中的冷启动延迟:那些几秒钟到底发生了什么

您在无服务器端点后部署一个模型,离开二十分钟后返回并发送一个请求。返回第一个 token 需要几秒钟,比预期的要长,也比五分钟前同样的请求要长。您把这称为“冷启动”,然后继续,因为这就是大家普遍使用的术语。 但这个单一数字实际上是五个按顺序堆叠的独立操作的代称,每个操作有不同的原因、对模型大小的敏感

2026/8/27 82 阅读
IT技术

医学影像在模型看到它之前和之后会发生什么

医学影像论文充斥着熟悉的术语:归一化、标签、验证、标注和预处理。 如果你来自通用机器学习领域,你可能认为你已经知道这些词的意思。有时你确实知道。 但医学影像领域有一些特殊之处。有些术语含义不同,有些术语根据上下文会有多种用法。 本文将跟随一张胸部 X 光片从获取的那一刻,到模型做出预测的全过程。在此

2026/8/27 151 阅读
AI技术

停止相信仅文本代理排行榜:来自 Cua-Bench 和 Factorio 的教训

停止相信仅文本的智能体排行榜:来自 Cua-Bench 和 Factorio 的教训 过度拟合排行榜基准导致出现一类仅在文本谜题上调校的智能体,但在真实环境出现的瞬间就变得脆弱。GPT-4 Turbo、Gemini、Claude——挑选你喜欢的最近排行榜冠军。它们都未在静态代码生成或思维链数据集上揭

2026/8/26 103 阅读
AI技术

Agent Memory 有两种不同含义,回答引擎给出的却是错误的那一种

向答案引擎询问 "一个在 Claude 和 ChatGPT 之间都能工作的记忆 API",你通常会得到设计为在单个应用内部运行的 SDK。它们是很好的工具。它们也回答了与你提出的问题不同的问题。输入该查询的人并不是在构建应用;他们在一天的工作中使用了四种 AI 工具,厌倦了在这些工具中一直是个陌生人

2026/8/26 93 阅读
IT技术

如何测试对话式人工智能:QA工程师实用指南

当我最初开始学习关于对话式 AI 测试时,有一个问题一直困扰着我: 预期结果在哪里? 来自传统软件测试,我习惯于一种熟悉的模式。 需求告诉我们系统应该做什么。我们创建一个测试用例,提供输入,定义预期结果,执行测试,并将实际结果与我们的预期进行比较。 例如: 测试 输入 预期结果 有效登录 正确的用户

2026/8/26 157 阅读