查看全部 →
AI技术

我用LLM描述了1,245张表格,检索效果变差

编目步骤本应是易得的胜利。你有一个模式,其 表被称为 ecm_template_link 和 v_pmpm ,你的用户用英文提问 ,而这两种词汇之间的差距正是导致检索 失误的原因。于是你对每张表使用一个模型,得到描述每张表的一句话 ,将这些句子与表名一起建立索引,现在语料库也能说 英文。 我对一个真

2026/9/13 70 阅读
IT技术

如何构建自评估AI系统:LLM应用的自动化测试与评估流水线

你已经把 AI 功能发布了,在演示中运行良好。团队对此印象深刻。随后,用户提出了一个略微超出你测试用例的问题,模型却自信地返回了完全错误的答案。 使用大型语言模型构建系统的真相是,传统的软件测试方法在这里失效了。当系统每次运行都会生成不同的文本时,你无法仅仅写一个简单的 assert output

2026/9/13 84 阅读
IT技术

什么是 Agent Harness?Claude Code、DeepSeek Harness 和 Hermes Agent 背后的架构

2026年8月13日,DeepSeek 在 GitHub 上发布了一个名为 deepseek-harness 的仓库。仅两天,它的星标就超过了 95,386,分叉达到 8,826(这本身只是一个虚荣指标,但如此迅速的激增预示着不仅仅是运气)。这在 2026 年是开发者工具在 GitHub 上增长最快

2026/9/13 104 阅读
IT技术

如何使用 Vercel AI SDK 和 Shadcn/ui 构建 AI 聊天应用界面

如今你打开的几乎所有 AI 产品都呈现相同的界面:底部有一个消息列表、一个文本框,以及逐 token 流式出现的文字。看起来简单,但要做好并不容易。 你需要管理流式状态、部分 token、工具调用、重试、Markdown 渲染、滚动位置以及十几个细微的 UX 细节……同时还要保持界面的可访问性和高速

2026/9/12 146 阅读
AI技术

Nexpath 评测:AI 提示质量层能否让 AI 编程更安全?

AI 编程工具让从想法到可运行代码变得轻松。 你描述想要的功能,发送提示,几分钟后就能得到文件、组件、逻辑,有时甚至是一个完整的可运行应用。 这种速度很棒,直到提示遗漏了某些重要内容。 也许需求过于模糊。也许没人说明该功能该如何验证。也许现有行为需要保持不变。也许改动听起来很小,但却容易忽视的后果。

2026/9/12 130 阅读
IT技术

Spot GPU Droplet 上的容错训练:设置检查点、断点续训,让任务持续运行

最新款的 GPU,反而是短期任务最难弄到手的资源。如果你所在的 AI 团队规模不大,想用上 NVIDIA HGX B300、AMD Instinct MI350X 和 MI355X,基本只能走合同容量或 12 个月预留套餐两条路,而且都得跟销售团队谈。对于要连续跑上一年的生产级推理集群来说,这没什么

2026/9/12 95 阅读
IT技术

为什么最佳模型是两个模型:在 Kimi K3 与 Claude 之间的路由

我认识的一位开发者上个月拉出了推理账单,却解释不清为什么修改配置文件中的一个拼写错误的成本竟然几乎和花了整个下午构建的功能相当。两个请求都经过了同一个编码代理。两者都调用了同一个模型。这正是该代理的设计方式:一个模型、一个 API 密钥、每 token 一个价格,无论它面前的任务是琐碎的还是真正艰难

2026/9/11 130 阅读
IT技术

为什么数据局部性比原始GPU速度对RAG更重要

当你试图加速生产环境的 RAG(检索增强生成)管道时,数据存放的位置通常比其他任何因素都更重要。如果运行在 GPU Droplet 上的模型需要跨区域,甚至跨云提供商去获取向量、文档和元数据,仅仅购买更快的 GPU 可能无法解决用户实际感受到的延迟。 假设有一个 RAG 应用运行在 DigitalO

2026/9/11 133 阅读
AI技术

Qwen 3.8 在笔记本上能否真正取代 Claude Opus 进行 Agentic 编码?

原文发布于 deepu.tech 。 AI 编程热潮刚兴起时,我仍持怀疑态度。和大多数技术爱好者一样,我尝试过,但当时对模型的编码能力并不印象深刻。我仍然在使用它们,但主要只是 VS Code 的自动补全工具。一切在我使用 Claude Code 的 Opus 4.6 时改变了。那是我第一次感觉到模

2026/9/11 151 阅读
AI技术

我用 100 个线程跑了一场秒杀,没等来超卖,等来了更阴险的东西

100 线程秒杀实测:1500 次请求全部成功、库存一分没超卖、账面却剩 793 件。比超卖更阴险的丢失更新,以及为什么单元测试全绿也发现不了。

2026/9/9 115 阅读
AI技术

测试挂了不用喊人:我给 CI 装了个会自己修 bug 的循环,AI 修完我还得改回来一处

搭一个测试挂了自动喂给大模型、拿 patch 重跑的最小自愈闭环。AI 一次修对公式 bug、保住审批规则,但顺手删了金额舍入——测试全绿不等于修复正确。

2026/9/9 99 阅读
AI技术

AI Agent 拆开看就是 if 语句?我写了个对照实验,发现真正的问题在别处

同一个客服任务,if/else 版和大模型版对照实测:常规消息打平,长尾消息 0% 处理率对比全部接住——但 LLM 赢得并不干净。

2026/9/9 94 阅读