全部 AI技术 安全技术 IT技术
IT技术

最佳 OpenAI 兼容推理 API:2026 年的即插即用替代方案

TL;DR: 2026 年领先的 OpenAI 兼容推理 API 按字母顺序为:DigitalOcean(无服务器推理)、Fireworks AI、Groq、Nebius Token Factory、OpenRouter 和 Together AI。这六种都只需更改基础 URL 和 API 密钥即可

2026/8/19 163
IT技术

Qwen3.8-2.4T-A95B 现已在 DigitalOcean 推理引擎上提供

测量: 所有延迟和吞吐量数据均在 2026-08-12 对实时端点进行测量。 Qwen3.8-2.4T-A95B 在 DigitalOcean:阿里巴巴的开放权重旗舰模型,每 1M token 定价 $2/$6 在 NVIDIA HGX™ B300 GPU 上使用 NVFP4 量化权重提供服务,并与

2026/8/19 175
安全技术

我让AI代理无人看管地运行交易机器人,它两次崩溃后我才设置门阻止它。

我经营着一个一人的 AI 公司:Claude Code 负责编写和维护代码,我负责做出需要人类判断的决策。它构建的大部分内容都在无人值守的情况下运行 — — 一个在 5 分钟调度器上运行的实时策略机器人,以及一个每周的内容管道,可以在我不先阅读草稿的情况下自动草拟并发布(我的英文阅读水平不足以自己审

2026/8/19 108
AI技术

将 CLAUDE.md 从 548KB 压至 34KB:测量加载时机及保持小巧的提交门禁

我们的 CLAUDE.md 大小为 548KB。每个会话 — 包括每个子代理 — 在做任何工作之前都会加载全部内容。一次测量的无头运行在实际任务开始前向缓存写入了约 150,000 个 token,而文件本身是主要贡献者。 本周我们将其减少到 34KB,且未删除任何义务。这是我希望在开始之前就能看到

2026/8/18 131
AI技术

代理忽略了失败的工具调用:在 CI 中捕获的方法

您部署了一个 AI 代理。它调用工具,读取结果,再调用更多工具,给出答案。大多数时候它能正常工作。然后用户报告出了问题,您打开追踪,发现了它: charge_card 工具返回了 402,而代理只是……继续前进,并告诉客户他们的订单已发货。 这不是指“编造事实”意义上的幻觉。这是运行中的一个 结构性

2026/8/18 121
AI技术

不要给模型SQL

我构建了一个网页应用来回答关于我自身健康数据的问题,原因令人尴尬地微小。我本来就有一种完美的方式来提问:一个 Claude Code 技能,它查询数据库并对结果进行推理。它运行良好。它也无法在 Claude iOS 上运行,而我想要真正询问“应该担心这个吗”的时刻,我通常站在凌晨 6 点的厨房里,而

2026/8/18 117
AI技术

如何利用智能体上下文提高Playwright测试覆盖率

我不懂如何演奏乐器,所以显然我把它做成了一个应用。事实上,我家人人都能唱歌或演奏乐器,而我是那个格格不入的人。 我知道你在想什么,“谁会在乎?有了 AI,你几乎可以构建任何东西。” 我更兴奋的是我选择用来与我的代理一起构建这个应用的技术。具体来说,我使用了构建该应用的代理会话的上下文来查找并修复其

2026/8/18 120
IT技术

如何用AI现代化遗留应用而避免变成重写

我曾见过一些遗留系统迁移被认为很成功,仅仅因为旧框架从代码仓库中消失了。 六个月后,团队仍在处理同样的耦合问题、同样不清晰的业务规则,以及几乎相同的部署问题。 技术虽然变了,但整个系统并没有发生太大变化。 AI 让这个问题变得更加有趣。 它可以比人工团队更快地完成代码翻译。它可以解释陌生的类、生成测

2026/8/18 126
IT技术

连续批处理可改善P50,但可能毁掉P99:实测权衡

连续批处理是现代LLM服务系统的核心特性。它被包含在每个主要引擎中,经常出现在对比图表中,其对吞吐量的影响已经得到充分证实: Anyscale 广受引用的基准测试报告称,与基础服务设置相比,吞吐量提升高达23倍,而Orca论文在早期系统上测量到高达36.9倍提升。这些结果是真实的,它们主要描述吞吐量

2026/8/18 126
IT技术

如何用vLLM扩展AI智能体的LLM推理

在本教程中,我将向你展示如何使用 vLLM 为 AI 代理扩展 LLM 推理。我将帮助你建立对 LLM 推理工作原理的直觉,探讨为什么代理工作负载会造成 GPU 调度和内存压力,并研究 vLLM 如何设计来提高吞吐量。 然后,我们将运行一个本地 vLLM 服务器,并通过一个 AI 代理使用其兼容 O

2026/8/18 140