全部 AI技术 安全技术 IT技术
IT技术

产品实验中的工具变量:在Python中消除LLM路由决策的混杂

对于负责管理多模型网关的数据科学领导者和产品经理来说,衡量模型质量的标准回归方法存在根本性缺陷。 无论你是否承认,你其实都在进行一项因果推断实验,而你的路由规则正在悄无声息地污染你的性能估计。 考虑这样一个网关:它根据置信度阈值将传入的查询路由到高级模型或更快、更便宜的替代模型。置信度得分低于某个阈

2026/8/4 213
IT技术

为什么尖峰推理流量会破坏专用GPU算力模型

引言 专用GPU处理突发的LLM推理流量,在胜过按令牌计费之前,需要先达到一个明确、可计算的吞吐量下限——持续每秒1,910个可计费令牌;该下限的推导及其等效利用率百分比将在本文后面展开。本文将这一下限应用于DigitalOcean上的 llama3.3-70b-instruct ,详细分析了三种具

2026/8/4 231
IT技术

提示缓存如何工作,何时才能真正降低LLM成本?

提示缓存被宣传为一种免费获得的折扣。它并非自动开启,也并非在每个提供商那里都免费。节省的费用取决于你的流量的三个方面:每个请求中有多少内容重复,有多少请求共享该重复部分,以及它们之间经过多少时间。如果这三方面都做对了,在长时间的智能体会话中,缓存可以将输入令牌成本降低80%到90%。如果做错了,至少

2026/8/4 175
IT技术

如何构建自动切换模型的AI应用

大型语言模型(LLM)从根本上改变了我们构建现代软件的方式。 但是,对每个用户请求都依赖单一AI模型会带来严重的生产风险。API中断时有发生。对于简单任务,专有模型可能成本高昂。而较便宜的开源模型可能难以处理复杂的逻辑推理。 当我和我的团队为客户支持平台构建企业级AI引擎时,我们所有事情都依赖一个顶

2026/8/3 242
IT技术

提示工程与循环工程:开发者指南

对许多开发者来说,AI工作流程大致是这样的:编写提示词,获取响应,复制有用的部分,然后继续下一项任务。 这种方式涵盖了令人意想不到的广泛任务,从总结文档到起草电子邮件,再到解释一段代码。 但当任务涉及多个步骤、外部数据或依赖于模型刚返回结果而做出的决策时,这种工作流程就开始失效了。你最终不得不手动重

2026/8/3 166
IT技术

长上下文LLM服务中的真实权衡:内存、延迟、成本与准确性

“长上下文”的含义,以及为什么“支持”不等于“实际服务” 上下文是你在一次请求中发送给模型的所有内容:提示词、文档、代码、对话历史。它使用令牌(token)来衡量,令牌是词元片段,大约每1,000个令牌对应750个单词。128K令牌窗口(大约相当于一部小说的文本量)是当前常见的标准。 Llama 3

2026/8/3 143
AI技术

你的智能体为每个从未调用的工具付出代价

大多数智能体都会为它们不使用的工具付费。不是一次——而是每一轮都如此。 其机制简单到容易让人忽略。当你给模型一组工具时,每个工具的完整 JSON schema 都会进入请求中。名称、描述、参数类型、枚举值、嵌套对象,一应俱全。模型读取全部内容,选一个,然后调用。下一轮,整个目录再次通过线路传输,因为

2026/8/2 257
AI技术

CI 中的 Claude Code:对每个 Pull Request 运行代理式代码审查、测试生成与自动修复

Claude Code在CI中的应用:在每个拉取请求上运行智能代码审查、测试生成与自动修复 本文在人工智能辅助下撰写,并经过人工监督与审核。 为什么CI中的智能代码审查会改变一切 大多数CI失败会浪费数小时进行手动干预,因为传统机器人只会标记问题,却从不修复它们。开发人员提交一个拉取请求,代码检查器

2026/8/2 269
AI技术

Cursor + BrowserAct 如何处理动态页面而不依赖脆弱选择器

太长不看 现代 Web 应用不断变化。组件会被重新渲染,生成的属性在不同构建版本之间可能有所不同。即使界面看起来完全相同,浏览器自动化测试也可能失败,因为它仍然依赖于页面变化之前捕获的假设。 在本文中,我使用 Cursor 结合 BrowserAct CLI 来测试一个动态项目筛选器。与其依赖不可靠

2026/8/2 290
安全技术

Slopsquatting:将AI幻觉武器化的供应链攻击

依赖混淆攻击利用的是您的手误,而"Slopsquatting"攻击则瞄准您的AI助手。当模型虚构出一个不存在的软件包时,攻击者便会注册该名称,静候安装命令的执行。本文将揭示这一攻击链的全过程、常规防御手段为何对它束手无策,以及在npm、Composer和pip生态中真正有效的防御策略。 设想一下,您

2026/8/1 232