全部 AI技术 安全技术 IT技术
IT技术

杀毒软件称未检测到恶意软件,它就在磁盘上。

一个真实事件,以及关于绿灯的教训。 下面的每个命令输出、版本号和 CVE ID 都来自实际调查。叙述中没有虚构任何内容。 这始于一个无关的问题 我在整理群晖 NAS 上的计划任务时打开了任务调度器。有两个条目我不记得自己创建过: PowerOff task 0 → 2026-07-26 09:00

2026/8/20 153
IT技术

最佳 OpenAI 兼容推理 API:2026 年的即插即用替代方案

TL;DR: 2026 年领先的 OpenAI 兼容推理 API 按字母顺序为:DigitalOcean(无服务器推理)、Fireworks AI、Groq、Nebius Token Factory、OpenRouter 和 Together AI。这六种都只需更改基础 URL 和 API 密钥即可

2026/8/19 163
IT技术

Qwen3.8-2.4T-A95B 现已在 DigitalOcean 推理引擎上提供

测量: 所有延迟和吞吐量数据均在 2026-08-12 对实时端点进行测量。 Qwen3.8-2.4T-A95B 在 DigitalOcean:阿里巴巴的开放权重旗舰模型,每 1M token 定价 $2/$6 在 NVIDIA HGX™ B300 GPU 上使用 NVFP4 量化权重提供服务,并与

2026/8/19 175
IT技术

如何用AI现代化遗留应用而避免变成重写

我曾见过一些遗留系统迁移被认为很成功,仅仅因为旧框架从代码仓库中消失了。 六个月后,团队仍在处理同样的耦合问题、同样不清晰的业务规则,以及几乎相同的部署问题。 技术虽然变了,但整个系统并没有发生太大变化。 AI 让这个问题变得更加有趣。 它可以比人工团队更快地完成代码翻译。它可以解释陌生的类、生成测

2026/8/18 126
IT技术

连续批处理可改善P50,但可能毁掉P99:实测权衡

连续批处理是现代LLM服务系统的核心特性。它被包含在每个主要引擎中,经常出现在对比图表中,其对吞吐量的影响已经得到充分证实: Anyscale 广受引用的基准测试报告称,与基础服务设置相比,吞吐量提升高达23倍,而Orca论文在早期系统上测量到高达36.9倍提升。这些结果是真实的,它们主要描述吞吐量

2026/8/18 126
IT技术

如何用vLLM扩展AI智能体的LLM推理

在本教程中,我将向你展示如何使用 vLLM 为 AI 代理扩展 LLM 推理。我将帮助你建立对 LLM 推理工作原理的直觉,探讨为什么代理工作负载会造成 GPU 调度和内存压力,并研究 vLLM 如何设计来提高吞吐量。 然后,我们将运行一个本地 vLLM 服务器,并通过一个 AI 代理使用其兼容 O

2026/8/18 140
IT技术

如何管理代码库中的上下文文件,以从AI编码代理获得更好的输出

你让编码代理新建一个端点,九十秒后你就有了一个能工作的端点。 然后你查看 diff,发现它引入了一个不在你的 package.json 中的验证库,它用 Jest 编写测试,尽管你的团队去年春天已经迁移到了 Node 测试运行器,而且它从路由处理器内部访问了数据库,因为它无法知道代码库中的每个其他处

2026/8/18 98
IT技术

RAG在生产环境中的实际运行成本:完整成本分解

几乎每个规划RAG项目的团队都会在错误的项目上担心成本。人们的直觉是,嵌入10万份文档必定昂贵,存储几十万向量需要专门的基础设施,而摄取管道才是预算的大头。这三个假设全都是错的,下面的数学计算会显示差距有多大。 以下是在DigitalOcean上,一个基于10万份文档语料库的生产级RAG系统,按项目

2026/8/17 154
IT技术

如何用Pydantic AI构建生产级智能体

使用原始LLM SDK构建AI代理在原型阶段没问题,直到你需要结构化输出、可测试的代码和生产级可靠性为止。 这种差距会以可预期的方式暴露出来。你的笔记本代码能运行,于是你把它推向生产环境并开始打补丁:在json.loads周围加try/except,写一个去除Markdown围栏的辅助函数,几个检查

2026/8/17 150
IT技术

基于PHP、cPanel和Gemini Flash每月零成本构建生产级AI智能体

在本教程中,你将构建一个实用的AI智能体,它能够接收用户提示,判断是否需要使用工具,在PHP中执行该工具,将对话历史存储在MySQL中,并持续推理直到生成最终答案。 目标不是构建一个炫酷的演示。目标是展示AI智能体如何在一个对许多开发者而言现实可行的技术栈上工作:PHP用于请求处理,MySQL用于持

2026/8/16 206