面向手工测试人员的提示工程:如何从AI工具获取有用输出 你第一次打开AI助手时,心中满怀期待。你输入"为登录页面编写测试用例",大约三秒后得到了八个测试用例:有
引言 在近期的技术会议上,一个话题引起了我的注意:每年都有更多健康设备、传感器和应用涌现。智能手表追踪心率,智能秤测量身体数据,血糖仪记录血糖水平,各类应用帮助
LLM与AI智能体完全指南 - 从单词如何变成词元,到智能体如何为你预订航班 这份指南适合谁?任何希望深入理解现代AI(而不仅仅是使用它)的人。工程师、好奇
LoRA 极速挑战 :如何在单张 L40S 上,用 LoRA 微调 Qwen2.5-1.5B 在 GSM8K 上达到 >=57% 准确率? 你能在单张 L40S GPU 上,用 LoRA 微调 Qwen2.5-1.5B 模型,使其在 GSM8K 数据集上达到 >=57% 的准确率,并跑出多快的速度?
我烧光了所有代币,只为研究如何节省代币 Bartosz Kotrys·2026年7月17日 下载PNG 2026年7月19日登上Hacker News首页 在Quesma,我们正在研究AI代理的经济学:智能编码的真实成本是多少,以及你能做些什么。为此,我运行了自己的深度研究系统——一个由代理组成的流
将 Gemma-4(2B / 4B / 12B)移植到 AWS Inferentia2 [第1/5部分] 一份关于在AWS Inferentia2(inf2)上运行Google Gemma-4系列模型的实地报告,涵盖了破坏供应商技术栈的三个架构障碍——混合注意力头、vLLM / optimum-ne
事后剖析:使用Ollama和ChromaDB构建代码库记忆的本地MCP服务器 开发者们正在抵制云API计费以及将专有代码库发送至第三方端点所带来的隐私风险。今年Hacker News上的一条讨论帖直言不讳:问题不在于每token的价格,而在于当AI代理持续轮询API时,基于使用量的计费方式具有不可预
你的评估通过率是98%?你的置信区间大概率是错的 摘要: 几乎每一个 eval 工具在报告通过率时都会附带误差条(error bar),而这些误差条几乎全都来自正态近似法:p̂ ± 1.96 × √(p̂(1−p̂)/n)。这个近似法往往是错的。
用"古典"机器学习检测 LLM 生成的网络小说(AIGC 文本检测) 截至 2026 年初,主流 LLM 生成的文本表现出强烈的统计模式,使用传统机器学习模型可以有效地将其与人类撰写的内容区分开来。我怀疑这就是许多所谓的"AI 查重工具"背后的实际工作原理。
Kimi K3:开放前沿智能 Kimi K3 是首个达到 2.8 万亿参数的开源模型,标志着 Kimi 在扩展前沿的持续推进——今年连续第三次推出前沿级开源模型。