The Anatomy of an LLM Benchmark
https://cameronrwolfe.substack.com/p/llm-bench 本文深入剖析了大型语言模型(LLM)基准测试的构建与演进。文章首先通过分析 MMLU、GPQA、BIG-Bench、IFEval、AlpacaEval 及数学评测等流行基准,总结了其数据来源、质量保证、性能测量及迭代改进的通用模式。随后,文章探讨了利用项目反应理论(IRT)进行高效、动态评估的高级技术,如 tinyBenchmarks 和 Fluid Benchmarking。最后,文章提炼出创建有效基准的关键原则:建立领域分类法、结合人工标注与模型辅助、确保数据质量与真实性,以及实现基准的持续演进以避免模型能力饱和。
How to finally trust Claude’s advice
https://x.com/itsolelehmann/article/2038661433626333649 本文介绍了 Ole Lehmann 基于 Andrej Karpathy 的 LLM Council 理念开发的一项 Claude 技能。该技能通过创建五个具有不同思维方式的 AI 顾问(逆向思维者、第一性原理思考者、扩张主义者、局外人、执行人)来共同分析用户问题。这些顾问首先独立提出观点,然后进行匿名同行评审,最后由一个主席模型综合各方意见,生成一份包含明确建议和具体后续步骤的报告。文章以作者自身的产品决策为例,展示了该方法如何帮助发现单一AI模型可能忽略的盲点,从而做出更可靠、更全面的决策,避免因AI的“迎合性”而导致判断失误。
看看 Claude Code 怎么做 Harness,这才是 Agent 工程化的真正难点
https://mp.weixin.qq.com/s?__biz=Mzg5NTc0MjgwMw%3D%3D&mid=2247523594&idx=1&sn=50d9ebaf29db369bf436a17c1415e6d1&chksm=c1bfb0752dce66a86afc8d5881c7146c26d4c79c6044d22588485e011c41fbd8242035e695f5&mpshare=1&scene=1&sharer_shareinfo=e07b74d00c4cabf56ac6251b43f937d1&sharer_shareinfo_first=e07b74d00c4cabf56ac6251b43f937d1 本文深入分析了 Claude Code 泄露源码中展现的 Agent 工程化核心—— Harness 设计。文章指出,真正的难点在于构建一个可靠的本地运行时外壳,而非模型本身。Claude Code 采用 TAOR 循环,将智能下沉到模型,保持运行时“愚蠢”以提升架构稳定性。它围绕上下文窗口管理、分层记忆系统、可组合权限控制以及多 Agent 编排(子 Agent 与 Agent Teams)构建了一套精密的工程体系。此外,文章还揭示了未发布功能 KAIROS(常驻后台 Agent)以及反蒸馏、隐身模式等争议性工程决策,展示了从 Demo 走向企业级生产环境的Agent产品全貌。