Skip to content
Go back

2026.05.29

Edit page

How to Eval AI Agents — The 2026 Guide

https://www.howtoeval.com/

本文强调了在生产环境中评估AI代理的关键原则:从“提升底线”(floor raising)而非“基准最大化”(benchmark maxxing)出发,通过错误分析发现关键故障模式;使用代码感知的离线评估测试完整代理路径(工具调用、状态、输出);在生产中基于流量规模逐步扩展监控(从原始日志到实验验证);保持评估循环持续迭代,将真实故障转化为目标回归测试。最后展望了评估工具随模型能力增强而简化的趋势。

Attention the series 注意力机制系列图解

https://www.byhand.ai/p/library-series-models-attention

本系列配合 11 个交互式图解,从 QKV 投影、注意力计算,到自注意力、交叉注意力、多头注意力、Multi‑Query / Grouped‑Query 等变体,系统讲清 Transformer 中 attention 机制的全套细节与工程优化

Recent Developments in LLM Architectures KV Sharing, mHC, and Compressed Attention

https://open.substack.com/pub/sebastianraschka/p/recent-developments-in-llm-architectures?r=5xjw3n&utm_campaign=post-expanded-share&utm_medium=post%20viewer

本文综述了2025年4月至5月间发布的主要开放权重LLM在架构上的最新进展,重点关注降低长上下文推理成本的技术。文章详细解析了Gemma 4的跨层KV共享与逐层嵌入、ZAYA1的压缩卷积注意力、Laguna XS.2的逐层注意力预算分配,以及DeepSeek V4的流形约束超连接与混合压缩注意力等创新设计。这些改进通过复用KV缓存、在压缩潜在空间计算注意力、按层分配计算资源等方式,在保持或提升模型质量的同时,显著降低了KV缓存大小和注意力计算开销。


Edit page

Previous Post
2026.06.05
Next Post
2026.05.22