Skip to content
Go back

2026.05.22

Edit page

How Claude Code works in large codebases: Best practices and where to start

https://claude.com/blog/how-claude-code-works-in-large-codebases-best-practices-and-where-to-start 本文介绍Claude Code在大型代码库(百万行级单体仓库、遗留系统、多仓库分布式架构)中的工作原理与最佳实践。核心观点是:Claude Code通过agentic搜索(文件系统遍历、grep查找、符号跟踪)导航代码,而非依赖RAG索引。性能更多取决于工具链(CLAUDE.md、Hooks、Skills、Plugins、LSP、MCP、Subagents)而非模型本身。文章提出三种关键配置模式:使代码库可导航、随模型演进主动维护CLAUDE.md、分配专人管理Claude Code的采纳。强调CLAUDE.md要分层且精简,在每个子目录初始化会话,使用LSP实现符号级搜索,并通过组织层面的投入(专职团队、跨职能工作组)驱动成功采纳。

SFT, RL, and On-Policy Distillation Through a Distributional Lens

https://nrehiew.github.io/blog/sft_rl_opd/ 本文从分布视角比较了SFT、RL和On-Policy蒸馏(OPD)三种后训练方法。SFT直接优化固定外部分布,容易导致灾难性遗忘;RL通过在线采样和奖励信号自动约束更新,更抗遗忘且泛化更好;OPD介于二者之间,利用学生自身采样但以教师分布为学习目标。实验表明,OPD即使使用遗忘严重的SFT教师,也能保持良好泛化,证明在线采样是核心要素。文章认为,理想的算法应兼具蒸馏的密集信号、RL的无偏性和两者的在线特性。

Efficient AI Lecture 13 LLM Deployment Techniques

https://ickma2311.github.io/ML/HW-SW-codesign/efficient-ai-lecture-13-llm-deployment-techniques.html 本文从「系统视角」梳理大模型上线后端到端的效率瓶颈与解决方案。核心观点是:LLM 推理往往受限于内存带宽、KV cache 管理和调度策略,而不是算力本身。上层在数值层面通过 SmoothQuant 式 activation smoothing、AWQ activation‑aware weight quantization 和 INT4 kernel 设计,把难量化的激活重分配到权重、用少量“关键通道”保护 INT4 质量,并依赖 kernel fusion 把解码过程做成内存友好的算子链条。结构层面则通过剪枝与稀疏(权重稀疏、上下文稀疏、MoE 模块级稀疏)将「不重要的计算」从一开始就砍掉。系统层面,vLLM 风格的 PagedAttention 用分页 KV cache 提高并发与前缀复用,FlashAttention 通过 tile+fusion 降低 HBM 流量,speculative decoding 用大小模型协同提高每步产 token 的效率,最后配合 continuous batching 这种 token 级调度,在保证 TTFT 与 TPOT 体验的前提下最大化吞吐。整篇可以看成是「如何把同一个 Transformer,从算子到内存到调度,压榨到工程上真正可用、可扩展」。


Edit page

Previous Post
2026.05.29
Next Post
2026.05.15