我筛过的 LLM 和 agent 信息源
最近刷了不少 LLM 和 agent 相关的内容,有些确实有用,但大部分都是噪音。
所以我给自己攒了一份实用清单:几个信息源,再加一套思考框架,帮我做出不止能跑 demo 的 agent。
目前固定在看的有这几个:
- 小红书上的各种“更新”帖(反应快,当趋势雷达用)
- Latent Space Podcast
- Anthropic 博客(Newsroom / 动态)
- LangChain 博客
现在我正把它们理成一套体系。
思考框架(借鉴 Anthropic 的“Building Effective Agents”)
我从 Anthropic 那儿偷师来的核心思路很简单:
先用最简单的 workflow 把问题解决掉,复杂度真的需要了,才一步步把它“agent 化”。
这个思路很对工程师的胃口:给 agent 放权之前,先做出一个能观测、能测试、能 debug 的东西。
做 agent,我分三层来想:
1) 基础组件(primitives)
不管做什么系统,这几样都会反复用到。
- 工具 / 动作空间
Tool calling 已经是标配了,真正费功夫的在别处:agent 怎么发现工具,权限怎么管,schema 怎么写规范,还有工具一多,怎么不让上下文爆掉。
- 环境 / 状态
Agent 干活的地方不在聊天记录里,在环境里:浏览器、文件系统、UI 状态、终端、数据库。
- Memory / context engineering
- 存什么,不存什么
- 什么时候写进去
- 怎么检索
- 怎么压缩,又不影响正确性
“Memory”没法打个勾就完事,背后是一连串设计决定:
2) 模式(可组合的架构)
我不会一上来就奔着“通用 agent”去,更习惯用模式来想问题,下面这几种拼在一起很干净:
- Prompt chaining / Routing / Parallelization
- Orchestrator-Workers
- Evaluator-Optimizer(审查 → 改进 → 再评估,一轮轮循环)
3) Harness 和 eval(可靠性)
Demo 和能上线的东西,差就差在这一层:
- 可追踪
- 失败模式分类
- 安全重试
- 工具报错怎么处理
- 长时间跑下来不跑偏
可靠性量不出来,我就不信。
我的信息源(按“每分钟干货量”排序)
大致这么分:
- Tier 0:一手信息源,订阅了定期扫一眼
- Tier 1:“翻译官”,也就是把研究讲成工程经验的 podcast 和 newsletter
- Tier 2:benchmark 和 eval,当校准工具用,免得自己骗自己
Tier 0:一手信息源(必看)
Anthropic(研究 / 工程)
- Building Effective AI Agents
- Demystifying evals for AI agents
OpenAI 文档(agent 和 tool calling)
- Function calling
- Agents Python 文档
LangChain / LangGraph / LangSmith
- Deep Agents
- LangSmith Agent Builder
Manus(context engineering,很实用)
- Context Engineering for AI Agents: Lessons from Building Manus
Hugging Face(盯开源生态)
- smolagents
Google DeepMind 博客(看研究趋势)
- DeepMind 博客
Tier 1:podcast / newsletter(每周挑几期)
- Latent Space Podcast
- High Agency (Humanloop)
- The Cognitive Revolution
- The Gradient Podcast
- TWIML AI Podcast
- Import AI (Jack Clark)
Tier 2:benchmark / eval(拿来校准)
- AgentBench(把 LLM 当 agent 来测的 benchmark)
- WebArena(网页环境的 benchmark,很适合测浏览器和工具类 agent)
中文信息源(快,噪音也多,但还是有用)
这些我当趋势雷达用,不当事实看。图的是先拿到“早期信号”,再回 Tier 0 核实。
网站 / 多平台同步更新
- 量子位(QbitAI)
- 机器之心(Jiqizhixin)
我真在看的公众号
论文、产品更新、行业动态,这几个号一直跟得很快:
- 量子位 / QbitAI(公众号:QbitAI)
- 新智元(常有人拿“智能+中国”来概括它)
- 机器之心(公众号:almosthuman2014)
- PaperWeekly(偏论文解读/研究动态)
- DeepTech 深科技(偏“深科技”与产业侧)
- 机器学习研究会(更偏学术/研究社区)
小红书(我拿来筛内容的关键词)
MCP、LangGraph、agent eval、context engineering、tool calling、memoryYouTube(重实现,轻炒作)
- AI Engineer
- Latent Space(视频)
- LangChain
- Hugging Face
X(Twitter)上抓“早期信号”的账号
机构
- Anthropic
- LangChain
- Hugging Face
- Google DeepMind
个人
- Harrison Chase
- Simon Willison
- Jack Clark
动手实践(免得一直纸上谈兵)
1) nanochat:极简的端到端 ChatGPT 式技术栈
每次觉得自己看得太多、动手太少,我就回到一个 repo,把它底层是怎么串起来的从头捋一遍。
- Karpathy
我记笔记的模板:
- 数据怎么处理,token 怎么切?
- 训练循环里,工程上的关键点在哪?
- 有哪些 eval?最小能用的 eval 长什么样?
- 端到端看,推理 / serving 的循环是怎么跑的?
2) Memory 优先的 agent(MemGPT / Letta)
我越来越确信,对要长时间跑的 agent 来说,memory 是真正能拉开差距的东西。倒不是因为它多炫,主要是它能减少重复,前后也更连贯。
我关心的几个点:
- memory 分层(工作记忆 vs 长期记忆 vs 外置记忆)
- 写入策略(什么时候把 memory 正式存下来)
- 检索策略(取回什么,什么时候取)
- 压缩,但不能影响正确性
这部分链到了另一个页面,我在那边做些小实验(同一个任务连跑好几天,统计步数、重试次数和工具报错)。
我的每周节奏(轻量版)
- 每天(10 分钟):扫一眼 Tier 0(Anthropic / OpenAI / LangChain / Manus)
- 每周(1 小时):听一两期 podcast(Latent Space 或 High Agency)
- 每周(30 分钟):读一篇 eval 或 benchmark 论文,或者一篇专讲 eval 的文章
- 每两周:写一篇短笔记,记下“学到了什么 + 打算怎么用”
给自己的提醒(免得跑偏)
- 别追新热词,去追新的失败模式,看别人是怎么修的
- 多看复盘和生产环境的实战故事,少看“十大框架”这类榜单
- 可靠性还量不出来,就不算做完