文章 · Writing
写下来的思考
关于 AI、产品与判断方式的长文。
2026·09·23
我把 Personal Agent 开源了:这次公开了什么
Muse 出来后,我把自己的 Personal Agent 开源了。这里说明这次公开的范围,以及亲手搭建过程中,我怎样逐渐形成工程、审查和验收上的判断。
2026·09·08
从 Astra 的 Computer Use,想到 Everything Use
Astra 操作软件的表现,让我从 Computer Use 想到了接口与物理工具:数字世界可以为 Agent 改变接口,但我们生活的世界,可能更长期地要求 AI 适应已有环境。
2026·09·02
我突然发现,Coding Agent 可能只是 Personal Agent 的供应商
啃了很久自动开发 Graph 之后,我突然意识到:我真正想拥有的不是某一个更强的 Coding Agent,而是一个由我控制记忆、定义工具,并把模型和 Agent 当作服务提供方的 Personal Agent。
2026·08·21
通用 Harness 开源之后:Personal Agent 还必须自己负责什么?
Claude Code 的源码泄露让人看到成熟 Coding Agent 背后的产品工程,DeepSeek 先开源 DSH,把 Harness 做成可组合的插件体系;更晚公开的 Codex Harness 与 App Server,则展示了共享运行时怎样服务多个产品界面。把这些公共能力与我的 Personal Agent 放在一起,我不再问谁的 Harness 更强,而是复盘六个真实决策:我有哪些选项、为什么选择这一边、主动放弃了什么,又为此承担了什么代价。Finance 是已经打通真实写入、真机验收和恢复演练的第一条纵向链路,也是本文唯一的落地案例。
2026·08·16
如何评测一个 Agent:测量装置、统计纪律与判官校准
给我自己的记账 Agent 做评测时,我最意外的一条结论是:我以为我在测模型,其实我在测一个已经学会了配合模型的人。本文以 Personal Agent 一期的真实评测为主线,把踩出来的结论边界、三种「假绿」、统计纪律与证据绑定,同公开方法论体系(τ-bench、LLM-as-judge 校准、benchmark 审计)逐项对照,最后落在一条回路上:错误无法避免,所以每次错误都必须可诊断、可纠正、可回流成守门用例。
2026·08·07
用 Vibe Coding 完成 Personal Agent 一期
从模型与编码智能体路由、单一时间线与自动会话、受治理的财务 MCP,到真实 iPhone、ECS、备份与恢复,我用 16 天完成了一个只服务自己的 Personal Agent。本文记录最重要的产品决策、生产事故、评测补洞,以及为什么模型说“已经记录”从来不算完成。
2026·08·03
我为什么决定把业余时间 all in 到一个大项目:Personal Agent
从 ChatGPT、豆包、Claude Code 和 Codex,到 iCloud 云盘、GitHub 与多个个人数据源:我为什么不再继续寻找更好用的 AI 工具,而要开始搭建一套自己拥有、能够跨设备延续并对真实行动负责的 Personal Agent。
2026·07·21
大模型 API 是怎么设计的:一次传统 API 视角的逐项拆解
我对大模型 API 的认知一度停在「两个字符串进、一段文本出」。真去把 Anthropic、OpenAI 和几家国产平台的文档逐一翻完,才发现今天的大模型 API 是一台无状态的对话回放机,外挂一套内置的工具调用协议。这篇用「传统 API 设计」的眼睛逐项拆解:无状态回放与缓存四模式、stop_reason 与内容块、工具调用的挂起-恢复循环、采样参数被平台收回、API 归拢的四种哲学、协议对象从代码变成模型,以及一场很少被点破的 Anthropic 兼容端点协议战。结论是:外围全是传统 API 的老套路,真正的新物种只有核心那一小块。
2026·07·11
从 Prompt 到 Loop:为什么研发更容易自动闭环,产品工作需要让人回来
Prompt 决定这一轮怎么做,Context 决定这一轮知道什么,Harness 决定允许怎样行动,Loop 决定这一轮结束后发生什么。研发拥有测试、编译等硬验证器,产品工作的关键反馈却常在用户、业务和组织现场之外。本文从一次多 Agent 假绿和一个 iCloud 到小红书的个人工作流出发,讨论 Loop Engineering 的逻辑、适用边界,以及人在循环里的正确位置。
2026·07·01
当开放平台面对的 Agent,从开发者变成服务调用方
当 Agent 开始代表用户直接执行高风险服务操作时,开放平台要补上的不只是权限控制,而是平台可验证的本次意图确认。本文讨论的核心不是 OAuth 失效,而是第三方 Agent 的执行界面对平台变成了不透明信道。
2026·06·28
我为什么把 Agent 的记忆搬出聊天窗口
从 Claude Chat、Claude Cowork、Claude Code 到 Codex 双持之后,我越来越确信:Agent 时代真正需要沉淀的不是某个产品里的“记忆”,而是一套可迁移、可审计、可被不同 Agent 共同读取的个人上下文基础设施。我的做法是把知识库和项目 git 拆成两个事实源:知识库负责长期上下文,git 负责执行上下文。
2026·06·25
拆开飞书同一份 API 的两套 Agent 连接方式:MCP 与 CLI
飞书在同一份 OpenAPI 之上,同时做了两套面向 Agent 的连接方式:自动生成 1271 个工具的 lark-mcp,和人工策展十几个域的 lark-cli。我把两套源码、工具描述、REST 映射和 shortcut 层逐段拆开看完之后,结论不是谁替代谁,而是它们分别站在同一条「覆盖 × 质量」前沿的两个位置:MCP 负责低边际成本的广覆盖,CLI + skills 负责高摩擦任务的人工消解。而有趣的是,在飞书这个样本里,20 倍的 star 差距给出了一个清晰的开发者注意力信号:第一层自动封装很难单独形成护城河。
2026·06·24
从传统开放平台到 AI 时代:当调用方从人变成 Agent
开放平台过去十年都在优化「一个有经验的人会怎么用」。当调用方从开发者变成 Agent,衡量什么、设计什么、怎么验证都要换一套。这是在得物国际开放平台(POIZON Open Platform)上,把 Agent 真正放上去端到端跑过之后,踩出来的三段转换——以及一个不浪漫的结论:真正的门槛不在技术。