跳到主要内容

通读笔记 — tu-jie-skill-ai-ti-xiao

边读边记。行号 = 清洗文本的行号(一行一个自然段)。出处回核用 text/xx.txt:N + 短语。

前言(text/01-fm.txt)

  • 作者宝玉,业余 AI 自媒体作者,大量翻译/写稿工作。核心论点:多数人停留在「手工作坊」阶段(复制粘贴、反复改提示词),解法是把零散经验打包成结构化的「技能」(skill)。(行 2-10)
  • 翻译三阶段进化:text/01-fm.txt:18 随性对话(把 LLM 翻成「法学硕士」的笑话,行 22-23)→ 提示词工程(角色设定 + 直译→反思→意译三步 + 术语表,行 25-28;痛点:版本无法同步、只解决「内容生成」一个环节,行 30-32)→ 做成技能(交给智能体 agent 自动执行 5 步:抓网页存 Markdown→分析术语→分块翻译→拼接→审查润色,行 52-64)。
  • 翻译技能开源在 baoyu-skills(github.com/JimLiu/baoyu-skills),4 个月 1.7 万 Star;baoyu-infographic 被 Hermes Agent 官方内置(行 87-90)。
  • 技能本质与形式:本质=把个人经验浓缩为可执行、可复用的操作手册;形式=一个普通文件夹 + 核心说明书 SKILL.md + 可选脚本/参考文档(行 94-99)。不需要懂编程,难点是「思维的转换」——把脑中经验翻译成给智能体的操作手册(行 103-105)。
  • 本书收获承诺:技能原理/设计/使用;3 个单技能模板(写作风格、会议纪要、文章配图);1 条组合 5 技能的写作工作流(串联/并联/循环+子智能体);1 套工程方法论;1 次从零迭代实战(数据分析技能,交付可视化报告)(行 115-125)。
  • 全书结构:前言-第 5 章为基础篇(无需基础),第 6、7 章为进阶篇(行 130-135)。推荐按序读;想直接设计技能可跳第 4 章,不懂再回第 2、3 章(行 138-140)。
  • 平台说明:核心内容不依赖单一平台;实操示例默认 Claude Code(Anthropic 是技能发源地),兼顾扣子(Coze)、OpenClaw(行 170-175)。
  • Skill 与 Agent Skills 规范的关系(要点明):「本书主题『技能』,英文 skill,正式名称 Agent Skills(智能体技能)。最初由 Anthropic 为 Claude 系列产品设计,已于 2025 年 12 月正式作为开放标准(agentskills.io)发布;微软、OpenAI、GitHub、Cursor、字节扣子、腾讯云等已接入或兼容」(行 180-184)。「一次编写,到处运行」(行 187-188)。
  • 书名用 Skill(大写)作核心概念标识,正文统一用中文「技能」——编者注(行 177-178)。
  • 「做成技能/创建技能/封装成技能/开发技能」多种说法是有意的,不是术语不统一;做成技能的是「做事的步骤、流程和经验」,不是事情本身(行 42-45)。
  • 「AI 智能体」和「智能体」可互换(行 50)。

第 1 章 先用用:跑通你的第一个技能(text/02-ch01.txt)

  • 本章目标:零门槛体验有/无技能差异,亲手跑通第一个技能(行 2-3)。先跑起来再说,不看原理(行 9-12)。
  • 1.1 环境准备:
    • 智能体需要连接大模型才能工作,模型是「大脑」(行 18-19)。LLM/多模态 LLM(MLLM)简称大模型;通常省「大」字说「模型」(行 21-23)。
    • API Key = 模型厂商的密钥,「加油卡」比喻(行 31-33)。
    • 三条路径:扣子(零安装、中文界面、技能商店;coze.cn 对话平台 + code.coze.cn 开发平台;技能四类型:官方/第三方/自定义/企业,行 37-67)、Claude Code(Anthropic 官方,Agent Skills 标准最初在它上面实践出来;本地运行可调用本地脚本/命令行,行 69-80;订阅 vs API 按量付费,行 104-111)、OpenClaw(开源个人 AI 助手,俗称龙虾,聊天工具交互,24 小时在线;ClawHub 技能商店,行 113-128)。
    • OpenClaw 技能三层存放:工作区技能 > 全局技能 > 内置技能,同名覆盖(行 146-152)。修改 SKILL.md 不用重启(文件监听自动刷新,行 161-162)。
    • 云端智能体省心,本地智能体能力强(能访问本地文件、执行脚本)(行 191-192)。
    • API Key 保密提醒:谁拿到谁就能花你的钱,已有泄露收到上万元账单的真实案例(行 216-220)。
    • 安全提醒:本地智能体有执行前确认机制;弹出确认框先看清再允许(行 250-253)。
  • 1.2 跑通第一个技能:
    • 不用技能写周报:每次都要重说全部要求(表格三列/语气/保存格式),耗时耗力输出不稳定(行 259-277)。
    • 创建技能两方式:①需求清晰直接创建(skill-creator 引导;扣子在「技能」选项卡云端生成,行 280-318);②先对话调试再固化——在同一个对话里让智能体回顾全部对话提炼规则生成技能文件,「智能体只能看到当前对话的历史」(行 345-367,承重!)。
    • 核心价值一句话:「把你脑子里的要求变成文件里的规则,从『每次都说』变成『只说一次』,从『到处改』变成『改一处,处处生效』」(行 387-388)。
    • 伏笔:学完第 2 章「工具」概念后,技能可接邮件/代码仓库/任务管理平台,连「做了什么」都不用说(行 391-394)。
    • 技能不生效三步排查:①确认已安装(问智能体列技能)→②确认已重启(启动时扫描技能)→③检查 description(触发词没对上;把「周报」「工作总结」「每周汇报」都加进去)(行 429-460)。排查思路:全程让智能体自己做,它比你自己翻文件高效(行 465-466)。
    • 安装别人的技能:一句话让智能体下载安装;有安全风险,第 3 章细说(行 486-504)。
  • 1.3 打开技能文件夹:
    • 技能 = 文件夹 + SKILL.md。文件夹名小写字母+连字符,SKILL.md 全大写(行 513-520)。
    • SKILL.md 三部分:name(技能 ID)、description(简介,干什么+何时用)、正文(--- 之后的操作步骤/规则/检查清单)(行 557-565)。
    • YAML 前置信息(YAML frontmatter)= 两 --- 之间 = 技能的「名片」。智能体启动时只扫描名片判断该不该用,判断调用才读正文——名片管「该不该」,正文管「怎么做」(行 569-575)。这是全书承重机制之一。
    • 检查清单是 skill-creator 自动补的:判断哪些环节容易出错主动加检查项(行 566-567)。
    • 存放位置:云端在服务器;本地两层——全局技能(~/.claude/skills/,官方叫「个人技能」)和项目技能(<项目>/.claude/skills/,OpenClaw 叫工作区技能,随代码库共享)(行 577-598)。大部分采纳开放标准的智能体用统一 .agents/skills/ 路径(行 601-611)。格式跨平台一样,复制目录即可用。

自洽抽查 1/3(第 1 章)

正文是完整的讲解文字,图只是辅助(图 1-15 SKILL.md 三部分等)。文字独立可读,不是图注。可写。

第 2 章 看门道:理解技能运行的核心逻辑(text/03-ch02.txt)

  • 2.1 六大要素(AI 厨房比喻):
    • AI 聊天机器人 vs 智能体:「美食顾问」vs「完备厨房」(行 34-38)。公式:聊天机器人 = 大模型+上下文;智能体 = 大模型+上下文+工具+技能(行 45-47)。
    • 权威定义引用:翁荔(Lilian Weng) agent = LLM + memory + planning + tool use;本书公式与之工程对应(上下文≈短期记忆,技能=固化规划的操作说明)(行 49-52)。
    • 六要素:①提示词(临时性,只在当前对话生效,行 58-73);②大模型(厨师;实际是「函数调用」指令,真正动手的是运行框架,行 75-82);③上下文(厨房台面;上下文=信息集合,上下文窗口=容量上限;满了先来的被挤掉→「忘事」,行 94-116);④工具(内置 vs 扩展,行 118-132);⑤技能(菜谱,行 133-156);⑥MCP(通用插座,model context protocol;厂商适配一次、智能体支持一次,行 200-225)。
    • 一句话:工具让智能体能动手,技能教它怎么做,MCP 让外部工具无缝接入(行 221-222)。
    • 框架与模型的分工(承重):智能体 = 大模型(大脑)+ 智能体运行框架(agent harness,加载技能/管理上下文/调度工具)(行 165-168)。引用 LangChain 工程师 Vivek Trivedi「Agent = Model + Harness」;harness 无统一定义、中文译「运行框架」(行 194-198)。框架负责「递本子」(把 SKILL.md+参考文档发给模型)和「跑代码」(脚本由框架直接本地运行,不经过大模型);模型负责「读本子」和「下指令」(行 176-187)。Claude Code/OpenClaw/Codex/Cursor/Copilot 都是框架;跨平台通用的技术基础 = Agent Skills 开放标准规定了框架怎样加载和执行技能(行 170-174)。
    • 人类指令(提示词,大白话) vs 大模型指令(结构化数据,如 {"action":"search_weather"})(行 232-239)。
  • 2.2 技能比提示词强在哪:
    • 前提:被对比的不是日常指令提示词,而是试图充当「操作手册」的长篇提示词(行 250-253)。
    • 为什么需要技能:「有能力做不等于做得好」;模型不了解你的业务规范——流程性知识(procedural knowledge);技能 = 把隐性经验+专属工具封装成 AI 的 SOP(标准作业程序)(行 259-284)。
    • 模型越强技能越值得投入(反直觉判断):模型升级解决「能做好」,技能解决「做得对」(业务对齐)(行 286-293)。
    • 四大进化:①按需加载打破全量塞入(名片→正文→参考文档,行 299-303);②文件系统成为持久化工作台(中间结果存文件,可单章重译,行 306-314);③协同工作流(翻译流程 4 技能接力:素材分析→翻译→润色→配图;技能可含脚本处理硬规则任务,如分块,提示词分块不稳定又浪费词元,行 315-325);④单一信源、经验复利(唯一一份 SKILL.md,原地迭代全局生效,支持版本管理,行 331-337)。
  • 2.3 上下文与按需加载:
    • 主流上下文窗口 200K1M 词元;1M 词元≈77 万汉字长篇小说(行 347-348)。词元 token=计算文本长度单位;中文 1 汉字 0.52 词元,本书取 1.3(行 352-354)。
    • 聊着聊着变笨两原因:①历史对话占满空间;②即使没满,信息越多注意力越分散、顾此失彼(行 357-364)。解法:开新对话+把关键信息复制进第一条消息(行 366-368)。
    • 渐进式披露(progressive disclosure)= 按需加载的官方叫法,三层(行 374-378):
      • 第一层:技能名片(YAML frontmatter;必填 name+description,选填 license/compatibility/metadata/allowed-tools)。启动时全加载;触发动作=拿需求与所有 description 比对;名片早加载好,此步零额外词元;装一二十个也不撑爆(行 379-400)。
      • 第二层:SKILL.md 正文。触发有代价:消耗一次工具调用,全文进上下文,对话结束前一直占空间(行 402-412)。
      • 第三层:关联文件(linked files;references/ 参考文档、scripts/ 脚本、assets/ 静态资源)。SKILL.md 用「条件+相对路径」牵出关联文件,如「如需填写 PDF 表单,请先阅读 forms.md」(行 438-449)。引用规则:从技能根目录出发的相对路径,只引用一层,不要 A→B→C 嵌套——层级越深越容易迷路(行 451-454)。
      • 脚本在「独立沙盒」运行,上下文外;返回给上下文的只有一行精简结果——几十个字的工作记忆换几万词元的后台重活(行 456-465)。
    • 目录结构标准:SKILL.md(必填)+ scripts/ + references/ + assets/(可选)(行 474-499)。
    • 管理上下文三技巧:①严控常驻技能数:官方建议安装上限 20~50 个;中文按名片 100 汉字/技能,50 个≈6500 词元,超 200K 窗口通常分配给系统提示词 2%(4000 词元)的预算上限(行 505-512);全局技能≤10 个,项目技能放项目目录(行 514-522)。②SKILL.md 克制:官方建议正文 ≤5000 词元(约 3800 中文字)、≤500 行;重型内容拆关联文件(行 531-541)。③适时开新对话清空工作记忆:SKILL.md 一旦读取留到对话结束;连续触发多个复杂技能累积效应可怕(行 542-548)。
    • 「安装」统一定义=技能已放进工具箱且可用(行 524-530)。
  • 2.4 description 机制:
    • 底层事实:所有已装技能的 description 在智能体启动瞬间被注入「系统提示词」(行 559-563)。description 的首要读者是 AI 不是人;它是模型决定调不调技能的唯一决策依据(行 565-566)。
    • 不是死板关键词匹配,模型用推理判断相关性(行 570-573)。
    • 触发条件写在正文里等于白写:正文是第二层,决策在第一层 description 就做完了(行 575-579)。
    • 两种代价:误触发(浪费一步+占用上下文)、漏触发(模型即兴发挥,结果不稳定)(行 582-589)。
    • 工具调用惰性:大模型天生偏向少用甚至不用技能;description 必须主动覆盖高频说法(行 591-593)。任务太简单不算漏触发(行 595-597)。
    • 写法公式:description = 功能定义 + 触发场景/触发词(行 604-615)。两陷阱:人称混乱(去掉「我/你」,用陈述句)、描述太长(建议 100 字左右,最多 200;扣子上限 200 字;Claude Code 总预算=上下文窗口 2%,单条硬上限 1024 字符,推荐通用技能 50~200 字符)(行 622-651)。
    • 高阶技巧:反向触发词(「不用于润色已有中文内容,不用于改写或摘要」)解决技能内卷/抢活;装 20 个技能后会感谢自己加了(行 654-667)。

自洽抽查进度

1/3 第 1 章 ✓(文字完整,图只是辅助)。

第 3 章 捋清楚:从任务到技能五步走(text/04-ch03.txt)

  • 作者自述踩坑:一口气建十几个技能,有些用不了几次维护成本高于省下的时间(行 9-13)。核心:「不是所有任务都适合固化成技能,技能也不是越复杂越好」(行 14)。
  • 3.1 三类操作:执行规则(盐 3 克)/做判断(鱼新不新鲜定清蒸红烧)/调外援(去菜市场买鲈鱼)(行 26-55)。拆数据分析报告:规则=标题格式/精度两位小数/结论先发现后建议;判断=哪些趋势值得关注;外援=连公司数据库查表(行 43-53)。三类操作对应三种「套路」(软件工程叫设计模式)(行 60-62)。
  • 100% 准确的执行规则只写进 SKILL.md 靠模型「硬扛」不靠谱——模型基于概率预测工作,「让厨师用手掂 3.14 克盐不如用电子秤」(行 74-81)。
  • 拆解避开三陷阱:万能技能/不知道哪里该严哪里该松/出问题不知道改哪(行 87-98)。
  • 3.2 要不要做成技能:成本=创建时间+维护+每次触发消耗一次工具调用和上下文(行 116-118)。三问:①反复做吗;②对一致性有要求吗;③流程基本稳定吗(过早固化把错误流程锁进 SKILL.md)(行 124-133)。
  • 三种不该做成技能:①始终生效的规则放全局配置(CLAUDE.md;「所有菜都少放盐」贴墙上);②工具一行命令搞定的直接用工具(ImageMagick/ffmpeg);③一次性任务用提示词(行 150-169)。
  • 四个限制:①结果不完全确定→确定性环节交脚本;②通用与可靠难两全(规则越严适用越窄;「LLM/token/prompt 一律保留英文」对科普文不适用)→该严的严该松的松;③触发不一定准→description 反复测试;④不同模型表现不同→复杂技能分别测(行 174-204)。
  • 最稳起步:先让智能体裸跑一遍真实任务,观察哪里不对再针对短板写技能(行 207-209)。
  • 3.3 分工:需要做判断的交给模型,需要执行规则的交给脚本;「调味靠厨师,计时称重靠计时器和电子秤」(行 218-219)。模型强在理解与生成,短板是执行固定规则(幻觉/微小偏差)(行 226-232)。技能里的脚本=把执行规则写成的固定代码片段(行 237-239)。「你不需要自己写脚本,智能体会帮你写」(行 241)。分工粒度不是按步骤是按性质,同一步可并存(行 252-254)。
  • 3.3.3 提示词(语义驱动)/脚本(规则驱动)/技能(混合驱动)三者不能互相替代;技能填中间地带:比提示词有约束力、比脚本有适应性、比传统工作流工具轻量(行 263-279)。
  • 3.4 工具:先内置后扩展;扩展按序:现成命令行工具(ImageMagick/ffmpeg)→现成代码库(pandas/Pillow)→连在线服务才用 MCP(行 283-297)。脚本语言 Python/Node.js 最佳;库名拼写要正确(涉及安全)(行 304-310)。
  • 工具给能力,技能给经验(承重):技能的核心不是教智能体「如何使用工具」——它知道 ffmpeg 怎么用,但不知道你们团队的视频规范(1080p/5Mbps/MP4/立体声);「新厨师背熟烤箱说明书但不知道你家这台温度要偏高 10 度」(行 313-323)。调用特定工具要在 description/SKILL.md 写完整工具名(行 327-329)。
  • 3.5 安全:技能赋予智能体真实操作特权;本地智能体能力更强,安全自己把关(行 339-342)。防两类:防坏人(恶意技能)+防自己(逻辑漏洞删错文件)(行 345-348)。铁律:只用可信来源,但信任不能代替安保(行 350-351)。
  • 三道安全闸:①最小权限(门禁卡);②二次确认(高风险=删除/发邮件/执行未知代码/访问敏感数据);③可追溯(摄像头+Git 回退)(行 356-374)。
  • 四个好习惯:①安装前安检(SKILL.md 是否写清读写/联网;脚本隐藏删除覆盖上传外联;覆盖原文件;要密码密钥;库名拼写——骗子拼错一个字母伪装恶意包)(行 384-399);外部 URL 拉数据的技能风险高:外部内容可能含恶意指令(行 401-402);②第一次跑用假数据;③专属文件夹干活,不在桌面/系统根目录;④看清弹窗不无脑点「是」(行 403-411)。

第 4 章 动手做:写出你的第一批技能(text/05-ch04.txt)

  • 核心规律:「不同类型的任务,技能的写法差别很大」;先跑起来再慢慢调(行 15-22)。
  • 4.1 写作风格技能(约束型):
    • AI 味儿=写得「太好了」:标准工整无可指摘但毫无个性,输出是全人类语料的「最大公约数」(行 49-50);红烧肉「我家的味道」比喻=唯一解(行 52-53)。
    • 去 AI 味提示词三失败原因:同质化污染(AI 味 1.0→2.0)/不可复用/缺乏正面锚点——只说不要什么没说要像谁(行 37-47)。
    • 四步循环:①投 3-5 篇自己写的文章分析特点(用词/句式/结构/语气四维度,行 77-97);②用技能写文章;③手动修改(别在聊天框让 AI 改,自己动手改,修改处=风格 DNA,行 109-114;前后对照示例行 117-122);④修改版+AI 原文一起发智能体分析差异更新技能(「多年」→「十多年」=具体数字优于模糊表述;删「在当今…的时代」=删宏观铺垫)(行 125-138)。「每一次修改都是训练数据」(行 138)。迭代体感:第 1 次改一半,第 3 次核心风格对味,第 5 次只改用词,第 10 次「AI 写的比你自己写的更贴合你的风格」——AI 执行偏好比人稳定(行 140-144)。
    • 四段式框架:角色定位/风格要点(3-5 条,正反例——大模型看例子比看规则学得快)/禁止清单(优先级高于风格要点,别太长,长了让 AI 归纳成 3~5 条规律)/参考资料(术语对照表+代表作品链接)(行 156-279)。禁止清单建议先放 10 条以内(行 293-298)。
  • 4.2 会议纪要技能(模板型):
    • 约束型 vs 模板型:约束型定义「输出的质感」(全局滤镜,可叠加任何创作任务);模板型定义「输出的结构」(语义归类填进预设板块,确定性,输出框架运行前定型)(行 407-421)。
    • 模板:输入/输出格式(议题+粗体结论+待办表格+遗留问题)/写作原则(概括≤3 句、结论粗体、待办必须有负责人和截止日期缺则标 [待确认]、人名保留原文、客观不加评价、不确定标 [信息不完整] 不编造)/输出文件名 meeting-minutes-{YYYY-MM-DD}-{主题}.md(行 321-400)。
    • 模拟转录稿 11 行测试:预算 30→50 万、渠道抖音→小红书;输出结论加粗、待办有负责人截止日期、「下周三」模糊日期保持原文(行 428-473)。
  • 4.3 文章配图技能(流程型):
    • 流程型两要点:分步执行+调用外部工具(行 512-519)。五步:分析文章(适合配图:抽象概念可视化/流程图解/对比可视化/核心观点强化;不适合:代码示例/简单列表/已直观描述;数量原则宁少而关键)→选风格(科技感/手绘/极简扁平,同篇一致)→写提示词存文件→生成图片(专属目录+可读文件名 01-concept-comparison.png)→插入文章(![描述](imgs/xx.png) 前后空行)(行 525-543)。
    • 拆解步骤与 SKILL.md 步骤可以不同(承重):拆解是为了想清楚做什么,SKILL.md 是为了让大模型执行不出错;大模型「边做边想容易狗熊掰棒子」,所以加「生成配图计划」步骤逼它先列清单(行 673-683)。
    • 实测细节:文字列表不用配图规则被正确应用;选择在四步法之后画循环图而非之前画对比图——理由是循环迭代纯文字难传达、对比文字已清晰、配图边际收益低(行 692-702)。「人类做出的选择改变了 AI 给出的结果」(行 697)。「多试智能体的能力边界,新模型让以前做不到的现在能做」(行 545-548)。
  • 4.3.5 三种技能三思路:约束型管调性(隐性准则)/模板型管结构(显性框架)/流程型管工序(执行步骤+外部工具);大多数技能是混合型可叠加(行 707-719)。与第 3 章三种套路角度不同互为补充(行 730-731)。
  • 4.4 技能迭代:
    • 「你要指挥而不是动手」:发现问题→告诉智能体→智能体改技能→你验证;尽量在同一对话里改(完整上下文)(行 765-771)。
    • 改技能两原则:①一次别改太多(控制变量,定位冲突);②解释原因比堆规则有效(「代码块是精确信息,插图打断阅读节奏」比「绝对不要插图」好,能举一反三);底线用规则,偏好加解释(行 773-786)。
    • 三步验证:①触发测试(5 应触发+3 不应触发;问智能体「你什么时候会用这个技能」);②功能测试(同一输入跑 3 遍看结构/关键信息/核心逻辑稳定;模型随机不要求全同);③对比测试(有/无技能比交互轮数/出错/质量;差别不大=技能不够好)(行 788-810)。
    • 改技能为何比改软件快(行 816-838):智能体既是执行者又是修复者(在现场不用复现问题);拥有完整上下文(不用写 bug 报告);文本配置天然好改(不用编译部署审批)。前提注:历史对话未超上下文窗口(行 838)。

第 5 章 组合用:搭建多技能工作流(text/06-ch05.txt)

  • 问题起点:人肉调度器(行 5-11)。别把所有环节塞进一个技能,三痛点:可复用能力被锁死/中间缺把关/出问题不知找谁(行 16-28)。
  • 5.1 拆分原则:「好东西别锁死,拆出来复用、统一维护」(万能高汤比喻,行 45-53);附带好处:省上下文/出错好排查/改动不牵连(行 55-56)。Anthropic 和 OpenAI 文档共识:一个技能只做一件事,别写万能技能(行 58-59)。判断两问:输出是不是完整交付物?步骤会不会在别的场景被单独用?(行 64-71)
  • 讨论分析技能 discussion-analyzer:五维度(关键决定标注谁提议谁支持谁反对/待办含负责人截止日期/争议点/背景信息/过滤闲聊)(行 74-128)。
  • 文件保存两规矩(贯穿全章):①产出与输入同目录;②已有同名文件先备份再覆盖——「成本为零,但能避免事后捶桌子」(行 130-140)。
  • 会议纪要技能升级 description 优先读 discussion-analysis.md,兼容直接喂原始稿(行 146-171)。
  • 5.2 三种组合:
    • 串联(serial):A 输出文件=B 输入文件,流水线工位,中间可检查半成品(行 194-204)。
    • 并联(parallel):同一素材多方向同时开工最后挑选;单个智能体一次推理只能依赖一个上下文,硬塞同一对话必互相干扰(「版本 C 渗进版本 A 措辞,一锅粥」)→需子智能体(行 209-219)。
    • 循环(loop):润色输出终稿+报告;报告显示伤筋动骨的问题→回写作环节重写→再润色=一轮循环;循环的触发者是你不是润色技能——技能各做各的事,人做决策(行 222-241)。工业级全自动循环:独立质检技能(只列问题不动手改)自动判断打回;代价节点多成本高,适合企业级质量硬标准(行 244-257)。
    • 导演口令:说清楚中间产物和暂停点(行 266-298)。并联口令末句「你只给我三份文件的路径和一句话摘要」不是客气,是控制主上下文(行 284-287)。
    • 技能间传数据三方式:文件路径(大块)/上下文共享(短对话)/格式约定(文件名对上自动衔接);经常混用(行 300-306)。
  • 5.3 子智能体(sub-agent):
    • 定义:主智能体派出的专项助手;独立上下文+自己的系统提示词+可限定工具(行 322-329)。主厨/副厨;主厨只看成品不关心中间折腾。
    • 三特性:①独立上下文(从零开始,不知道主对话——既是优势不被干扰也是限制:信息须显式传入);②过程隔离(工具调用/中间结果全留自己上下文,主智能体只收摘要或路径——第 2 章「比清空更优雅的解法」就是它);③同时开工(并联基础)(行 331-345)。
    • 触发:自动委派(子智能体有 description;Claude Code 的 Agent 工具旧称 Task;内置 Explore/Plan 只读、general-purpose 读写执行)/显式调用(点名/@名称)(行 375-391)。
    • 传信息两路径:任务描述直接写(方向+少量关键信息;塞大段素材挤占主上下文);传文件路径(大块数据绕过主智能体;文件持久,多个子智能体读同一份天然共享)。最佳实践:提示词传「决策和方向」,文件传「数据和内容」(行 395-409)。
    • 任务描述四要素:目标/约束/输入/验收;「只审查不修改」对应工具权限控制(行 426-460)。
    • 两注意:信息交接会丢失;子智能体之间隔离(须主智能体中转或文件系统共享)。一个上下文能搞定的事别派子智能体(行 462-473)。
    • 技能 vs 子智能体判据:「需不需要了解中间过程」——轻任务要看过程用技能;重任务只要结果用子智能体(行 474-489)。自定义子智能体=.claude/agents/ 下 Markdown(YAML 头+系统提示词)(行 495-505)。
    • 智能体团队(agent teams):成员可直接发消息共享任务列表;判断「子任务间需要互相通信吗」;大多平台仍实验性(行 506-513)。
  • 5.4 五技能写作工作流:素材分析(content-analyzer;静态资料与动态交流提纯逻辑不同,不能复用 discussion-analyzer)/大纲(outliner;3-5 个差异化方案,「等待用户选择」=人工检查点)/写作(writer;加载 writing-style 作全局约束+内置验收自检=出厂检验非审文笔)/润色(article-polish;先诊断后修改,输出报告+终稿)/配图。主线串联+润色处循环+并行写作并联(行 520-545)。
    • 加载 vs 串联:串联有先后;加载同时生效不分先后;润色加载风格后只改问题不改风格(行 796-802)。
    • 技能互调写死名字 vs 描述能力:判据「换成同类另一个还能工作吗?能→描述能力;不能→写死名字」;多数情况倾向描述能力(行 804-810)。
  • 5.5 演进心得:
    • 四周演进:第 1 周素材分析+写作→第 2 周加大纲+风格(人工检查点比全自动好)→第 3 周加润色(加载风格后只改问题)→第 4 周加配图+并行子智能体(行 861-879)。关键:先跑通两个技能串联的最小可用版;等哪个环节成瓶颈再加技能(行 881-883)。
    • 效率:一篇文章选题到成稿从三四小时缩到四十分钟;省的不是思考是体力活;留手里的是定选题/判断方向/终审把关(行 890-893)。
    • 三个坑:①一开始就想搭完整版→「加一个,跑通」;②子智能体返回全文塞爆上下文→口令加「只返回路径和摘要」;③润色改我的风格→加载写作风格技能(行 903-914)。
    • 工作目录示例 posts/2026-05-15/ai-agent-skills/:source.md/analysis.md/outline-a/b.md/draft-outline-a.md/final.md/imgs/——每步产出都是文件,草稿不行对比 draft 和 analysis 就知道是写作还是分析的问题(行 916-935)。

第 6 章 工程化:从需求到上线的技能开发全流程(text/07-ch06.txt)

  • 起点故事:技能分享给三个朋友都翻车——A 换语言不好用(只测过英翻中)、B 没配 Gemini API Key 画不了图、C 传 PDF 卡死(只测过 Markdown)(行 11-15)。给自己用 vs 给别人用要求完全不一样;隐含假设大部分不成立(行 17-22)。
  • 软件工程五阶段:需求分析→设计→实现→测试→上线与发布,套用到技能完全适用(行 25-29)。
  • 6.1 需求分析:
    • 好技能从真实痛点长出来:反复手动做→发现重复→提示词固定→发现局限→封装成技能(行 46-53)。
    • 技能需求卡 6 问:问题/场景(触发)/输入/输出/规则/禁止清单——答案基本就是 SKILL.md 骨架;小红书信息图技能例(竖版 3:4 卡通手绘、每张一个核心信息、不能用写实风格、不能跳过大纲确认)(行 60-84)。需求不需要完美,先写初版在使用中迭代(行 86-89)。
  • 6.2 设计四招:
    • ①踩坑点(gotchas):Anthropic 内部几百个技能的实践——信息密度最高的部分往往不是流程说明而是踩坑点(引 Thariq @trq212 "Lessons from Building Claude Code")。菜谱空白处铅笔字比喻(行 112-121)。例:「总以为模板放 references/ 智能体自己会去找,结果它根本不会主动跨文件读取——必须明确指令」(行 132-133)。与禁止清单区别在时间线:禁止清单=事前硬底线;踩坑点=事后暴露的盲区(行 137-139)。
    • ②可容错:「永远不要假设用户会按你期望的方式使用产品」。三方面:开头检查输入(空/格式/太长;遇 PDF 提醒转换);关键步骤人工确认(小红书技能最初没确认,方向不对图全白费);中间结果随手存文件(生成失败提示词文件还在,重跑不用从头来)(行 143-174)。
    • ③可扩展:开闭原则。封面图技能案例:穷举风格列不完→拆六维度(构图/色彩/渲染/元素密度/情绪/文字布局)32 个选项组合 18900 种变体——「用维度组合替代穷举」(行 183-198)。EXTEND.md 扩展文件:.baoyu-skills/<技能名>/EXTEND.md(项目级)>~/.baoyu-skills/(用户级);别放技能安装目录——升级被覆盖(行 200-228)。YAGNI:扩展性是跑通之后才考虑的;过早为将来需求设计=不必要复杂度(行 230-234)。
    • ④跨对话记忆:微信群聊精华技能——history.json 记录上次汇总最后一条消息时间+按日期存精华,下次只拉新消息(行 236-250)。第 7 章数据分析也用:记录每次分析的数据文件名和核心发现,下次对比变化(行 267-268)。记录文件放稳定目录(行 270-271)。
    • 设计检查清单 8 项:单一职责/按需加载/可预测/可容错/可扩展/跨对话记忆/踩坑点/禁止清单(行 273-291)。
  • 6.3 实现:人机协作——你定需求和标准(决策者+验收者),智能体写和改(执行者);「技能是给智能体用的,它比我们更清楚什么指令适合自己——让使用者自己写使用说明」(行 299-302)。四阶段:MVP(能用)→功能补齐(做加法)→架构重构(做拆分)→持续优化(打磨)。小红书信息图技能:提示词模板→约 200 行初版→20 多次迭代→641 行主文件+26 个参考文档(行 315-348)。
  • 6.4 测试=评测(Eval):
    • 先定考题再测考生:第一印象绑架判断力——「先看答案再出题」(行 385-388)。测试用例三部分:指令(像真人说话)+输入+期望结果(行 389-391)。起步 2-3 个;要求:像真人/覆盖多种情况/别忘了反例(反例拿「帮我把这段话改得更通顺」这种真正易混淆的;反例比正例难写也更有价值)(行 411-420)。
    • 测试用例别写进 SKILL.md;踩坑点写进 SKILL.md(教做事),失败案例存题库(留案发现场)(行 422-437)。
    • 检查项=客观可判对错(「纪要包含待办事项清单」「篇幅不超过原文 30%」「技能被正确触发」也是检查项);不好:「输出质量好」/「必须出现『总收入:X$』精确措辞」太脆弱(行 440-458)。检查项可以后补(行 460-462)。
    • 对比打分:同一用例有/无技能各跑一遍——评测价值不在绝对输出,在相比裸跑把下限提升多少(80→85 可能不值得维护;30→90 价值一目了然)(行 464-469)。
    • 三动作:①记分表(看实质不放水:有待办标题但只有一句模糊话=不通过;记依据);②主观验收(检查项管客观人眼管主观;反馈要具体可执行:「context window 被翻成『上下文窗户』」而不是「翻译得很死板」;大模型听不懂情绪只听得懂指令)(行 471-504);③质量与耗时经济账(40→85 分但 5 秒→30 秒需取舍)(行 506-509)。
    • 对症下药:治病治根——「只为眼前用例打补丁=考前背答案」。LLM→法学硕士案例:打补丁=「LLM 应翻译为大语言模型」(只救一个词);通用解=「根据文章所属领域判断术语含义,优先采用该领域通用译法;无通用译法保留英文」——连 agent/hallucination 一并覆盖(行 519-528)。停止条件:反馈为空或连续两轮改进幅度小(行 532-533)。三心法:检查项本身也要迭代;老技能升级基线是「改之前的老版本」;把反馈交给智能体提方案,你拍板(行 535-548)。
  • 6.5 上线与发布:三场景逐级叠加:个人自用(安全清单:权限控制/不可逆操作;风险分层低中高)→团队分享(分发:项目仓库 .claude/skills 或内部技能市场避免全塞进每个人上下文;质量:Anthropic 内部=沙盒试用/Slack 推荐,获得关注再正式发布;「发布前有人用过觉得好用」)→社区发布(用户决定不超一分钟,关注三件事:简介能看懂/有示例/装完能跑通;清单:重审 description/说明文档/清理个人信息(key、token、password、绝对路径;<YOUR_API_KEY> 占位符)/加版本号;各平台三内容:slug/version/文档;发布后向后兼容——不改核心触发词固定输出字段,优先外挂扩展;停更要标注并推荐替代)(行 568-698)。
    • 按需钩子:Claude Code hook 机制+/careful 触发严格模式;PreToolUse 钩子检测 rm -rf、DROP TABLE 拦截;并非内置安全开关而是钩子+技能组合(行 602-614)。

第 7 章 上实战:从零迭代数据分析技能(text/08-ch07.txt)

  • 开场:35 行 10 列品牌投放数据;裸跑只做算术(整体 ROI 2.271、美妆 3.06、服饰 1.39、食品 GMV 占 43%、退货率 7.7%、服饰 16%、3 行缺失);你想要的(哪条在亏钱/退货率与 ROI 关系/食品是否下滑)一个没碰→「提示词复读机」(行 7-30)。
  • 三版本:V1(稳定性)/V2(深度)/V3(交付感)。「需求不是规划出来的,是每一版用完之后才浮现的」(行 67-73)。本章教迭代方法,数据分析只是载体(行 76-85)。
  • 测试纪律:三版同一句话+同一份 CSV(行 100-104)。
  • 7.1 V1(20 多行):取舍 4 条:只分析不可视化/输出对话不生成文件/只要一个 SKILL.md(20-30 行强迫只写核心)/没指定 pandas 也没列统计指标——智能体自己选的;「你负责说清楚『要什么』,智能体负责决定『怎么做』」(行 118-128, 193-196)。产出:概览+板块分布+关键发现框架。「V1 没让智能体变聪明,而是通过技能约束让输出稳定、可复用」(行 227-230)。吃狗粮:分析太浅/没结构/没优先级;根源=只说「做统计」没说「怎么思考」(行 232-246)。
  • 7.2 V2(60 多行):
    • 决策:只改分析深度和输出结构;三阶段分析法(理解结构→统计概况→挖掘发现);给指引而非脚本(多工作表/编码/表头异常表现多样,写死脚本覆盖不全)(行 261-276)。
    • 智能体自主补全:提示词只给「分层递进」方向,具体检查项(均值中位数差距>20% 分布偏斜、p25/p75/p95、偏离 2 个标准差、|r|>0.7 强相关)都是智能体补的(行 309-311)。
    • 分析哲学:so what——对比产生意义(「退货率 7.7%」是死数字,「服饰是美妆的 4 倍」才有冲击力)/标题就是结论/异常值是金矿/警惕虚假精确(「约 5%」比「4.73%」更可信)(行 369-383)。
    • 输出结构:一句话摘要/数据全貌/核心发现 3~5 条/值得关注/建议(行 386-405)。
    • 测试:颗粒度说明+均值中位数并报+r=-0.79 强负相关+结论式标题+主动指趋势+建议(行 433-481)。
    • 2.27 vs 2.17 之谜:V1 简单平均(每条 ROI 相加÷35),V2 加权 ROI(总 GMV 604.5 万÷总消耗 278.2 万);加权让花钱多的记录权重大;两个都对含义不同(行 483-488)。
    • 主线测试 vs 边界测试分开(行 489-492)。
  • 7.3 V3(100 多行+2 参考文档):
    • 四决策:坚守边界(只改输出形式);引入参考(判断标准「智能体是否需要参考物照着做」;过早复杂度过晚不稳定);给样板不给死模板(report-template.html=组件库:KPI 卡/发现卡片/数据表格/Chart.js 函数);给方向不给参数(design-brief.md 全篇没有一个色值一个像素)(行 519-556)。
    • 给方向 vs 给参数:写死「主色深蓝间距 16px 圆角 8px」=把智能体退化成模板填充器;给方向它自主补全字体/间距/阴影/交互——「把微观决策权还给智能体才是更高级的设计」(行 549-556)。
    • design-brief:杂志风 editorial;《经济学人》/麦肯锡/彭博(别用彭博黑底,打印要明亮);受众决策层;大小反差;≤2 主色+语义色;禁止清单(不要 Chart.js 默认配色/不要所有卡片一个样/不要纯装饰/不要彩虹色)(行 637-706)。正面描述+禁止清单必须配合:只有正面牵引细节踩雷;只有禁止无所适从(行 707-710)。
    • 图表选择:类别对比→柱状/趋势→折线/占比→环形(≤6 类)/关系→散点/分布→直方图(行 740-749)。
    • 验收:浏览器可打开;≥1 行 KPI+3 图+1 表;无图表类型错误;视觉层级清晰。智能体自主完成没要求的细节:字体/阴影/悬停交互(行 776-814)。
  • 7.4 回顾:
    • scripts/ 为空:四个环节(读数据/分析/选图表/生成报告)核心决策都在大模型,现场判断动态生成代码;因为每个环节都涉及判断,没有「每次逻辑完全一样」的确定性任务(行 844-855)。
    • 什么时候用脚本:格式标准化(「2025/1/3」「2025 年 1 月 3 日」「Jan 3, 2025」→「2025-01-03」)输入多样但规则确定;判据「同样的输入是否应产生同样的输出?是→脚本;不是→大模型+参考模板」(行 858-862)。
    • 什么时候给领域知识:结论「正确但外行」(知道 ROI 1.39 不知道 <1.5 通常亏损;知道退货 16% 不知道服饰>10% 该预警)→缺的是领域常识;references/ 加基准值文件+SKILL.md 加加载指引——只放 references 不提及,智能体未必主动读(行 864-870)。
    • 四心法:克制引入参考;方向优于参数;正面+禁止组合;好技能不改变用户使用习惯——「帮我分析一下这份数据」从 V1 用到 V3 一字未改,复杂度锁在技能文件里(行 872-897)。

结语 从菜谱到厨艺(text/09-fm.txt)

  • 菜谱 vs 厨艺:菜谱是死的厨艺是活的;厨艺=面对没见过的场景能判断该不该做成技能/拆几步/哪几步给智能体;判断力只能动手踩坑积累(行 2-11)。
  • 四心法:①好食材比好菜谱重要——技能装的是你的经验;「你在某个领域干三五年攒下的手感就是最好的食材,SKILL.md 只是装盘的容器」(行 15-27)。②先开火别等万事俱备——「菜做砸了可以重做,一直不开火什么也做不出来」(行 29-41)。③你掌勺 AI 打杂——「写书技能」失败了:AI 写两千字文章没问题,写几万字前后呼应的书不行(前面讲清的概念后面又从头解释);但全书内文插图、格式整理全靠技能(行 43-57)。④吃到好菜就把做法变成自己的菜谱——「做过三次的事,做法就值得写成技能」;访谈稿技能=拿好样本反推;「你出标准,智能体出初稿,你修改」(行 59-72)。
  • 关于这本书(行 77-91):「模型会换代产品会更新,但技能不会过时——技能的本质是你的业务经验」。落款:宝玉,2026 年春(行 92-93)。
  • 行 111-163 字体授权(SIL OFL)、164-175 目录——跳过不引。

自洽抽查 3/3

第 1/4/7 章抽查通过:文字是完整讲解,数字密集,图只是辅助。本书文字自洽,可写。「图解」类风险(文字只是图注)不存在。