-
Brody - 2026/05/21
MCP 与 Skill:搞清楚 AI 能力扩展的两个核心概念
在 AI 和智能体(Agent)开发领域,MCP(Model Context Protocol,模型上下文协议) 和 Skill虽然都与「扩展 AI 的能力」有关,但它们处于完全不同的架构层级。 简单来说:MCP 是「接口标准」,而 Skill 是具体的「功能实现」。 就像 MCP 是电脑上的 USB 接口协议,而 Skill 则是插在这个接口上的 U 盘、鼠标或打印机。核心概念对比 MCP (Model Context Protocol) MCP 是由 Anthropic 开源的一种标准化通信协议。它解决的是「AI 模型如何安全、统一地连接外部数据源和工具」的问题。本质: 一套 Client-Server 架构的底层基础设施。 作用: 过去,开发者要让 AI 查数据库、读本地文件、调用外部 API,需要为每个平台写定制化的集成代码。MCP 提供了一套通用标准,只要数据源封装成了「MCP Server」,任何支持 MCP 的 AI 客户端(如 Claude Desktop、Cursor、各类 IDE 插件)都可以无缝接入,读取上下文或调用工具。 关注点: 安全性、连接性、标准化、跨平台。Skill (技能) Skill 通常指的是 AI Agent 能够执行的具体任务或业务逻辑。这个概念在 AI 行业存在已久(比如 Amazon Alexa Skills,或者智能体框架中的 Tools/Actions)。本质: 封装好的业务能力。 作用: 赋予 AI 完成特定指令的能力。例如:「搜索网络」、「查询天气」、「总结指定的本地 PDF 代码库」、「在 Jira 中创建一个 Bug 工单」。 关注点: 业务逻辑、Prompt 设计、输入输出的处理。详细区别 {% table %}维度 MCP (模型上下文协议) Skill (技能)层级定位 底层/架构层 (Infrastructure) 上层/应用层 (Application/Logic)核心问题 AI 如何与外部世界建立标准化的连接? AI 能够为用户完成什么具体任务?通用性 极高。跨平台、跨模型通用。 较低。通常依赖具体的提示词或特定的 AI 框架。开发对象 开发「MCP Server」,定义资源(Resources)和工具(Tools)的暴露方式。 编写代码逻辑或 Prompt,定义输入参数、执行动作和输出结果。 {% /table %}它们是如何协同工作的? 在现代的 AI 架构中,MCP 往往是实现 Skill 的底层通道。 假设你正在为运维团队开发一个基于 RAG(检索增强生成)的企业知识库系统: 没有 MCP 之前开发 Skill: 你需要写一个大长串的 Python 脚本,直接把 AI 的 API 和公司内部的 Confluence API 绑死在一起。这个「查文档」的 Skill 只能在你的代码库里运行。 使用 MCP 之后开发 Skill:你开发一个连接 Confluence 的 MCP Server。 这个 Server 向外暴露了一个叫 search_internal_docs 的 Skill(或 Tool)。 现在,不仅是你自己写的代码,团队里的开发者用 Cursor 写代码时,或者用 Claude 客户端聊天时,只要连接了这个 MCP Server,他们的 AI 就瞬间具备了「查询公司内部运维文档」的 Skill。总结:你可以通过 MCP 协议,将各种强大的 Skill 标准化地分发给不同的 AI 应用。有了 MCP,为什么还到处是 Skill? 这是一个很敏锐的问题。你可能会觉得:「既然已经有了一个统一的底层协议(MCP),为什么还要反复强调或者大量去写上层的 Skill 呢?」 其实,MCP 的出现不仅没有消灭 Skill,反而直接促成了 Skill 的「大爆发」。像 Claude、Cursor 现在之所以大量依赖 Skill,正是因为 MCP 把开发和接入 Skill 的门槛降到了前所未有的低。 1. 模型本质上是「缸中之脑」,它永远需要手和眼 无论是多么强大的大语言模型(Claude 3.5 Sonnet、GPT-4o),它们的本质都只是一个「文本预测引擎」。如果没有任何外部工具,它们既不知道现在是几点,也无法读取你 MacBook 上的本地文件,更无法帮你执行终端命令。Skill 就是 AI 的手和眼睛(例如:读取本地文件、执行终端命令、搜索网页)。 MCP 是连接大脑(AI)和手眼(Skill)的神经系统。神经系统再好,没有手眼也干不了活。因此,要想让 AI 真正帮你干活,依然需要大量具体的 Skill。 2. 「解耦」带来了类似 App Store 的效应 在 MCP 出现之前,如果 AI 厂商想让 AI 拥有一个新 Skill(比如「读取本地代码库」),他们必须亲自在自己的客户端里硬编码写死这套逻辑。这导致 AI 能干的事情非常受限。 有了 MCP 之后,发生了类似「苹果推出 App Store」的效应:以前: Claude 团队自己吭哧吭哧写几百个集成逻辑。 现在: Claude 只需要说「我支持 MCP 协议」。然后,全世界的开发者就可以用几行代码写出一个「读取本地 Git 仓库」的 Skill,或者「查询 Jira 状态」的 Skill,封装成 MCP Server 喂给 Claude。正因为 MCP 提供了一个标准的「插座」,现在任何开发者都可以轻松地把成千上万个 Skill(U盘)插到 Claude 这个主机上。 3. 具体到代码开发场景 假设你在本地 macOS 环境下进行开发,遇到了依赖管理或编译报错的问题,AI 需要帮你排查。AI 要真正解决问题,它可能需要调用以下几个 Skill:read_file:读取你本地的配置文件 execute_command:在你的终端跑一下相关的环境检查命令 search_internal_knowledge:去你们公司的内部运维知识库检索在这个过程中,MCP 和 Skill 是如何配合的?Claude/Cursor 客户端 会通过 MCP 协议 与你本地机器上的服务建立安全连接。 通过这个连接,AI 会发现你暴露给了它上述三个 Skill(工具)。 AI 大脑经过思考后决定:「为了排查这个依赖报错,我需要调用 execute_command 这个 Skill。」一句话总结 MCP 是修好的高速公路,而 Skill 是跑在上面的货车。 正因为高速公路(MCP)修通了且标准统一了,你才会看到现在马路上跑着比以前多得多的货车(Skill),去帮你运送数据、执行任务。 未来,随着企业知识库、自动化工作流的普及,这种原子化的 Skill 只会越来越多。搞清楚这两个层级的关系,是理解 AI 工程化、构建真正有用的 AI Agent 系统的关键第一步。
-
Brody - 2026/05/16
软件开发正迎来它的「印刷机时刻」
编程的「印刷机时刻」:当代码消失,软件开发的权力将归还给每一个人在人类文明史上,15世纪的古腾堡印刷术是一个转折点。在那之前,欧洲只有约10%的人掌握读写能力,他们是受雇于权贵的"专业人士"。印刷机的出现让书籍成本下降了100倍,在接下来的50年里,欧洲产出的文献超过了过去一千年。虽然普及教育用了几个世纪,但它最终让文字从精英手中的权杖,变成了人人都能使用的工具。 如今,Anthropic 的 Boris Cherny 提出了一个大胆的断言:软件开发正迎来它的「印刷机时刻」。 一、编程问题已经解决了 在最近的一次访谈中,Boris 向在座的开发者们抛出了一个扎心的问题:"现在还有谁是100%手写代码的?"结果显示,现场已没有人坚持手动输入每一行代码。 Boris 透露,他自己已经一年多没写过一行代码了。 现在的 Claude 等最新模型已经能够100%接管代码编写。 在他看来,"编程问题已经解决了"(Coding is solved)。 这一变革的速度将远超当年的印刷机。Boris 认为,软件开发将从一种需要高度专业技能的"手艺",迅速演变为一种像发短信一样普及的通用技能。 二、从「氛围编程」到「智能体工程」 硅谷技术大神 Andrej Karpathy 为这一变革提供了深层的理论支撑。他提出了**软件 3.0(Software 3.0)**的概念:软件 1.0:人类手写明确的规则(传统代码)。 软件 2.0:通过数据集训练神经网络。 软件 3.0:编程变成了提示词工程(Prompting)。上下文窗口就是我们的杠杆,通过它来驱动 LLM 这个「解释器」在数字空间中执行任务。Karpathy 观察到,自去年12月以来,模型的能力出现了质的飞跃。过去 AI 只能写代码片段,现在它能生成完整且正确的代码块,让人进入一种**「氛围编程」(Vibe Coding)**的状态——你只需要描述愿景,AI 负责实现细节。 但更高的境界是智能体工程(Agentic Engineering)。这不再仅仅是提高速度,而是在保持专业软件质量标准(安全性、健壮性)的同时,指挥一组智能体协同工作。 三、「循环」的力量:AI 正接管繁琐流程 如果说 100% 自动写代码是起点,那么**「循环」(Loops)**则是软件开发的未来形态。 Boris 分享了他的私人工作流:他在手机上运行着几百个甚至几千个智能体。通过一种简单的逻辑——让 AI 利用 Cron 等工具定时运行任务——他构建了无数个「循环」:有的循环在「监视」PR(拉取请求),自动修复 CI 错误; 有的循环在自动重构过时的测试代码; 有的循环每 30 分钟从社交媒体抓取反馈并自动归类。这种「大规模并行」的能力,让一个人就能发挥出过去一整个团队的效能。 四、跨学科通用型人才 在「印刷机时刻」之后,软件的价值将发生重心的偏移。 Boris 指出,当编程变得极其廉价且简单时,掌握**「领域知识」将比掌握「编程语言」**更重要。比如,开发一款会计软件的最佳人选,可能不再是资深工程师,而是一位精通业务的资深会计,因为 AI 让实现变得容易,而「定义问题」才是真正的门槛。 与此同时,我们将看到更多**「跨学科通用型人才」(Cross-disciplinary Generalists)**的崛起。他们既懂产品,又懂设计,还能指挥 AI 完成工程实现。这种人能够通过 AI 这种原生技术,从零开始构建出足以挑战巨头的小型公司。 五、外包思考,但不外包理解 面对 Intelligence 变得像水和电一样廉价的时代,人类还剩下什么? Karpathy 引用了一句耐人寻味的话:「你可以外包你的思考,但你不能外包你的理解。」虽然 AI 可以替我们写代码、跑循环、做繁琐的执行,但审美、判断力和理解力依然是人类最后的堡垒。 结语 我们正站在软件开发历史上最令人兴奋的门槛上。正如印刷机终结了知识的垄断,AI 正在终结代码的垄断。软件的未来,不再属于那些会写代码的人,而属于那些有想法、有洞察、并懂得如何与机器协作的人。
-
Brody - 2026/04/25
用 Google AI Studio 3分钟搓出一个微信公众号排版工具
如果你经常发微信公众号,一定被公众号默认编辑器折磨过:样式单调、排版费事、每次发文都要反复调整格式。久而久之,一个问题浮现出来:如果有一个工具可以预设好常用风格,支持 Markdown 输入并自动排版好,一键复制到公众号,那该多省事? 今天这篇分享,就是关于我怎么用 Google AI Studio,在 3 分钟内把这个想法变成可运行的工具。从「想法」到「运行」的过程 事情的起因很简单。某天我准备发公众号时,再次面对那个熟悉的白色编辑框,心里只有一个念头:能不能让 AI 直接帮我做一个排版工具? 我的需求并不复杂,但痛点很明确:支持 Markdown 输入:平时写文章习惯用 Markdown,不想来回切换格式 支持富文本编辑:有时需要插入图片、分割线、表格等富媒体内容 可预设主题风格:能保存几套常用的配色和排版风格,发文时一键切换 实时预览:左侧编辑,右侧即时看到手机端效果 一键复制:排版完成后,直接生成公众号可用的格式并复制到剪贴板带着这些想法,我打开了 Google AI Studio(https://aistudio.google.com),使用它的 App Builder 功能,直接把上述需求用自然语言描述给 AI。AI Studio 生成出来的工具长什么样 结果出乎意料的顺。AI 不仅理解了所有需求,还额外做了一些超出预期的设计。以下是我收到结果后的第一印象:核心功能一览 从截图可以看到,工具采用了经典的三栏布局:左侧编辑区:支持 Markdown 和 Rich Text 两种模式切换 中间预览区:实时渲染为手机屏幕尺寸,直观看到最终公众号效果 右侧主题面板:提供多套预设主题,支持自定义修改Markdown + 富文本双模编辑 左侧编辑器支持两种输入模式。Markdown 模式下,你可以直接粘贴或输入 Markdown 语法,右侧会实时渲染为带样式的公众号排版。富文本模式则更像传统编辑器,可以插入图片、表格、音视频等媒体元素。富文本模式还参考了 Notion 的一些交互设计:拖拽调整块位置:像 Notion 一样,可以拖拽各个内容块(段落、图片、表格等)来重新排序 / 符号唤醒快捷菜单:输入 / 就能呼出插入菜单,快速插入分割线、表格、标题、图片、视频、音频等块级元素 Emoji 搜索:支持通过关键词搜索并插入 Emoji主题预设系统 右侧 Theme Settings 面板提供了多套预设风格,目前包含:Modern Pro:现代专业风格,蓝白色调,适合技术类文章 Minimalist (Medium Style):极简风格,类似 Medium 的排版体验 Retro Terminal:复古终端风格,深色背景,适合极客向内容更实用的是,你可以点击 Edit 进入自定义模式,调整颜色、字体、间距等参数,并保存为自己的自定义主题。这意味着你可以为不同的公众号账号、不同的内容类型,分别建立专属的视觉风格,每次发文时一键切换。使用流程 整个工具的使用流程非常顺畅:选择或创建主题:从右侧选择一个预设风格,或自定义一套新的 输入内容:在左侧用 Markdown 或富文本编辑器撰写文章 实时预览:中间预览区同步显示手机端效果,随时调整 一键复制:点击右上角「Copy for WeChat」按钮,复制到剪贴板 粘贴到公众号:在公众号编辑器里直接粘贴,排版效果完整保留整个过程不需要写一行 HTML 或 CSS,也不需要手动调格式。对于经常发公众号的人来说,省下的时间相当可观。为什么要用 AI Studio 做这件事 你可能会问:市面上已经有不少公众号排版工具了,为什么要自己做一个? 我的考虑是:现有工具要么太复杂:一些排版工具功能臃肿,上来就给你一堆参数和按钮,学习成本高 要么太简单:简单工具不能满足 Markdown 输入 + 富文本混排 + 主题定制的组合需求 要么收费:核心功能被放在付费墙后面而用 Google AI Studio 自己做的好处在于:零代码:用自然语言描述需求,AI 自动生成完整的前端应用 完全可定制:不满意哪里,直接告诉 AI 修改,比如「把标题颜色改成深蓝色」或「添加一个引用块样式」 即时可用:生成后在右侧直接运行预览,不需要本地搭建环境 免费:Google AI Studio 目前对个人用户免费一点感受 这个工具的完整开发过程,从打开 AI Studio 到运行出第一个可用版本,实际只花了不到 3 分钟。大部分时间其实花在和 AI 确认细节上,比如「能不能加一个复制按钮」「能不能支持拖拽排序」。 这让我再次感受到:当下的 AI 工具已经进入了「想法即产品」的阶段。你不需要是前端工程师,不需要写 React 组件,不需要调 CSS 样式。只要能把需求说清楚,AI 就能帮你把工具做出来。 当然,这个排版工具目前还有一些可以优化的地方,比如:支持更多公众号特有的格式(如阅读原文链接、小程序卡片) 增加历史文章模板功能 导出为 HTML 文件这些后续我会继续迭代,也欢迎你如果有类似需求,不妨试试 Google AI Studio 的 App Builder,说不定几分钟就能做出一个解决自己痛点的工具。如果你对这个排版工具感兴趣,或者有类似的工具开发想法,欢迎在评论区交流。
-
Brody - 2025/12/15
教学战略手册:从「灌输」到「引导」的二语习得转型指南
在这篇文章中,我汇集了来自 YouTube 上多个高播放量、累计数百万次观看的学习视频资源,并借助 Google NotebookLM 进行整理与总结。通过 AI 的分析与提炼,这些零散的学习素材被转化为结构化的知识框架,帮助你快速抓住重点、梳理逻辑、形成适合自己的学习路径。1. 引言:二语习得的战略悖论与「人」之本源 在人工智能与大语言模型(LLM)唾手可得的时代,英语学习者正面临着一个残酷的悖论:尽管我们拥有 24/7 全天候的「口袋专家」,全球英语习得效果却呈现结构性下滑。以美国为例,过去五年外语学习人数下降了 17%。正如教育战略家克里斯蒂安(Christian)所言:语言学习不是资源问题,而是人的问题。作为教育引领者,我们必须建立一个核心认知:AI 与数字化资源是「汪洋大海」,但教师的职责不是灌输水分,而是让马口渴。 这种「口渴」——即习得欲望,是不可替代的战略势能。在伊朗-伊拉克战争的战俘营中,即便在纸笔被禁、条件极度匮乏的严苛环境下,战俘们仍能用木棍在花园的泥土上划写单词。他们最终不仅习得了流利的英语,甚至能在舞台上表演英语戏剧。 这证明了当心态(Mindset)从「被动接收」转为「主动社交」时,习得过程将不可阻挡。2. 核心战略框架:Paul Nation 的「四大支柱」 (The Four Strands) 教师转型的第一步是重塑课程的时间分配。Paul Nation 的「四大支柱」理论不仅是教学法,更是确保习得发生的平衡战略。一个卓越的语言课程必须在时间上达成四个维度的均等(各 25%)。意思导向输入(Meaning-focused Input):通过听、读获取信息,侧重隐性知识吸收。 意思导向输出(Meaning-focused Output):通过说、写传递讯息,将知识从「认识」推向「产出」。 语言导向学习(Language-focused Learning):对语言特征(语法、发音)进行刻意的显性研究。 流利度发展(Fluency Development):在不涉及新知识的前提下,强化已知内容的提取速度。💡 批判性评估:传统课堂往往将 80-90% 的时间耗费在「语言导向学习」上,这种对显性知识的过度痴迷会导致「认知过载」并扼杀流利度。教师必须清醒意识到:显性知识不一定能自动转化为隐性能力。3. 教学重心重塑:身份认同、意图与「社会工具」 语言学家 David Crystal 指出,语言受双重力量驱动:理性的「理解力(Intelligibility)」与感性的「身份认同(Identity)」。理解力(大脑驱动):确保信息传达。 身份认同(心灵驱动):表达「我是谁」。追求「完美发音」或「像母语者一样」是一个过时的迷思。在英国,标准发音(RP)的使用者仅占 2%。教师应将口音视为学生的「身份标签」。只要不干扰理解,保留个人特征是建立自信的关键。 提升沟通意图的战略原则接受「不完美」:正如 Dan Everett 所言,语言始于对话,而对话始于「敢于在语言中扮演傻瓜」。 建立社会契约:语言本质上是社会工具。课堂任务应聚焦于「信息差(Information Gap)」,让学生为了生存或社交的「福祉」而不得不说。 沟通先于精确:优先关注「说了什么」,而非「怎么说的」。4. 教师角色的战略级转型:从「传递者」到「策划者」 Paul Nation 提出,教师应完成从「讲课者」向「教学建筑师」的晋升。当教师在课堂上最忙碌时,学生的习得效果往往最差。 教师五大职能层级(按战略重要性排序)策划者(Planner):这是教师作为「建筑师」的核心职能。确保四大支柱的精准平衡,并为学生挑选符合 i+1 标准的真实材料。 组织者(Organizer):设计高效流程(如配对谈话、广泛阅读计划),让学生在自主运作中完成习得。 培训者(Trainer):教授学生「如何学习」。例如,指导学生使用间隔复习(Spaced Repetition)和检索练习(Retrieval),培养其独立性。 测试者(Tester):监控进度并及时反馈,让学生通过成就感维持长效动力。 教学者(Teacher):仅占极小比例。在学生产生好奇时提供画龙点睛的显性讲解。💡 「懒惰教学法」的逻辑核心:卓越的老师应是「懒惰」的。这并非不负责任,而是为了最大化学生的认知处理时间(Cognitive Processing Time)。如果老师占据了 80% 的说话时间,那么学生就失去了 80% 的习得机会。5. 课堂实战:基于真实语境的「脱书」工作流 战略转型的终点是抛弃工业化的课本练习,转向基于真实语境和学生兴趣的教学。 「阿黛尔工作流」(The Adele Workflow) 案例分析 与其通过语法书学习被动语态,不如利用学生感兴趣的真实材料(如歌手阿黛尔):真实阅读:使用关于阿黛尔巡演的新闻。学生会自然接触到「raked in(大赚)」或「pocketed(收入囊中)」等生动表达。 词汇深度控制:确保 98% 的覆盖率。如果 100 个词中有 2 个以上生词,学生将进入「挫败水平(Frustration Level)」,习得随即停止。 真实输入与挑战:播放未经处理的采访播客。即使学生只能听懂 50%,这也是在模拟真实的沟通挑战,建立「模糊耐受度」。 任务设计:利用两张阿黛尔在不同场景的照片进行对比(Comparison Task),强迫大脑调用已知词汇来描述细节。💡 时间在任务中的价值(Time on Task):要成为优秀的讲者,必须进行大量的说。教师应设计「不得不说」的场景,利用社交需求驱动产出,而非机械背诵。6. 总结:构建持久的语言习得生态 教学不仅是技术的传递,更是建立人与人之间联系的艺术。本手册的核心战略原则总结如下:心态是成败的分水岭:动力是习得的第一生产力。 隐性习得先于显性规则:语法是沟通的副产品,而非前提。 学生是故事的英雄:教师应将学习的「努力权」和自主权还给学生。 真实性是唯一的路径:拒绝真空中的练习,拥抱真实世界的碎片。 四大支柱的动态平衡:确保每一分钟的投入都能转化为长期能力。通过这一战略转型,你将赋予学生在真实世界中自由表达、建立联系并主导自身叙事的能力。本文内容由 Google NotebookLM 辅助整理,素材来源于 YouTube 语言学习领域多个高播放量视频。