📚 AI 使用教程
共 30 篇教程。每篇解决一个具体问题——有步骤、有 Prompt 示例、有注意事项。从入门到精通,帮你真正用好 AI。
如何用 AI 工具组合做小红书爆款图文?完整工作流
Cloud Run instances 跑长驻 Agent:月成本约 5.70 美元,什么时候比 VM 更合适?
Google Cloud 在 2026 年 8 月 27 日推出 Cloud Run instances Preview,专门填补 Cloud Run services 和传统 VM 之间长期存在的一块空档:有些 AI Agent 需要“始终只有一个实例在线、长期保持状态、偶尔突发工作”,但又没有必要维护一整台 VM。Cloud Run instances 当前提供单实例、无自动扩缩、最长 7 天连续运行、默认自动重启、跨更新与重启保持不变的 HTTPS URL,以及 Stop/Resume。Google 给出的公开价格示例是 1 vCPU + 1 GiB 内存连续运行 30 天约 5.70 美元。它非常适合个人 Agent、消息机器人、低频 Worker 和小型自动化,但不适合高并发无状态 API,也不能简单替代 Kubernetes 或 VM。
Qwen3 Embedding 上 Cloud TPU:16K 长上下文检索怎么做生产化
Google Cloud 在 2026 年 8 月 26 日公布了 vLLM 原生 TPU Embedding 推理方案,重点不是普通 LLM Chat,而是企业 RAG、Semantic Search 和多模态检索常用的高维 Embedding 工作负载。Google 以 Qwen3-Embedding-8B 和 Qwen3-VL-Embedding-8B 为工程目标,处理 4K+ 文本和 15K+ 图文上下文,并在 TPU 上解决 Tensor Alignment、Lazy Loading、JAX/XLA 编译预热、Chunked Prefill 与 StepPool 状态累积问题。官方给出的 Qwen3-Embedding-8B 结果中,在 bf16、16K+ 序列、TP=4 条件下达到 83,996 total token/s 和 5.13 req/s,同时使用文本 ≥0.999、多模态 ≥0.995 的余弦相似度阈值验证跨硬件数值一致性。真正重要的问题是:Embedding 服务扩容和换硬件以后,检索结果能不能保持稳定。
Copilot Code Review 进入 Azure Repos:企业怎么配才不变成“自动评论机”
微软在 2026 年 8 月 26 日宣布 GitHub Copilot Code Review for Azure Repos 进入 Public Preview,Azure DevOps 客户不再需要 Early Access 申请。这个版本已经补上企业真正关心的几块能力:组织 / Project / Repository 三级启用、Managed DevOps Pools、按组织 / 项目 / 仓库 / 路径配置 Custom Instructions、通过 Branch Policy 自动触发 Review、Draft PR 提前审查,以及在 Azure Cost Management 中通过 Project Tag 做成本归属。它真正的价值不在“AI 多写几条评论”,而在于能否把 Review 标准提前、统一和自动执行。
WebMCP 实战:让网站从“给人点”变成“给 Agent 调”
WebMCP 正在把“Agent 操作网页”从视觉自动化升级成结构化调用。这个实验性开放标准允许网站主动暴露 Tool,让 Agent 知道“查询订单”“增加购物车商品”“切换页面状态”到底需要什么参数和返回什么结果,而不是继续依赖截图识别、DOM 猜测和模拟点击。Chrome 已提供 Imperative API 和 Declarative API,Chrome 149 进入 Origin Trial;OpenAI 在 8 月 25 日启动 10 天 WebMCP Challenge,ChatGPT 的 in-app browser 可以直接测试 WebMCP 网站。对于电商、SaaS、内部 Portal 和内容网站来说,WebMCP 代表一个新问题:未来网页除了 SEO 和 Human UX,还需要设计 Agent UX。
Codex mcp-server 退场:App Server 迁移指南
OpenAI 在 2026 年 8 月 24 日正式把 `codex mcp-server` 标记为 Deprecated,并给出明确迁移方向:需要把 Codex 深度嵌入自有产品时,改用 **Codex App Server**;如果是 CI、批处理或非交互自动化,优先使用 **Codex SDK**;如果希望从 Claude Code 调用 Codex,则使用官方 Codex plugin for Claude Code。App Server 不是 MCP Server 的简单改名,它提供的是面向富客户端的 Codex 控制协议:认证、Thread/Turn、审批、流式 Agent 事件、MCP Tool、配置与状态都通过双向 JSON-RPC 2.0 交互。本文给出从旧命令迁移到 App Server 的架构判断和安全清单。
ADK 语音 Agent Eval:把“听起来不错”变成 CI 可测
Google 在 8 月 24 日为 Agent Development Kit(ADK)介绍了原生 Live Evaluation:开发者现在可以让一个 LLM 驱动的模拟用户直接“说话”给语音 Agent,完成多轮真实音频对话,再用自然语言 Rubric、逐轮指标和 Tool Execution 结果进行评分。官方示例使用三个 `gemini-live-2.5-flash-native-audio` Agent 串成一个 Graph Workflow,用 `gemini-3.7-flash` 控制模拟用户的对话逻辑,用 `gemini-3.1-flash-tts-preview` 合成用户音频,并可以通过 `AgentEvaluator` 接入 CI/CD。对实时语音 Agent 来说,这意味着测试终于从“人工听 Demo”进入可回归、可自动化的工程阶段。
Raspberry Pi 5 跑本地 Agent:LiteRT + Gemma 实战
Google 在 8 月 11 日展示了一套很有实用价值的 Edge AI 路线:用 LiteRT 在 Raspberry Pi 5 上运行轻量 Gemma 模型,把语音、视觉、Embedding 和小型 Agent 推理全部留在本地。官方给出的 Gemma 4 E2B 数据约为 99 tokens/s 的 prefill、9 tokens/s 的 decode、约 1432 MB 峰值内存;在 Reachy Mini 语音演示中,端到端生成约 27.3 characters/s,接近每分钟 300 个英文单词。更重要的是,LiteRT 不只是跑一个 LLM:它可以让 CPU 负责 Gemma 与语音识别,GPU 持续运行 YOLO 等视觉模型,组成一个无需云 API 的本地多模态 Agent。本文从硬件、模型选择、安装命令、CPU/GPU 分工和隐私边界几个方面,给出一套可复现的 Raspberry Pi 5 Edge Agent 架构。
Google ADK Zero-Trust 实战:Agent 能写数据库后,安全边界该放哪?
Google 在 2026 年 8 月 17 日发布了一套基于 Agent Development Kit(ADK)的 Zero-Trust Agent 参考实践,背景非常现实:当 Agent 不再只是生成文本,而是可以退款、修改数据库、执行动态代码和调用内部 API 时,传统“在 System Prompt 里写不要做危险操作”已经不能作为真正安全边界。Google 给出的重点方案包括三层:对所有状态变更使用 Agent 独立的硬件支持加密签名;把动态代码放进 gVisor 等沙箱隔离;在输入输出之间设置确定性的语义网关,对数据形态和允许动作进行硬校验。本文把这三层拆成一套企业可实施架构。
ChatGPT Sites 实战:从一句需求到上线网站,自定义域名、版本和权限怎么配?
ChatGPT Sites 已进入 Public Beta,并且官方文档今天再次更新了创建、预览、发布、分享、自定义域名和权限相关说明。Sites 的定位不是传统“生成一段 HTML 给你复制”,而是让用户直接在 ChatGPT Work 或桌面端 Codex 中描述需求,生成可交互网站或轻量应用,再经过预览、版本保存和发布形成真实可访问地址。当前 Plus、Pro 和 ChatGPT 工作区可用,Business 默认开启,Enterprise 由管理员通过角色权限控制;可用场景包括项目看板、Launch Calendar、内部 Portal、Dashboard、Calculator 和轻量工具。本文不做功能罗列,而是给出一套从需求到生产上线的完整使用方法。
Google Credentio + C2PA 实战:如何在本地验证 AI 图片、视频、音频和文档的 Content Credentials?
Google 在 2026 年 8 月 13 日开源了 Credentio,一套用于验证 C2PA Content Credentials 的高性能 C++ 库,首批支持 C2PA 2.2 和 2.4。Google 表示,这套代码已经支撑近 40 个符合 C2PA 标准的 Google 产品,并扩展到数百亿个生成资产,覆盖图片、视频、音频和文档等多种格式。Credentio 最值得开发者关注的特点是“Local-First Validation”:媒体文件可以在桌面端、移动端、边缘设备或企业后端本地完成验证,不需要上传回 Google 或其他远程验证服务,因此减少了带宽、隐私、延迟和超大文件处理问题。本文解释 C2PA 与前天 Claude 文本水印的区别,并给出内容平台、CMS、审核系统和企业素材库三种接入方式。
Google Cloud API Gateway 多模型路由实战:一个 OpenAI 兼容入口同时接 Gemini、Claude 和 OSS-GPT
企业 AI 应用越来越少只使用一个模型。客服可能用低成本模型处理普通问题,代码任务需要更强推理模型,离线批处理又可能使用开源模型。如果每个业务应用都直接连接不同厂商 API,模型地址、认证、重试、限流、切换和成本统计很快会散落在所有代码库里。Google Cloud API Gateway 已经提供 Model Routing Public Preview,可以暴露一个 OpenAI 兼容入口,通过 OpenAPI 3.x 中的 `x-google-api-management` 和 `x-google-model-router` 规则,把请求动态路由到 Gemini、Claude 或 OpenAI OSS-GPT 等 Google Cloud 托管模型。真正的价值不是“一个 API 调三个模型”,而是把业务代码和具体模型供应商解耦。
GitHub Copilot for JetBrains 企业治理升级:MCP 白名单、插件市场和 OpenTelemetry 怎么配?
GitHub 在 2026 年 8 月 18 日为 GitHub Copilot for JetBrains 增加了企业托管设置。管理员现在可以集中控制 Copilot Plugin 是否启用、允许哪些 Plugin Marketplace、哪些 MCP Server 可以连接、OpenTelemetry 应发送到哪个 Collector,以及是否禁止 Agent 使用 Bypass Approvals 或 Autopilot。这个更新看起来只是 JetBrains 插件设置增加了几个字段,实际上解决的是企业推广 AI Coding Agent 时最棘手的治理问题:开发者不能各自在本机随意接插件、接 MCP、绕过审批和把遥测发送到未知位置。
Gemini Live API 异步函数调用实战:实时语音 Agent 不再等待工具返回
实时语音 Agent 最容易被一个问题拖垮:模型说到一半需要查询 CRM、订单、数据库、搜索或工单系统时,如果工具调用采用阻塞模式,整个对话必须停下来等待外部系统返回。Google 在 Gemini Live API 的级联架构中支持异步函数调用,开发者可以把函数行为设置为 `NON_BLOCKING`,让模型在后台执行工具时继续保持会话。这并不意味着 Agent 可以无视工具结果继续“瞎说”,而是要求开发者重新设计对话状态、并发任务、超时、回写、打断和最终一致性。本文从实时语音架构出发,给出一套可直接用于客服、销售和助手类产品的异步工具调用方案。
OpenAI 提出“防守者窗口”:AI 网络安全进入攻防加速期,企业现在该做什么?
OpenAI 在 2026 年 8 月 17 日发布《The Defender’s Window》,核心判断非常明确:前沿模型已经开始自动化真实网络攻击中的部分环节,过去长期存在但难以发现的软件漏洞、错误权限、基础设施配置和泄露凭证,正在变得更容易被攻击者发现并串联利用;与此同时,同样的 AI 能力也可以帮助防守方更快扫描代码、分诊告警、枚举攻击路径、处理漏洞积压并修复问题。所谓“防守者窗口”,指的就是企业还有一个时间窗口,可以在攻击自动化进一步普及之前,用 AI 提高自身防御速度。本文不讨论进攻技术,而是从企业防守角度给出一套可执行的安全升级路线。
OpenAI Assistants API 8月26日关闭:迁移 Responses API 完整指南
OpenAI 已明确宣布 Assistants API 将于 2026 年 8 月 26 日关闭。对于仍在使用 Assistants、Threads、Runs、Run Steps、File Search 或 Function Calling 的应用,这已经不是“以后有空再迁移”的技术债,而是必须在截止日期前完成的生产迁移。新的 Responses API 已达到 Assistants API 的功能对等,并进一步支持 Conversations、MCP、Computer Use、Deep Research 等新能力。本文从概念映射、数据迁移、会话状态、工具调用、Prompt 版本、File Search、灰度发布和回滚等方面给出一套可执行迁移路线。
AI 助手记忆架构:短期、长期、情景与语义记忆怎么设计?
AI 助手的记忆不是把所有对话永久存起来。短期上下文、用户偏好、任务状态、情景记录和语义知识需要不同存储、更新、检索和删除策略。本文给出生产级记忆架构。
个人 AI 知识库实战:从收藏混乱到可检索、可复用的知识系统
个人知识库最常见的问题是收藏越来越多,却无法再次使用。本文给出收集、筛选、来源、结构、摘要、关联、检索、复习和删除的完整流程。
OCR + Document AI 架构设计:复杂 PDF、表格和扫描件如何统一处理?
企业文档同时包含原生 PDF、扫描件、图片、表格、手写和 Office 文件,单一 OCR 无法统一处理。本文给出文档分类、路由、多解析器、质量检测和统一表示架构。
AI 发票与单据识别实战:从 OCR 到结构化数据入库
发票、订单和回单的自动化不能只靠 OCR 文本。系统还需要版面、字段 Schema、校验规则、重复检测、置信度、人工复核和审计。本文给出完整数据抽取流程。
AI 音乐版权风险:商用前必须检查的 10 个问题
AI 音乐的权利问题涉及平台条款、用户输入、训练争议、歌词、声音肖像、相似性、地区法律和分发平台规则。本文给出商用前风险检查框架。
商业 AI 音乐生产实战:从 Brief 到授权归档
商业 AI 音乐不能止于生成和下载。企业需要把品牌 Brief、参考风格、歌词、版本、混音、审核、平台条款和授权证据串成完整流程。
AI 声音克隆合规指南:授权、标识、存储与撤回怎么做?
声音属于高度可识别的个人特征。企业使用声音克隆必须处理授权范围、身份验证、用途限制、合成标识、模型存储、第三方访问和撤回。本文给出治理框架。
AI 播客生产实战:从选题、脚本到配音和发布
AI 可以加速播客研究、脚本、配音、降噪、章节和分发,但不能自动保证事实、节奏和版权。本文给出单人、双人和企业播客的生产流程。
多租户 AI SaaS 架构:数据、向量、Prompt 与成本如何隔离?
AI SaaS 的多租户隔离不仅涉及数据库行,还涉及向量索引、对象存储、缓存、Prompt、工具凭证、模型额度和日志。本文给出全链路租户边界设计。
AI SaaS MVP 后端实战:用户、计费、对话与模型网关怎么搭?
AI SaaS 的 MVP 也需要正确处理用户、租户、模型密钥、流式响应、用量、配额和失败重试。本文给出一套最小但可扩展的后端架构。
办公电脑部署本地大模型:8GB、16GB、32GB 内存怎么配置?
办公电脑运行本地模型需要根据内存、显存、CPU、操作系统和任务选择模型与量化,而不是盲目追求参数量。本文给出不同硬件档位、上下文、性能、安全和员工使用方案。
AI 门户权限架构:SSO、RBAC、多租户与数据隔离怎么设计?
AI 门户同时连接模型、知识库和工具,权限错误可能导致跨部门泄密或越权执行。本文给出身份、角色、属性、资源、租户、检索和工具调用的分层授权模型。
企业内部 AI 门户部署实战:从多模型网关到员工上线
企业 AI 门户需要统一入口,但不能把聊天 UI 直接连接到模型。本文给出身份认证、模型网关、知识权限、配额、审计、安全过滤、灰度上线和运营培训的完整架构。
AI 来源可信度评估:如何识别二手转述、过期数据与伪引用?
AI 搜索常常给出很多引用,但数量不能代表质量。本文建立来源层级、独立性、时效性、适用性和句子支持度评分,并给出自动筛选与人工抽查方法。