Skip to content

AI 应用与产品概览

本页是 AI 应用与产品拆解系列的导览。前面各章节按技术领域分类(传统 ML、深度学习、生成式 AI、LLM 生态等),而本目录把目光转向真实的 AI 产品——拆解它们用了什么技术、架构如何设计、商业模式是什么、以及你如何自己搭建类似的东西。

一个 ChatGPT 背后同时涉及 Transformer 架构、RLHF 训练流水线、多模态融合、工具调用、流式推理等十几个技术模块。

真实产品是多种技术的系统工程组合。学完 Transformer 原理后,你仍然不知道:一个对话产品如何做到首 token 延迟(TTFT)低于 500ms?一个 AI 编程工具如何在几秒内搜索整个代码库?一个角色扮演前端如何让 LLM “记住”几十万字的剧情上下文?

这些问题的答案分散在十几个技术领域中,只有把它们拼成完整的系统图景,才能真正理解一个 AI 产品。本目录的目标就是完成这种”拼图还原”:

  • 每个产品背后的技术选型和架构权衡
  • 各技术模块在产品中如何协作(数据流、调用链)
  • 如果你要复刻,从哪里入手、需要哪些开源工具
  • 产品的商业模式和市场竞争格局

理解 AI 产品最好的方式,是建立”分层思维”。几乎所有 2024-2025 年的 AI 应用都可以映射到以下五层:

  • ① 基础设施层:GPU 集群(NVIDIA H100/H200/B200)、向量数据库(Pinecone / Milvus / Qdrant)、推理引擎(vLLM、TGI、TensorRT-LLM)
  • ② 模型层:基础模型本身——GPT-4o、Claude 3.7 Sonnet、Gemini 2.0、Llama 3.3、Stable Diffusion 3.5、Whisper 等
  • ③ 模型服务层:通过 API(OpenAI / Anthropic)或本地推理(Ollama)获取模型输出,包括流式推理(逐 token 返回,降低用户感知延迟)、量化部署(quantization——用更低精度如 INT4/INT8 存储模型权重,显著降低显存占用和推理成本)
  • ④ 框架层:LangChain / LlamaIndex 等编排框架,以及 MCP(Model Context Protocol)——Anthropic 于 2024 年 11 月开源的标准化工具接入协议
  • ⑤ 应用层:最终用户直接交互的产品界面——ChatGPT、Cursor、Midjourney、Suno 等

一个产品的”技术深度”,取决于它覆盖了从第①层到第⑤层中的多少层。例如 ChatGPT 覆盖全部五层(OpenAI 自研模型、自建推理集群),而 SillyTavern 只做第⑤层(纯前端,模型由用户提供)。

本目录目前覆盖以下产品,按应用场景分为五大类:

产品核心技术阅读对象
ChatGPT 与 Claude 深度拆解GPT-4o 架构、o3 推理模型(通过思维链 Chain-of-Thought 慢思考来增强推理能力)、RLHF 训练流水线、多模态融合、Constitutional AI想理解对话式 AI 全貌的开发者
Perplexity 与 AI 搜索引擎实时联网 RAG、多步推理搜索、答案引用溯源想理解 AI 搜索引擎架构的开发者
PI Agent 与个人 AI 助手Agent 架构、长期记忆系统、日历/邮件集成想搭建个人 AI 助手的开发者
产品核心技术阅读对象
AI 编程工具拆解FIM(Fill-in-the-Middle)补全、代码库 RAG 索引、Agent 模式、延迟优化想理解 Copilot/Cursor 技术原理的开发者
OpenCode 与开源编程工具开源编程助手生态、本地模型集成、终端工作流想用开源方案替代商业工具的开发者
产品核心技术阅读对象
Midjourney 与开源生图生态Diffusion 模型(扩散模型——通过逐步去噪从随机噪声生成图像)、CLIP 文本理解、美学调优想理解 AI 绘图产品架构的开发者
Stable Diffusion 生态指南LoRA(Low-Rank Adaptation——冻结大模型主体,只训练少量低秩矩阵来实现风格定制,显存需求极低)、ControlNet、社区模型生态想深度玩转 SD 生态的开发者
ComfyUI 与 AUTOMATIC1111 对比节点式工作流 vs 面板式 UI、工作流复用、自定义节点开发想选择合适 SD 前端工具的开发者
Suno 与 AI 音乐创作音频 latent diffusion、歌词条件生成、多轨混音、版权争议对 AI 音乐生成感兴趣的开发者
Sora 与 AI 视频生成视频 Diffusion Transformer(DiT)、时空注意力、长视频一致性、运动控制对 AI 视频生成感兴趣的开发者
产品核心技术阅读对象
AI Dungeon 与 NovelAILLM + 持久上下文、世界设定记忆、令牌优化对 AI 文字冒险/小说生成感兴趣的开发者
AI 叙事与互动小说技术分支叙事引擎、叙事状态机、动态内容生成想深入互动叙事技术的开发者
SillyTavern 角色扮演前端角色卡系统、世界书向量注入(World Info——将角色背景设定按关键词触发注入到提示词中)、提示模板、多后端想搭建本地 LLM 角色扮演前端的开发者
产品核心技术阅读对象
本地 LLM 部署:Ollama 与 Open WebUIGGUF 量化格式、本地推理引擎、Web UI 部署、多模型管理想在本地/私有环境部署 LLM 的开发者
OpenClaw/Hermes 与开源 Agent 生态开源 Agent 框架、工具调用、Agent 设计模式想参与开源 Agent 项目的开发者
HuggingFace 生态指南Model Hub、Transformers 库、Inference Endpoints、Spaces想利用 HF 生态加速开发的开发者
LangChain/LlamaIndex 应用框架RAG 管线编排、文档加载/分块/检索、Chain/Agent 抽象想用框架快速搭建 LLM 应用的开发者

每个产品页面都围绕以下维度展开,方便你横向对比不同产品的设计决策:

  • 核心定位:这个产品到底解决什么问题?与竞品有何差异?
  • 技术架构拆解:用 Mermaid 流程图展示产品内部的数据流和模块关系
  • 关键技术点详解:链接到站内对应技术章节,做到”看到不懂的概念就能跳转”
  • 商业模式与市场:怎么赚钱?定价策略?市场竞争格局?
  • 动手实践:提供可运行的 Python / 配置示例,让你动手感受核心机制
  • 实践要点与陷阱:性能瓶颈在哪?常见误区?什么情况下不该用?
  • 典型类库与工具:列出复刻该产品所需的开源工具链

AI 应用格局在 2024-2025 年经历了剧烈变化。以下是理解当前产品生态必须知道的几条主线:

趋势一:从”对话框”到”Agent”

Section titled “趋势一:从”对话框”到”Agent””

2023 年是”聊天框之年”——所有 AI 应用的核心交互都是一问一答的对话框。2024-2025 年的核心趋势是 Agent(智能体)化:LLM 不再只回答问题,而是能自主调用工具(搜索、代码执行、文件操作、API 请求)、分步推理、循环执行直到任务完成。

标志性产品/功能包括:

  • OpenAI Operator(2025 年 1 月发布):能直接操作浏览器完成订票、购物等任务
  • Anthropic Computer Use(2024 年 10 月发布):Claude 能看到屏幕截图并控制鼠标键盘
  • Cursor Composer / Agent Mode:AI 编程工具从”补全一行代码”进化到”理解整个代码库并自主完成多文件修改”
  • Deep Research(Google Gemini / OpenAI o3):AI 自主进行多轮搜索、阅读、综合,产出长篇研究报告

技术底层支撑是 推理模型(如 o3、Claude 3.7 的 extended thinking 模式)的成熟——这些模型能生成数千 token 的内部思维链,在行动前”想清楚”该怎么做。

趋势二:推理模型改变产品交互

Section titled “趋势二:推理模型改变产品交互”

2024 年 9 月 OpenAI 发布 o1,开启了”推理模型”(reasoning model)时代。与 GPT-4o 这类”快思考”模型不同,推理模型在回答前会先生成大量隐藏的思维链 token(可能耗时 10-60 秒),从而在数学、编程、科学推理等任务上大幅超越传统模型。

这对产品设计产生了深远影响:

  • 延迟预期重构:用户开始接受”等 30 秒拿到一个高质量答案”,而非”1 秒内拿到一个凑合的答案”
  • 分层推理:产品开始根据问题难度动态选择”快模型”(GPT-4o-mini / Claude Haiku)或”慢模型”(o3 / Claude Opus),平衡速度与质量
  • 进度展示:推理过程可视化(如 o1 的 “thinking…” 状态、Deep Research 的搜索步骤展示)成为新的 UX 设计课题

2024-2025 年开源模型的竞争力显著提升:

  • Llama 3.3 70B(2024 年 12 月):性能接近 GPT-4 级别,可在单张消费级 GPU 上运行
  • DeepSeek-V3 / R1(2024 年 12 月 / 2025 年 1 月):中国团队推出的开源推理模型,R1 在推理能力上对标 o1,训练成本仅约 560 万美元(远低于同级别模型的数十亿美元),引发行业震动
  • Qwen 2.5 / Mistral Large:持续缩小与闭源模型的差距
  • Stable Diffusion 3.5 / FLUX:开源图像生成质量大幅提升,FLUX.1 在某些场景超越 Midjourney v6

开源生态的成熟降低了 AI 产品的创业门槛——你不再必须依赖 OpenAI API,可以在自己的 GPU 上运行达到 GPT-4 水平的模型。

2024 年起,“纯文本”LLM 已逐渐过时。主流模型均支持文本 + 图像 + 音频输入输出:

  • GPT-4o:原生多模态(non-native 改用统一 encoder),支持实时语音对话(平均延迟 320ms)
  • Gemini 2.0 Flash:原生支持文本、图像、音频、视频输入
  • Claude 3.7 Sonnet:强大的视觉理解能力,可分析图表、UI 截图、手写内容
  • GPT-4o audio:端到端语音生成(非 ASR→LLM→TTS 拼接),保留了语调和情感

产品层面,这意味着用户可以直接”发一张截图问问题""录一段语音对话”,交互方式从打字扩展到语音和视觉。

API 价格在 2024 年下降了约 10 倍:

模型2024 年初价格2025 年初价格降幅
GPT-4 Turbo(128K)10/10 / 30 per M tokensGPT-4o: 2.50/2.50 / 10~4-3 倍
Claude 3 Opus15/15 / 75Claude 3.5 Sonnet: 3/3 / 15~5 倍
GPT-3.5 级别0.50/0.50 / 1.50GPT-4o-mini: 0.15/0.15 / 0.60~3 倍

成本下降使得此前不经济的 AI 应用场景(如大规模文档处理、实时 Agent 循环、海量 RAG 检索)变得可行,催生了更多 B 端 AI 应用。

AI 应用的商业模式在 2025 年逐渐分化为几种成熟范式:

理解这些模式对技术选型很重要:如果你的产品需要大量推理调用,API 计费模式下成本会线性增长,可能需要考虑本地部署开源模型来摊薄成本。

阅读产品拆解前,建议先了解以下基础章节。如果某个概念让你困惑,可以随时跳转学习后再回来:

LLM 基础理论:

LLM 工程核心:

训练与微调:

Agent 与工具:

以下是几条建议阅读路径,根据你的目标选择:


💡 本目录持续更新:AI 应用生态变化极快,我们会持续跟踪新产品和技术演进。如果你发现某个重要产品缺失或内容过时,欢迎反馈。