AI 叙事与互动小说技术
AI Dungeon、NovelAI、AI Roguelite、Tale 这类产品让玩家用自然语言自由行动,由大语言模型(LLM,Large Language Model——一种通过预测”下一个词”来生成文本的神经网络)实时生成下一段故事——本质是一个以 LLM 为叙事引擎的互动文本循环。核心难点不在”生成一段文字”,而在让长达数百轮的冒险保持设定一致、角色不崩、伏笔不丢。本页拆解这套叙事引擎的技术架构,并分析各主要产品的商业模式与设计哲学。前置阅读:自回归语言模型、检索增强生成、上下文工程。
把 AI 文字冒险想象成一群人围着篝火”接龙讲故事”——
- 朴素做法 = 只念最近几句话:每个人只记得上一轮说了什么。讲到第 50 轮,主角的名字都变了,第三章交的朋友彻底消失,剑的名字一会儿叫”破晓”一会儿叫”暮光”。
- 进阶做法 = 带着笔记本接龙:一个”记录员”专门维护三样东西——一张世界设定卡(世界规则、地理、阵营)、一张角色状态表(血量、装备、好感度)、一本事件日志(发生过什么大事)。每次轮到某人接龙,记录员把”设定卡 + 状态表 + 最近几轮 + 笔记本里和当前场景相关的旧事件”摊开给他看。接完龙,记录员把新发生的事记进笔记本,更新状态表。
AI 叙事引擎就是这位记录员 + 接龙者的合体:LLM 负责接龙,记忆系统负责把正确的上下文递到 LLM 面前。记忆系统才是这类产品真正的技术壁垒——更深层的原理见记忆系统。
技术架构拆解
Section titled “技术架构拆解”一个生产级 AI 叙事引擎的每一轮交互,远不是”把历史拼进 prompt”那么简单。它要同时管理三种生命周期不同的记忆:
| 记忆层 | 内容 | 生命周期 | 管理手段 |
|---|---|---|---|
| 世界设定 | 世界观、规则、地理、阵营 | 几乎不变,常驻 prompt | 静态系统提示 |
| 角色状态 | 血量、装备、位置、关系 | 每轮可能变化 | 结构化状态追踪 |
| 事件历史 | 具体发生了什么 | 持续增长 | 摘要压缩 + 向量检索 |
为什么必须分三层? 因为上下文窗口(context window——LLM 一次能”看到”的文本长度上限,以 token 为单位)是有限的(详见上下文工程)。把 500 轮冒险的全量历史塞进 prompt 既塞不下,也会让 LLM 注意力分散、叙事质量下降。分层后,常驻的只有”设定 + 当前状态”,事件历史则按需检索——玩家提到”上次那个酒馆老板”时,才把相关旧事件召回进来。
摘要压缩是控制历史长度的核心手段:每当原始对话累积到一定长度,就调用一次 LLM 把旧段落压缩成几句摘要,丢弃原始细节只保留关键事实。向量检索(详见检索增强生成,即 RAG——Retrieval-Augmented Generation,一种在生成前先从外部知识库检索相关信息的范式)则是长程记忆的钥匙——把每个事件存成向量(vector——文本经过 embedding 模型编码后的高维数值表示,语义相近的文本在向量空间中距离也近),玩家输入时检索语义最相关的若干条,拼入上下文。
关键技术点详解
Section titled “关键技术点详解”记忆系统:三层架构
Section titled “记忆系统:三层架构”-
世界设定(World Info / Lorebook):以”关键词触发条目”的形式存储。每个条目带一组触发词(如
["精灵", "艾尔登森林"]),当玩家输入或近期叙事中出现这些词时,对应条目被激活并注入 prompt。NovelAI 的 Lorebook、AI Dungeon 的 World Info 都是此机制。这本质上是一种基于关键词匹配的轻量检索,比纯向量检索更可控、更可预测。一个成熟的世界设定库可以包含数百甚至上千个条目,涵盖人物、地点、物品、阵营、魔法体系等——如果全部常驻,token 预算瞬间耗尽;关键词触发让只有相关条目占用空间。 -
滚动摘要(Rolling Summary):维护一段不断更新的”故事摘要”。每当原始事件日志超出阈值,取最旧的一批事件让 LLM 生成增量摘要,合并进总摘要,然后丢弃原文。摘要本身也会周期性再压缩,形成层级摘要(近期细节 → 中期摘要 → 远期纲要)。这种”压缩的压缩”结构类似于人类记忆的分层遗忘机制——越久远的事记得越模糊,但关键骨架不丢。
-
向量检索(Vector Retrieval):将每个事件编码为向量存入向量库(详见向量数据库)。每轮用玩家输入和当前场景检索 Top-K 相关事件,拼入上下文。这让数百轮前埋的伏笔能在恰当时刻被”想起”。深度实践见检索增强生成。实际工程中,关键词触发和向量检索往往组合使用——前者保证关键设定 100% 命中,后者处理模糊语义关联(如玩家说”那个绿衣服的家伙”,向量检索能找到”精灵游侠 Elara 身着翠绿斗篷”的旧事件)。
上下文窗口组装
Section titled “上下文窗口组装”给定有限的 token 预算,如何分配是核心问题。典型分配策略(详见上下文工程):
- 系统指令(叙事风格、规则):约 10%。
- 世界设定(按触发词激活的条目):约 15%。
- 滚动摘要:约 15%。
- 向量检索召回的相关事件:约 20%。
- 最近 N 轮原始对话(保持即时连贯):约 30%。
- 生成预留:约 10%。
这个预算表不是教条,而是动态的——战斗场景多留原始对话(动作细节不能丢),探索场景多留检索事件(旧线索更重要)。AI Dungeon 早期版本就因上下文管理粗糙而饱受”失忆”诟病,后续版本大幅重构了记忆系统。
LLM 是无状态的自回归模型(见自回归语言模型)——它逐个 token(token——文本的最小处理单元,约等于一个词或一个汉字片段)生成文本,每次生成时只依赖当前 prompt,没有任何跨轮次的”内在记忆”。连贯性完全靠 prompt 约束:
- 一致性约束:在系统提示中强制”角色名固定为 X""武器名固定为 Y”,并在状态表中记录,降低漂移概率。Transformer(Transformer——目前主流 LLM 采用的神经网络架构,核心是自注意力机制 self-attention)虽然理论上能注意到 prompt 中的所有内容,但实践中对”埋”得太深的约束仍会忽略,因此关键设定需要反复强调。
- 风格锚定:放入几段示范文风的前文,让 LLM 模仿语气(few-shot 风格引导——通过在 prompt 中提供示例来引导模型输出风格)。
- 条件生成:用结构化状态控制叙事走向——角色血量低于阈值时,强制注入”你受了重伤”的条件,引导 LLM 生成相应情节。
玩家自由度 vs 故事结构
Section titled “玩家自由度 vs 故事结构”完全自由的 AI Dungeon 式沙盒容易”流水账化”——玩家想干嘛干嘛,但没有主线张力。后来的产品尝试不同平衡:
- AI Roguelite:引入 Roguelike 机制(随机地牢、死亡惩罚、数值成长),用游戏系统给叙事提供骨架,LLM 负责填充细节。游戏系统提供目标感(“活到第十层”),LLM 提供自由度(“我想跟 NPC 讨价还价”),两者互补。
- 结构化叙事引擎:预定义”剧情节点图”,LLM 负责节点内的自由交互,节点切换由系统判定——类似传统文字冒险游戏(如 Zork)的状态机 + LLM 叙事层。
- Agent 驱动叙事:更前沿的方案使用 Agent 架构(Agent——能自主规划、调用工具、多步推理的 AI 系统),让多个角色 Agent 各自维护独立记忆和目标,在同一世界中交互。玩家不再面对单一叙事引擎,而是与一群”有自己意图的 NPC”打交道。Agent 设计模式详见 Agent 模式。
流式推理与用户体验
Section titled “流式推理与用户体验”流式推理(streaming inference——LLM 边生成边返回 token,而非等整段生成完毕再返回)对叙事体验至关重要。想象你在读小说——逐字逐句浮现的悬念感,远胜于盯着加载圈等三秒后蹦出一整段。技术实现上,叙事生成使用流式 SSE(Server-Sent Events)逐 token 推送到前端,让玩家有”故事正在被书写”的沉浸感。同时,前端可以在检测到句号或段落分隔时提前渲染,优化阅读节奏。详见流式输出。
生产环境还需考虑:长文本生成中途如果用户点了”撤销”或”重试”,需要中断流式请求(abort),避免浪费 token 和算力——这对 API 成本控制很关键。
下面是一个最简化的文字冒险循环,演示”系统提示 + 历史摘要 + 向量检索 + 玩家输入”的上下文组装与 LLM 调用:
import openai
# 三层记忆:世界设定(常驻)、滚动摘要、角色状态、检索到的旧事件WORLD = "黑暗奇幻世界。玩家是流浪剑客 Kael,持剑'破晓'。"SUMMARY = "Kael 在灰烬镇酒馆遇到精灵法师 Lyra,两人决定前往龙脊山。"STATE = "Kael: HP 80/100, 装备[破晓之剑], 位置[龙脊山途中]"RECALLED = "第12轮:Kael 在酒馆击败三个佣兵,展现了剑术。" # 实际由向量检索填充
def narrate(player_input: str, history: list[str]) -> str: """组装上下文(设定+摘要+状态+检索+近轮+输入)并调用 LLM 续写""" recent = "\n".join(history[-6:]) prompt = (f"[世界设定]{WORLD}\n[状态]{STATE}\n[摘要]{SUMMARY}\n" f"[相关旧事件]{RECALLED}\n[最近对话]{recent}\n" f"[玩家行动]{player_input}\n[要求]第二人称,150字内,保持设定一致。") resp = openai.chat.completions.create( model="gpt-4o-mini", messages=[{"role": "user", "content": prompt}], stream=False) # 生产环境建议开启流式(见流式推理章节) return resp.choices[0].message.content
history = [] # 主循环while (action := input("\n> 你要做什么? ")) != "退出": story = narrate(action, history) history += [f"玩家:{action}", f"叙事:{story}"] # 追加本轮,供下轮组装 print(f"\n{story}")生产级实现还需补上:向量检索召回相关事件(用 chromadb 或 faiss)、每 N 轮触发摘要压缩、结构化状态解析与更新(可用结构化输出约束 LLM 返回 JSON)、流式输出(见流式输出)以提升体验。
如果想进一步定制叙事风格,可以在开源模型上做 LoRA 微调(LoRA——Low-Rank Adaptation,一种只训练少量低秩参数的高效微调方法,详见 LoRA 训练),用几十万字的目标文风语料让模型”学会”特定写作风格。
商业模式与市场分析
Section titled “商业模式与市场分析”AI 叙事产品虽同源(LLM + 记忆系统),商业模式却截然不同,反映了不同的市场定位。
定价策略对比
Section titled “定价策略对比”| 产品 | 模式 | 价格区间 | 免费额度 | 核心卖点 |
|---|---|---|---|---|
| AI Dungeon | Freemium + 订阅 | 免费~$30/月 | 有(广告/限额) | 开放世界沙盒体验 |
| NovelAI | 纯订阅制 | 25/月 | 无免费层 | 无审查、高隐私、Lorebook |
| Character.ai | Freemium | 免费~$9.99/月 | 充足 | 角色社交、海量 UGC |
| AI Roguelite | 买断制 | ~$20 一次性 | Steam 试玩 | 游戏化数值系统 |
| Tale | 开源免费 | $0 | 全功能 | 隐私、可定制、零成本 |
为什么定价差异这么大? 根本原因是成本结构和目标用户不同:
- API 转售模式(AI Dungeon、Character.ai):产品自身不训练模型,而是调用 OpenAI 等厂商的 API。每次生成都有边际成本(按 token 计费),因此必须通过订阅或广告覆盖成本。高峰期数百万用户的 API 账单是天文数字——AI Dungeon 早期就因 GPT-3 调用量暴增而不得不引入能量系统和限额。
- 自研模型模式(NovelAI):自建 GPU 集群(NovelAI 使用 CoreWeave 提供的 NVIDIA H100 集群,代号”Shoggy”),训练和推理完全自主。前期投入大,但边际成本远低于 API 转售,且不受上游模型策略变化影响。订阅制保证了稳定的现金流来覆盖基础设施成本。
- 本地部署模式(Tale、SillyTavern):用户自己跑模型,零边际成本。产品本身免费开源,靠社区贡献和捐赠维持。代价是叙事质量受限于用户硬件(消费级显卡跑 7B–13B 模型,质量不及 GPT-4 级)。
内容审查:商业与伦理的拉锯
Section titled “内容审查:商业与伦理的拉锯”AI 叙事产品面临一个独特难题:用户会用它生成色情、暴力甚至违法内容。不同产品的应对策略截然不同,这直接影响了用户群体和商业模式:
- AI Dungeon 的教训:2021 年 4 月,AI Dungeon 引入内容审核算法(针对未成年人相关内容),但人工审核员会阅读用户私密故事,加上误判率极高(如”八岁的笔记本电脑”被标记为涉及儿童),引发了大规模用户流失和差评轰炸。此后 AI Dungeon 移除了广告系统、从 Steam 下架(2024 年 3 月),活跃度明显下降。这是一个经典的审查过度反噬案例。安全对齐的技术原理见安全对齐。
- NovelAI 的路线:走”无审查”路线,不限制成人内容,用户数据加密、生成内容归用户所有。这吸引了大量对自由度要求高的创作者和角色扮演用户,但也长期处于版权和伦理争议中(2022 年曾发生源码泄露事件)。
- Character.ai 的困境:作为面向大众的产品,Character.ai 走的是社交娱乐路线,但 2024 年发生了多起青少年因沉迷 AI 角色而自杀的悲剧,面临大量诉讼。2024 年 12 月推出青少年专用模型和安全过滤,2025 年 10 月宣布禁止 18 岁以下用户使用。这类事件揭示了 AI 叙事产品的成瘾性和心理影响是比技术更严峻的挑战。
竞争格局(2025–2026)
Section titled “竞争格局(2025–2026)”AI 叙事赛道的竞争已从”谁的故事更好”演化为多维竞争:
- 模型质量军备竞赛:NovelAI 持续迭代自研模型(从早期的 Calliope/Sigurd 到 Kayra,再到 Erato 系列),每次升级都在长程连贯性和文风质量上显著提升。AI Dungeon 转向自研模型路线(不再纯依赖 OpenAI)。本地派则有 Llama 3/3.1、Mistral、Qwen 等开源模型的快速进步——2025 年的开源 8B–14B 模型在叙事质量上已接近两年前的 GPT-3.5 水平。
- 多模态融合:AI Dungeon 2022 年加入”See”指令生成场景插图,NovelAI 从文本扩展到图像生成(基于 Stable Diffusion 定制的 NovelAI Diffusion)。趋势是文字叙事 + AI 插画 + 甚至语音朗读的一体化体验。
- Agent 化:Character.ai 在 2025 年 1 月推出了基于 LLM 的小游戏(Speakeasy、War of Words),2026 年 7 月推出 AI 动画微短剧(c.ai Series),显示叙事 AI 正从”文字冒险”走向更广泛的互动娱乐。
- 本地化与隐私:随着开源模型和推理框架(如 Ollama、llama.cpp)的成熟,本地部署的文字冒险工具(Tale、SillyTavern 等)在 2025 年获得了爆发式增长——零成本、零审查、完全隐私,成为硬核用户的首选。详见 SillyTavern 和 Open WebUI + Ollama。
技术选型建议
Section titled “技术选型建议”不同场景应该选什么方案?以下是基于实际经验的选型指南:
| 场景 | 推荐方案 | 理由 |
|---|---|---|
| 快速体验 AI 叙事 | AI Dungeon 免费版 | 零门槛、无需配置,直接在浏览器玩 |
| 创意写作 + 精细设定管理 | NovelAI | Lorebook 行业最强、文风可定制、无审查 |
| 角色扮演 / 角色社交 | Character.ai 或 SillyTavern | 前者海量 UGC 角色、后者本地隐私 |
| 游戏化体验(有数值系统) | AI Roguelite | Roguelike 机制提供目标感和张力 |
| 完全掌控 / 隐私敏感 | Tale + Ollama + 本地模型 | 零成本、零审查、可深度定制 |
| 教育 / 企业培训原型 | LangChain + GPT-4 API | 质量优先、开发快、可控性好 |
| 大规模商业产品 | 自研模型 + 自建推理集群 | 长期成本最优、不受制于上游 |
模型选型补充:如果走 API 路线,叙事生成建议用 GPT-4o-mini 或 Claude 3.5 Sonnet(性价比高、创意足);状态解析和摘要生成用更小更快的模型(如 GPT-4o-mini 或本地 7B 模型)以降低成本。如果走本地路线,Llama 3.1 8B 或 Qwen 2.5 14B 在消费级 GPU 上即可流畅运行(配合 GGUF 格式的量化部署——quantization,一种通过降低模型参数精度来减少显存占用和加速推理的技术,详见 LLM 推理优化)。模型选型的系统方法见模型选型。
- 先搭记忆系统,再调叙事质量:新手常见误区是一上来就精调 prompt 文风,却忽略记忆系统——结果故事 20 轮后就”失忆”。先把三层记忆跑通,叙事质量自然上来。
- 摘要不是越短越好:过度压缩会丢关键事实(角色关系、伏笔)。建议保留”谁在何时何地做了什么、结果如何”的最小叙事单元,宁多勿少。
- 世界设定用关键词触发,别全塞 prompt:Lorebook 条目按触发词激活,避免无关设定占满 token 预算。设定条目越多越要严格触发。
- 状态追踪用结构化格式:让 LLM 以 JSON 返回状态变更(
{"hp": -10, "location": "山洞"}),比让它在叙事里自然提及再正则解析可靠得多。 - 温度参数权衡:叙事生成温度(temperature——控制生成随机性的参数,值越高越有创意但也越不可控)建议 0.7–0.9 以保证创意;状态解析和摘要生成用 0.1–0.3 保证确定性。解码策略的完整讨论见解码策略。
- 本地部署完全可行:Tale 等项目用 Ollama + 7B–13B 本地模型即可跑文字冒险,隐私无忧、零 API 成本,代价是叙事质量略逊于 GPT-4 级模型。推理性能与量化部署见LLM 推理优化,本地部署基础可参考Open WebUI + Ollama,小模型选型见小模型。
- 成本监控必不可少:API 模式下,一个活跃用户每天可能产生数万 token 的调用量。务必实现 token 用量监控和用户级限额,否则 API 账单会失控。
典型应用场景
Section titled “典型应用场景”核心产品深度分析
Section titled “核心产品深度分析”- AI Dungeon(Latitude):开创性的 AI 文字冒险,由 Nick Walton 于 2019 年 3 月在 BYU 的黑客松上创建,灵感来自 Dungeons & Dragons 龙与地下城。技术演进路径清晰地映射了 LLM 发展史:Classic 版用 GPT-2 126M(2019.5)→ AI Dungeon 2 用完整 GPT-2 1.5B(2019.12)→ Dragon 模型接入 GPT-3 175B(2020.7)。2021 年 2 月获 330 万美元种子轮融资(NFX 领投),累计用户超 150 万。核心壁垒不是模型本身,而是多年迭代积累的世界设定系统和记忆管理经验——这部分 know-how 即使开源模型也能复用。2024 年 3 月从 Steam 下架后转向纯网页/移动端运营。商业模式从最初的能量制 → 广告制 → 最终回归订阅制,反复调整折射出 API 成本与用户体验的持续博弈。
- NovelAI(Anlatan):2021 年 6 月上线,总部位于美国特拉华州。定位”AI 辅助小说创作 + 互动叙事”,核心用户是严肃写作者和深度角色扮演爱好者。模型从早期的 Calliope(GPT-Neo 2.7B 微调)、Sigurd(GPT-J 6B 微调)一路迭代到 Kayra、Erato 系列——全部基于开源模型自研微调,摆脱了对任何 API 供应商的依赖。2023 年部署 NVIDIA H100 集群(代号”Shoggy”,致敬克苏鲁神话的修格斯),用于训练自有模型。除文本外,NovelAI Diffusion(基于 Stable Diffusion 定制、在 Danbooru 数据集上训练)提供动漫风格插图生成,ControlNet 支持也让图像构图更可控。Lorebook 系统是行业标杆——支持嵌套触发、权重控制、选择性激活等高级功能,精细程度远超竞品。商业模式为纯订阅制(25/月),无免费层但提供无限生成。用户内容归用户所有,服务器端不存储生成图像,这些隐私承诺是其核心竞争力。
- Character.ai:2021 年 11 月由前 Google 工程师 Noam Shazeer 和 Daniel de Freitas(LaMDA 的核心开发者)创立,2022 年 9 月公测。不同于 AI Dungeon 的”叙事引擎”定位,Character.ai 更像”角色社交平台”——用户创建、分享、与各种 AI 角色对话,角色可以是历史人物、动漫角色或完全原创的虚拟人格。2023 年 3 月以 10 亿美元估值完成 1.5 亿美元融资,2024 年日均访问者达 350 万。技术亮点在于角色”人格”的定义方式:通过角色描述、问候语、示例对话、星级评分反馈等多维度塑造一致的角色行为。2024 年 8 月,Google 非独家授权 Character.ai 技术并重新聘请创始人 Shazeer 回归 Google。安全方面经历了严峻考验——2024 年多起青少年自杀事件引发诉讼,促使平台推出青少年专用模型、安全过滤和 60 分钟使用提醒,2025 年 10 月更全面禁止 18 岁以下用户。2025 年 1 月推出内置小游戏(Speakeasy、War of Words),2026 年 7 月推出 AI 动画微短剧,显示其向更广泛娱乐形态扩展的野心。详见 AI Dungeon 与 NovelAI 中的横向对比。
- AI Roguelite:把 AI 叙事和 Roguelike 数值系统结合——战斗、升级、地牢探索都有游戏机制约束,LLM 负责生成场景描写和 NPC 对话。Steam 平台买断制发行。这种”游戏系统 + LLM 叙事”的混合架构解决了纯沙盒”无张力”问题:玩家有明确目标(生存、变强、深入地牢),死亡有实质惩罚,每一次决策都有重量。类似思路也出现在一些 AI 驱动的桌游辅助工具中。
- Tale(本地 LLM 文字冒险):开源/本地部署路线,用 Ollama 跑本地模型,强调隐私和零成本。适合想完全掌控叙事引擎、定制世界观的硬核玩家。配合 SillyTavern(功能更丰富的本地角色扮演前端)可以构建非常完整的本地 AI 叙事工作流。详见 SillyTavern。
- SillyTavern:开源的本地 AI 角色/叙事前端,支持接入几乎所有主流模型(OpenAI、Claude、本地 Ollama 等),拥有强大的角色卡系统、世界设定管理和预设管理。在本地部署社区中已成为事实标准,尤其适合角色扮演和深度叙事场景。
应用领域扩展
Section titled “应用领域扩展”- 教育与企业培训:用 AI 互动叙事模拟历史场景、商务谈判、危机应对——学员用自然语言互动,LLM 生成情境反馈,比选择题式培训沉浸得多。例如法学院用它模拟法庭质询,医学院用它模拟医患沟通。
- TRPG 辅助 DM:跑团时用 AI 叙事引擎辅助地下城主生成场景描写、NPC 反应,甚至独立充当”AI DM”,降低跑团门槛。对于找不到固定队伍的玩家,AI DM 提供了随时开团的可能。
- 语言学习:通过 AI 叙事场景让学习者在”真实”语境中练习外语——例如在虚拟餐厅点餐、在异国问路,LLM 实时纠正语法并给出口语化建议。
典型类库与工具
Section titled “典型类库与工具”| 类库 | 语言 | 说明 |
|---|---|---|
| OpenAI Python SDK | Python | 调用 GPT 系列模型的官方 SDK,叙事生成最常用的后端 |
| LangChain | Python | 提供 Memory、Retriever、Prompt 模板等组件,适合快速搭建叙事管线 |
| ChromaDB | Python | 轻量级向量数据库,适合存储和检索事件记忆 |
| FAISS | C++/Python | Meta 开源的高效向量检索库,本地事件检索的强力选择 |
| Ollama | Go/Python | 本地 LLM 运行时,Tale 等本地文字冒险项目的后端 |
| NovelAI | 在线 | 商业 AI 叙事/写作平台,Lorebook 系统是设定管理的标杆 |
| KoboldAI | Python | 开源的本地叙事前端,支持多种开源模型和世界设定管理 |
| SillyTavern | TypeScript | 开源的本地 AI 角色/叙事前端,支持几乎所有主流模型接入 |
| 术语 | 英文 | 解释 |
|---|---|---|
| 世界设定 | World Info / Lorebook | 按关键词触发注入 prompt 的背景设定条目集合 |
| 滚动摘要 | Rolling Summary | 对旧事件日志不断压缩生成的层级化故事摘要 |
| 状态追踪 | State Tracking | 维护角色血量、位置、关系等结构化状态的技术 |
| 上下文组装 | Context Assembly | 在有限 token 预算内拼接系统提示、设定、摘要、检索结果、历史的过程 |
| 条件生成 | Conditional Generation | 以结构化状态或标记为条件引导 LLM 生成特定走向的叙事 |
| 叙事连贯性 | Narrative Coherence | 长篇互动故事中角色、设定、情节前后一致的程度 |
| 自由度 | Player Agency | 玩家用自然语言自由行动、影响故事走向的能力 |
| 量化部署 | Quantization | 降低模型参数精度以减少显存占用和加速推理的技术 |
| 流式推理 | Streaming Inference | LLM 边生成边返回 token,而非等待整段生成完毕 |
- 自回归语言模型:理解 LLM 逐 token 生成的无状态本质,是理解”为什么需要外部记忆系统”的前提。见自回归语言模型。
- 检索增强生成(RAG):向量检索召回相关事件的完整技术栈,事件记忆的核心实现手段。见检索增强生成。
- 记忆系统:AI 记忆系统的系统化设计框架,叙事引擎三层记忆的理论基础。见记忆系统。
- 上下文工程:有限 token 预算下的上下文分配与压缩策略,直接决定叙事连贯性。见上下文工程。
- 提示工程:叙事风格控制、一致性约束、few-shot 文风引导的系统性方法。见提示工程。
- 流式输出:让叙事逐字呈现而非等待整段,大幅提升沉浸感。见流式输出。
- 安全对齐:内容审查与安全过滤的技术原理,理解 AI Dungeon 和 Character.ai 审查争议背后的技术约束。见安全对齐。
- Agent 模式:用多 Agent 架构构建自主 NPC 的前沿方案。见Agent 模式。
- 同目录延伸:AI 叙事产品的横向对比与选型,见AI Dungeon 与 NovelAI;本地角色扮演前端,见SillyTavern;本地 LLM 部署基础,见Open WebUI + Ollama。