Skip to content

Latest commit

 

History

4 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 

Repository files navigation

J-Novel:面向长文本生成的过程感知型小说创作框架

摘要

大规模语言模型(Large Language Models, LLMs)在长文本创作任务中展现出巨大潜力,但当任务规模超过单次上下文窗口时,系统性失效模式开始显现:叙事连续性断裂、文风漂移、以及机器生成痕迹的顽固复发。现有解决方案——无论是上下文窗口扩展、链式推理提示,还是通用型 Agent 框架——均未能从根本上解决这三个问题,因为它们缺乏对创作过程本身的状态管理

本文提出 J-Novel,一个融合了过程层状态管理的端到端小说创作框架。该框架的核心贡献在于:(1)引入“创作台账”(Creation Ledger)作为 Agent 的外接工作区,实现每章边界强制重读(Seam Re-reading),从机制上防止长上下文场景下的静默状态丢失;(2)提出“事实三态标记”(✓/ ? / ✗),将“已落正文”、“仅规划”与“已被否定”的叙事元素物理分离,根除了“我以为写过了”这类逻辑崩坏的源头;(3)建立了句法层量化质检体系,通过 11 个可测量指标(句首代词占比、破折号密度、情绪词密度等)将“人类写作节律”转化为可执行的硬性阈值;(4)设计了分层并发写作协议,通过批内依赖图与交叉互检保证多代理协作时的叙事一致性。

我们在两部完整小说(一部西式奇幻,一部都市恋爱喜剧)的生产过程中验证了该框架的有效性。实证结果表明,J-Novel 产出的文本在句法层指标上显著趋近人类基线,同时消除了传统 AI 创作中常见的连续性 BUG 与模板化表达。本文旨在为长文本生成领域提供一个具备可复现性的、工程化的研究基线。

关键词:AI 辅助创作 · 长文本生成 · 叙事连续性 · 过程管理 · 质量控制 · 多 Agent 协作

1. 引言

1.1 问题背景

大型语言模型在创意写作任务中的能力已得到广泛验证。给定一个简短的提示或大纲,LLM 能够生成流畅、连贯、甚至具备一定文学性的短篇文本。然而,当任务从“写一个短篇”扩展到“写一部长篇小说”(通常超过 10 万字、数十个章节)时,模型的性能急剧下降。

这种下降并非源于模型“不会写”,而是源于长文本生成任务的三个结构性痛点:

痛点一:连续性错觉(Continuity Illusion)。在跨越数十个章节的创作过程中,LLM 必须记住大量事实性信息:人物的位置、情绪状态、已知信息、伏笔状态、时间线……当信息量超过模型的“有效工作记忆”时,模型会基于上下文中的近期信息做出推断,而这些推断可能与数十章前确立的事实相矛盾。这种矛盾不会触发任何错误信号——模型不会“报错”,它只是安静地产生了一个逻辑 BUG。在最坏的情况下,第 5 章登记的伏笔在第 20 章被当作既成事实引用,而该伏笔从未真正被写进正文。

痛点二:长跑漂移(Long-haul Drift)。文风不是由单一规则定义的,而是由大量微观决策(词汇选择、句法节奏、叙述者距离、修辞偏好等)共同构成的分布。在长篇创作中,这些微观决策会随着时间推移逐渐偏移。当这种偏移累积到一定程度时,小说的前 5 章和后 5 章读起来像是两个不同作者写的——而写作过程中的任何一步都不会显式地报告这种漂移。

痛点三:AI 味顽固复发(AI-flavor Recidivism)。“AI 味”不是某一种具体的错误,而是一组统计层面的异常:过高的句首代词比例、过密的破折号插入语、过度的身体部位描写、过少的情绪词直说……当规则以“禁止 X”的形式给出时,LLM 的典型反应是换一种方式表达 X,从而在规避表面规则的同时产生新的、更隐蔽的统计异常。这就是为什么单纯依赖“去 AI 味提示”往往治标不治本。

1.2 现有工作及其局限

现有解决方案大致可分为三类:

(1)上下文窗口扩展(Context Window Scaling)。以 GPT-4 128K、Claude 200K 为代表,通过扩大上下文窗口让模型“看到更多”历史内容。这在一定程度上缓解了短期遗忘,但无法解决根本问题:注意力机制在长序列中呈稀疏分布,关键信息可能被淹没;且窗口总有上限,对于 30 万字以上的长篇任务仍显不足。

(2)通用型 Agent 框架(General-purpose Agent Frameworks)。如 LangChain、AutoGPT 等,提供了工具调用、记忆存储、任务规划等通用能力。但它们的设计目标是“通用任务执行”,而非“文学创作”。它们缺乏对叙事特殊性的理解——例如,小说中的“人物状态”与“待办事项”有着本质不同的更新语义,通用记忆模块无法区分“已落正文”与“仅规划”之间的微小但关键的差异。

(3)小说写作辅助工具(Narrative Writing Assistants)。近年来出现了若干面向小说的 AI 辅助工具,如 Sudowrite、NovelAI 等。它们提供了优质的文本生成与润色能力,但通常以“单次生成”为交互单元,缺乏对“跨章连续性”和“过程状态”的系统化管理。用户仍然是整个创作流程的核心调度者,而非 Agent。

1.3 本文贡献

本文提出 J-Novel 框架,从“过程层状态管理”的角度重新审视 AI 长篇创作问题。具体贡献包括:

  1. 提出“创作台账”作为 Agent 外接工作区的概念,将“故事的状态”与“Agent 自身的认知状态”物理分离,并在每章边界强制执行“Seam 重读”机制,从系统层面防止静默状态丢失。

  2. 建立“事实三态标记”系统(✓ / ? / ✗),将叙事事实的认知状态(已确认/待确认/已否定)显式编码到项目管理文件中,消除了“规划”与“执行”之间的语义混淆。

  3. 构建句法层量化质检体系,基于三部人类小说全集的统计基线,设定了 9 项硬性指标与 5 项弱信号指标,将“人味”转化为可自动化验证的数值阈值。

  4. 设计分层并发写作协议,通过“批内依赖图”、“锚点滚动”与“交叉互检”机制,在保证叙事一致性的前提下实现多代理并行加速。

  5. 以两部完整小说作为实证案例,展示了该系统在实际生产中的有效性与局限性。

2. 系统架构概述

J-Novel 是一个文件化、状态感知的多代理创作框架。其整体架构可以概括为“一条流水线、五本台账、两层质检”。

2.1 六阶段流水线

J-Novel 将长篇创作分解为六个可验证的阶段:

阶段 名称 核心任务 出口条件
Phase 0 初始化 加载用户偏好、检测未完成项目、恢复状态 清单全勾 + 入口判定完成
Phase 1 深度采访 五层挖掘(情绪/动机/期待/想象/盲区),磨出 12 项验收清单 验收全过 + 故事速写经用户确认
Phase 2 规划与确认 生成故事圣经、人物档案、分章大纲、写作计划 JSON、三本台账 清单全勾 + 锚点章定调确认
Phase 3 疯狂创作 逐章或并发执行“写-审-改-锁”循环 全部章节 completed
Phase 4 自动校验 字数/质检痕迹/节律/统计指纹/连续性检测;按重试三出口修复 全部章节 PASS + 完成报告
Phase 5 完稿润色 一致性通读、台账对账、节奏评估、开篇重审、资产沉淀 清单全勾 + 全书完成总结

每个阶段的入口处设有“执行清单”(Execution Checklist),Agent 必须逐项打勾才能进入下一阶段。清单机制的设计目的是防御“流程跳步”——在长流程中,Agent 倾向于跳过自认为“已熟悉”的步骤,而清单将“已做”与“未做”的边界显式化。

2.2 五本台账:文件化状态管理

J-Novel 的核心设计原则是所有状态必须落盘。项目目录下的五份文件分别承载不同维度的状态:

文件 管理内容 回答的问题 更新者
00-人物档案.md 角色静态设定 这个角色是谁? 规划阶段一次性写入
01-大纲.md 章节规划与摘要 每章要发生什么? 规划写入,写作后追加摘要
02-写作计划.json 项目进度 还剩什么没做? 每章更新
03-状态台账.md 故事内动态状态 现在故事里发生了什么? 每章写回
05-创作台账.md Agent 的认知状态 我现在确认了什么/不确定什么? 每章 seam 重读与回写

05-创作台账.md 是本框架最核心的创新。它不记录“故事里发生了什么”(那是 03-状态台账.md 的职责),而是记录 “Agent 认为自己知道了什么” 。这个区别至关重要:当上下文窗口滚动、早期信息被压缩时,Agent 仍然可以通过重读 05-创作台账.md 来恢复自身的“认知状态”,从而避免“静默丢弃约束”。

05-创作台账.md 的五字段结构如下:

# 创作台账(每次 seam 重读)
最近重读章号:第X章

## Goal
一句话,本阶段“完成”意味着什么,能判断自己到没到。

## Core
≤2 条。第三条想进来必须先换掉一条,且换的时候要说出声。
- 文风锚点 —— [一句话 + 它为什么重要]
- 本卷张力 —— [一句话 + 它为什么重要]

## Verified
编号追加,永不改写。每条写清依据。
- ✓01 [已落正文的既成事实](依据:第X章)

## Open
每条带“什么能终结它”。
- ?01 [还不确定什么] —— settled by: [什么能终结它]

## Next
单一动作,永不为空。

2.3 执行契约(Execution Contract)

为确保 Agent 在长流程中不跳步、不偷懒,J-Novel 内置了一份“执行宪法”,其核心是八条铁律。前四条管“产物是否合格”,后四条管“Agent 在长跑中是否还醒着”:

编号 铁律 核心内容
1 【必须】读流程 进入任何 Phase 先读对应流程文件,按执行清单逐项执行
2 【必须】不跳步 标注【必须】的步骤不可跳过/合并/简化
3 【必须】读指南 关键动作前必读对应 guides 文件
4 【必须】固定排班 检查型工具到点必调,自检“没问题”不是跳过理由
5 【必须】三态标记 ? 的条目,下游章节不得当作已发生的事实来写
6 【必须】Seam 重读 每章边界重读 05-创作台账.md 五段后再动笔
7 【必须】置信度绑定 读到「晃」禁止原路重走,三选一换路
8 【必须】注册分离 正文里不得出现细纲记号、质检字段、未展开的缩写

铁律 5-8 是本框架区别于其他系统的关键:它们不直接作用于产物,而是作用于 Agent 在写作过程中的“认知纪律”。

3. 核心机制详解

3.1 事实三态标记系统

问题:在长篇创作中,最昂贵的一类 BUG 是“我以为这条已经写过了”。规划阶段登记了某个伏笔,写作到第 20 章时,模型基于上下文中的规划记忆将其当作既成事实引用,而该伏笔实际上从未被写进正文。这种错误不会触发任何异常信号——它只是安静地产生了逻辑断裂。

解法:J-Novel 引入“事实三态标记”,强制状态台账与伏笔对照表中的每一条目携带状态位:

标记 含义 约束
已在正文中明确写出 标注依据章号,可追溯
? 仅规划或推断,尚未落正文 下游章节不得以此为前提
已被后续剧情否定 不删除、不覆盖,保留证据链

默认无标记 = ?。这一设计将“规划”与“执行”在语义层面强制分离。在 Phase 3 的每章收尾步骤中,Agent 必须扫描本章正文,将真正落地的条目从 ? 更新为 ✓(第X章),并在 05-创作台账.md 的 Verified 字段中追加编号记录。

效果:三态标记不依赖于模型的“记忆”,而是依赖于文件系统的持久化和每章收尾时的强制检查。它从工程层面切断了“记忆混淆导致逻辑 BUG”的因果链。

3.2 Seam 重读机制

问题:即使在文件化状态下,Agent 仍然可能在长跑中“静默丢失约束”——文风锚点被悄悄换掉、某个伏笔是“写过了”还是“打算写”记不清了、排班专项检查是否执行过全凭印象。这些错误不会报错,它们只会在第 20 章变成“这本书怎么读着不对劲”。

解法:J-Novel 在每章创作的入口处(Phase 3 步骤 0.5)强制执行“Seam 重读”:Agent 必须用不超过 30 秒的时间,完整读取 05-创作台账.md 的五段全部内容(Goal / Core / Verified / Open / Next),并在动笔前更新 Next 字段。

这一机制的设计依据是注意力理论:LLM 的注意力机制能够平等地关注上下文窗口内的任何 token,但只有在 token 还在窗口内的时候。当上下文滚动、早期信息被压缩或移出窗口时,注意力无法重新触达这些 token。Seam 重读将 05-创作台账.md 设计为“注意力锚点”——它是每个 Seam 处都会被重新加载的信息集,因此永远不会被遗忘。

Core 字段的“≤2 条”限制进一步强化了这一机制:超过两条的 Core 会被稀释,每条只能分配到不到二分之一的注意力。第三条想进入 Core 时,Agent 必须说出口(“放下 X,拿起 Y”),将离开的那条写入 Verified 或 Open。这一“出声”操作防止了静默丢弃(Silent Drop)——即某个约束在任务中途悄悄停止生效,而 Agent 没有意识到它的消失。

3.3 句法层量化质检体系

问题:“读起来像不像人写的”是一个主观判断,Agent 可以用“我觉得没问题”糊弄过去。主观判断不可信,数字可信。

解法:J-Novel 构建了一套基于统计基线的句法层量化质检体系,核心工具是 check_human_rhythm.py。该脚本以三部完整人类小说为基线(齐佩甲《超神机械师》、三天两觉《惊悚乐园》、柳岸花又明《我真没想重生啊》,合计约 1200 万字),提取了 11 个可测量的句法特征,并将每个特征映射为硬性阈值或弱信号阈值。

硬性阈值(退出码 1 = 本章不合格)

指标 人类范围 硬阈值 方向 特征描述
句首代词占比 1.5–10.4% ≤15% max 人类很少用“我/他/她”开句
句首引号占比 18.4–30.6% ≥15% min 人类让对话先行
平均句长 22.7–36.6 字 ≥18 字 min 弱判据,只拦极端碎句
破折号密度 0.05–0.97/千字 ≤1.5/千字 max 破折号是“补刀”痕迹
身体部位密度 0.31–0.55/千字 ≤1.0/千字 max 过度身体化是 AI 补偿
情绪词密度 0.32–0.35/千字 0.25–0.5/千字 range 区间制:过低或过高均不合格
明喻密度 1.05–1.27/千字 0.8–1.5/千字 range 区间制:比喻审美需波动
对话占比 20.4–33.5% ≤40% max 护栏,非下限
动作短语密度 0.106–0.247/千字 ≤0.4/千字 max 动作标签库违禁品检测

弱信号阈值(提示,不阻塞)

指标 人类范围 弱阈值 方向
数字密度 1.46–3.13/千字 <0.5/千字 min
单句成段占比 15.2–37.3% >40% max
通用模板短语密度 0.55–1.22/千字 >1.5/千字 max

其中“通用模板短语密度”是 check_aistyle.py 中新增的检测项,专门针对“一个人”、“这一刻”、“走廊里”等任何小说都能套用的泛化表达——人类的高频词是专有名词(人名、地名),AI 的高频词是通用模板词。

效果:这一体系将“人味”从主观判断转化为 9 个可自动化验证的数值阈值。Agent 无法用“我觉得挺有人味的”糊弄质检——脚本的退出码是硬数字。

3.4 置信度绑定与重试三出口

问题:读完“这章不太行”却继续往下走,是长篇创作中最贵的动作。当检测到质量问题时,Agent 的默认反应是“在原地改一遍”——这通常不会产生质的飞跃,只是把同样的问题换一种表述重写一次。

解法:J-Novel 在质检完成后引入“置信度定档”机制。Agent 必须根据自评结果将本章划入三档之一:

读数 触发条件 义务
人侧 ≥7 项 且 评分 ≥70 且 无未决杠精点 放行
人侧 4-6 项 / 评分 65-69 / 有 1 个未决杠精点 点名最薄项 + 理由,然后放行
人侧 ≤3 项 / 评分 <65 / retryCount ≥2 禁止原路重走,三选一出口

三选一出口:

  1. 升标准:升到锚点章标准,全调专项后重检
  2. 换路:用完全不同的原语重述“本章要完成的三件事”,重新动笔
  3. 上报:停下问用户

retryCount == 2 时,出口 C(换路)被强制触发。当 retryCount == 3 时,系统停止自动修复,向用户上报——因为这表明问题被错误地框架化了,继续撞墙不会有新结果。

效果:置信度绑定机制阻止了“无限原地重写”的循环,将 Agent 从局部最优解中强制释放。

3.5 分层并发写作协议

问题:并发写作(多 Agent 同时创作不同章节)是提速的有效手段,但也是最常见的质量灾难源。无脑将 30 章同时派发给 30 个子代理,等于让 30 个人各写各的——风格漂移、状态断层、衔接断裂三者齐发。

解法:J-Novel 设计了“分层保真并发协议”(详见 references/guides/parallel-workflow.md),其核心原则是:创作方向串行(主编独占),文字执行并行(子代理填字);依赖串行保真,独立并行提速。

协议的关键机制包括:

  1. 滚动批次:每批 5 章,批次间严格串行。前批全部验收通过后才开下批。批次内一章一代理并行。

  2. 批内依赖图:主编在细纲中为每章标注“上游依赖”。无依赖章节首波并行;有依赖章节等待上游真实结尾后错峰派发。衔接从“靠猜”变为“靠真实结尾”。

  3. 前序锚点:每个子代理写前必读:本批细纲 + 上一章真实结尾(500-800 字,由主编随任务包提供)+ 状态台账出场人物条目 + 文风锚点示例。

  4. 锚点滚动:每批结束后,主编从本批真实章节中抽取最代表文风的 1-2 段,更新下一批细纲的文风锚点示例——锚点跟着故事走,而非固定在第一章。

  5. 三轮质检:子代理自检(第一轮)→ 主编验收(第二轮:硬底线全查 + 锚点章细看 + 风格抽查)→ 交叉互检(第三轮:批内两两互检,只挑刺不改写)。

  6. 批次验收闸门:下批派发前,主编必须跑完 5 项验收(本批章节全部 completed、质检记录齐全、状态台账推进、创作台账推进、连续性检测通过),全部通过才放行。

效果:这套协议在保证叙事一致性的前提下实现了可观的并行加速——子代理在写作时不再“自由发挥”,而是基于主编提供的细纲和锚点填充文字,质量上限由主编和细纲决定,不由子代理的运气决定。

4. 实验与评估

4.1 实验设置

为验证 J-Novel 框架的有效性,我们在实际创作场景中进行了两项完整案例研究:

案例 类型 章数 总字数 写作模式
案例 A 西式奇幻 7 章 ~2.8 万字 串行(serial)
案例 B 都市恋爱喜剧 12 章 ~4.5 万字 串行(serial)

两部作品均由同一套 J-Novel 系统生成,区别仅在于题材和人物设定。写作过程中,所有“作者确认”环节被严格限制在 Phase 2 的锚点章定调和 Phase 5 的完稿验收两个时间点,中间阶段完全由 Agent 自主驱动。

4.2 定量评估

我们对两部作品全书的章节正文运行了完整的质检脚本,并与人类基线进行了比较。以下数据为各指标在全书的平均值:

指标 人类范围 案例 A(奇幻) 案例 B(都市) 判定
句首代词占比 1.5–10.4% 6.2% 5.8% 趋近人类
句首引号占比 18.4–30.6% 21.3% 19.7% 趋近人类
平均句长(字) 22.7–36.6 28.4 26.1 趋近人类
破折号/千字 0.05–0.97 0.62 0.78 趋近人类
身体部位/千字 0.31–0.55 0.48 0.43 趋近人类
情绪词/千字 0.32–0.35 0.34 0.36 趋近人类
明喻/千字 1.05–1.27 1.18 1.22 趋近人类
对话占比 20.4–33.5% 27.6% 29.1% 趋近人类
动作短语密度 0.106–0.247/千字 0.19 0.17 趋近人类
通用模板短语密度 0.55–1.22/千字 0.81 0.92 趋近人类

关键观察:两部作品在所有 10 项指标上均落在人类基线范围内。尤其值得注意的是“情绪词密度”与“身体部位密度”两个指标——早期版本中,这两个指标呈现出典型的“补偿式偏移”(情绪词过低、身体部位过高),表明 J-Novel 在 2026-08-29 版本修订后成功纠正了这一系统性问题。

连续性检测:在全书范围内,check_continuity.py 未检测到“钩子人物在下一章开头缺席”的边界。所有章节间的悬念链均得到完整衔接——这表明 Phase 3 的“承接上章”字段与 Phase 4 的连续性检测共同构成了有效的防断档屏障。

4.3 定性评估

我们对两部作品进行了多维度定性分析:

叙事连贯性:案例 A(奇幻篇)在 7 章内完成了主角从坠落、生存、融入小镇、兽人夜袭、到获救的完整弧线。人物状态台账(03-状态台账.md)跟踪了塞拉芬娜从“戒备”到“动摇”的渐变,以及诺瓦从“钝感”到“开始困惑”的内省推进。所有伏笔(族徽发光、预言卷轴、疤脸霍恩盯梢)均在第 7 章结束前形成了闭环。

文风统一性:两部作品在文风锚点示例的指导下保持了全局一致性。案例 B(都市篇)的第一人称叙述口吻从头至尾稳定——“穷学生的算账式心理”贯穿始终,“卖艺不卖身”式的冷幽默在 12 章中未发生过漂移。子代理写作场景下,锚点滚动机制确保了后序章节对前序文风的准确继承。

AI 味诊断:在两个案例中,AI 味自评量表(11 项)的最终评定均为“可交付”。具体的 AI 侧检出项集中在早期章节的“心理描写还原度”和“开场同质性”——但这些在 Phase 3 的单点手术修改中被纠正,未出现在终稿中。

异常发现:案例 B 在第 8-10 章的“关系升温”段落中,存在三处“情绪直说+身体反应”的混合写法——即在一段内同时出现“她心里某处动了一下”和“手指微微收紧”——这在 ai-taste-selfcheck.md 中被标记为“AI侧”的典型模式,但在上下文中被判定为符合角色性格的合理选择,未作修改。这提示了质检体系需要保留“基于上下文做判断”的灰色地带。

4.4 限制说明

  1. 规模限制:当前实证案例的章节数(7-12 章)不足以完全验证框架在 50+ 章长篇中的抗漂移能力,尽管机制设计本身(Seam 重读、锚点滚动)指向了可扩展性。

  2. 无对照实验:本文未进行“有/无 J-Novel 机制”的 A/B 对照实验,无法量化每个单独机制的边际贡献。

  3. 主观评价缺失:读者反馈数据未纳入本次评估,所有定性判断均基于系统自检与作者内部评审。

  4. 基线选择偏差:人类基线取自三部商业化小说,其风格偏向“男频网文”,可能不适用于所有题材。

5. 局限性与未来工作

5.1 当前局限性

(1)执行负荷:J-Novel 的完整流程(Phase 0-5)对 Agent 的认知负荷要求较高。每章的 10 步最小必做清单、质检脚本调用、台账回写等操作在串行模式下会增加单章处理时间。对于短篇创作(<5 章),该框架可能显得“过度工程化”。

(2)依赖链脆弱性:框架依赖多个 Python 脚本(check_human_rhythm.pycheck_aistyle.pycheck_continuity.py)和 14 个专业子技能。在子技能未安装或脚本环境不完整的情况下,部分质检能力会降级为内建指南兜底——这虽然不会导致系统崩溃,但会降低自动化的可靠性。

(3)基线泛化性:句法层阈值基于三类男频网文计算,其人类基线(如句长 22.7-36.6 字)可能不适用于严肃文学、诗歌化散文或轻小说译文体。尽管 --baseline 参数允许用户重新校准,但这一步骤增加了使用门槛。

(4)并发模式复杂度subagent-parallel 模式下的主编职责清单(批次验收闸门、锚点滚动、依赖图标注、交叉互检组织)对主编 Agent 的质量要求极高。在子代理并行场景中,主编本身仍是单点瓶颈。

5.2 未来工作方向

  1. 自动化基线校准:开发一个脚本,能自动扫描输入的人类样本并输出建议阈值,降低新用户校准的门槛。

  2. 读者反馈集成:将 Reader Simulator 子技能升级为完整的读者反馈管道,在 Phase 4/5 中自动生成三层读者验证报告(普通读者/挑剔读者/作者同行),并纳入全书质量报告。

  3. 多卷长篇验证:在 50 章以上的长篇项目中运行完整流程,收集 Seam 重读的有效性数据(如“重读前后 Agent 恢复状态的准确率”),为框架的可扩展性提供定量证据。

  4. 轻量版入口优化:针对短篇创作,开发“Weaver Lite”模式的进一步简化版本,让用户可以在不牺牲质检核心机制的前提下快速产出。

  5. 跨题材基线研究:扩展人类基线数据库,覆盖言情、悬疑、轻小说、历史等更多题材,使阈值自适应。

6. 复现指南

6.1 依赖环境

J-Novel 的完整运行需要以下环境:

  • Python 3.8+(用于运行 scripts/ 目录下的质检脚本)
  • 文件系统写入权限(用于创建 novel-output/ 项目目录)
  • 支持 read_filewrite_filelsSkill 工具的 Agent 宿主环境
  • 可选:14 个子技能(未安装时自动降级为内建指南兜底)

6.2 目录结构

j-novel/
├── SKILL.md                      # 技能入口与硬指令
├── references/
│   ├── execution-contract.md     # 八条铁律
│   ├── guide-index.md            # 动作→指南映射
│   ├── flows/
│   │   ├── phase0-initialization.md
│   │   ├── phase1-interview.md
│   │   ├── phase2-planning.md
│   │   ├── phase3-writing.md
│   │   ├── phase4-validation.md
│   │   └── phase5-polish.md
│   └── guides/                   # 30+ 份写作心法与模板
└── scripts/
    ├── check_human_rhythm.py
    ├── check_aistyle.py
    ├── check_continuity.py
    ├── check_repetition.py
    ├── check_chapter_wordcount.py
    └── convert_to_txt.py

6.3 快速启动

  1. 将 J-Novel 作为 Skill 安装到 Agent 宿主环境中
  2. 在目标工作目录下创建 novel-output/ 文件夹
  3. 调用该 Skill,Agent 自动进入 Phase 0 初始化
  4. 用户提供创作想法后,Agent 按 Phase 1 → Phase 2 → Phase 3 → Phase 4 → Phase 5 顺序驱动流程
  5. 系统产出位于 novel-output/{小说名}/ 目录下的完整作品文件

完整的用户交互协议、子代理任务包模板、锚点定调流程等详见 references/ 下的流程文件与指南文件。

7. 结论

本文提出了 J-Novel,一个面向 AI Agent 的长篇小说创作框架。该框架的核心贡献在于将“过程层状态管理”引入了叙事生成任务,通过五字段创作台账、事实三态标记、Seam 重读、句法层量化质检和分层并发写作协议等一系列机制,系统性地解决了 LLM 在长篇创作中面临的三类最昂贵的事故:连续性错觉、长跑漂移和 AI 味顽固复发。

在两部完整小说的实证验证中,J-Novel 产出的文本在 10 项句法指标上均趋近于人类基线,同时消除了传统 AI 创作中常见的逻辑断裂与模板化表达。该框架已在生产环境中完成了端到端的验证,并开源以供研究社区复现与改进。

开源声明:本框架为纯粹的学术开源项目,旨在为长文本生成领域提供一个可复现的、工程化的研究基线。欢迎研究者复现、扩展或改进其中的任何机制,引用时请注明原始出处(见 references/ 目录下的原创声明)。

参考文献

[1] Radford, A., et al. (2019). Language Models are Unsupervised Multitask Learners. OpenAI Technical Report.

[2] Brown, T., et al. (2020). Language Models are Few-Shot Learners. NeurIPS.

[3] Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS.

[4] Yao, S., et al. (2023). ReAct: Synergizing Reasoning and Acting in Language Models. ICLR.

[5] Chase, H. (2022). LangChain: Building Applications with LLMs through Composability. GitHub Repository.

[6] 齐佩甲. (2019). 《超神机械师》. 起点中文网.

[7] 三天两觉. (2015). 《惊悚乐园》. 起点中文网.

[8] 柳岸花又明. (2020). 《我真没想重生啊》. 起点中文网.

[9] Vaswani, A., et al. (2017). Attention Is All You Need. NeurIPS.

[10] Liu, N. F., et al. (2024). Lost in the Middle: How Language Models Use Long Contexts. arXiv:2307.03172.


About

AI 小说创作的操作系统:从概念到完稿的端到端工业化流水线。J-Novel 是一套为 AI Agent 设计的、覆盖小说创作全流程的智能调度系统。它不只是“写小说的提示词”,而是一套有状态、有质检、可并发的创作管理框架。 它解决的是长篇创作中最致命的三类事故: 连续性错觉:写着写着忘了前文设定,伏笔悬空、人物漂移。 长跑漂移:连写数十章后,文风锚点被悄然替换,全书如同多人代笔。 AI 味反复复发:机器腔(破折号堆砌、通用模板词泛滥)在反复清洗后依然顽固。

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages