衡量标准是平台有多少角色可聊、多快能产出、质量是否稳定。冷启动期最缺的不是功能而是内容, 一个角色的完整人设人工写要半天,而平台需要成百上千个。
我把「从零写一个人设」拆成多个可校验步骤,用脚本串成可批量执行的生产链路。 支持两种输入:一句灵感,或一张已有角色卡。
为什么分四段而不是一个大 prompt:一次性从灵感生成 36 字段结构化人设,模型会顾此失彼, 顾了格式就丢文笔,顾了文笔就漏字段。拆开后创作段只管写好一篇自然语言人设,结构化段只管准确切进字段。
最初拆开只是为了让模型别顾此失彼,实际最大的收益是可归因。中间产物全部落盘留档后, 「输出不好」这种没法排查的反馈变成了「第三段的语感不对」。
部分字段需要在每轮注入聊天上下文,这部分设有严格预算。 超了会挤占对话历史空间,也直接推高每轮成本。模型不会自觉守,所以我写了校验脚本, 跑批后统计每个角色的注入字段字符数,超标的打标记回看是哪个字段写飘了。
任何靠 prompt 措辞约束的量化要求,模型都会漂。要么把它变成可校验的检查项,要么就别写进 prompt 里假装有约束。
面向多区域的内容产品,审核不是可选项。我建立了多语言内容风险审核机制,覆盖三类风险: 真人艺人姓名、有版权的角色形象、违规用语。
| 批次 | 规模 | 处置 |
|---|---|---|
| 创作者素材名称与描述 | 多批次 | 核对图文一致性与本地化,输出问题清单 |
| 贴纸素材视觉与内容审核 | 多批次 | 按主题、风格、色调、角色结构化归类 |
| 韩文表情包筛选 | 547 → 242 | 剔除不合规与低质,保留可用集 |
线上生成资产分散在多个功能域,早期依赖命名模拟目录层级,缺少统一规范。 我梳理时先反推出隐含规则:命名同时编码了功能域、内容类型、语言变体三条正交的轴。
清点只是第一步,更有价值的是找出四类不一致:
产出是统一的命名与版本规范、按线上层级还原的本地目录树(可离线检索与 diff)、一份带索引的清单。 另外维护了多语言动态素材库与多风格的生成资产体系。
链路跑通后格式覆盖度和信息密度都达标,但和人工精写的对比,有趣程度与审美判断力差距明显。 模型缺的不是信息量而是 taste,给它泛化的描述要求,它会填最安全的套路。 试过 few-shot,能提升细节质感,但解决不了模型不敢写出格的东西,而有趣往往来自出格。
所以下一步方向定的是优化输入源而不是继续调链路。承认天花板让我停止了在低收益路径上投入。