joesph77hc
Creator of
Recent community posts
# 模型与来源索引
本文件只提供名称、用途和原页面入口。公开 ZIP 不含任何模型权重。下载前必须重新阅读页面当前版本、许可和生成内容限制。
## 底模与基础控制
| 本机文件名 | 用途 | 来源 |
|---|---|---|
| `sdxl/Illustrious-XL-v1.1.safetensors` | Illustrious 基础对照 | https://huggingface.co/OnomaAIResearch/Illustrious-XL-v1.1 |
| `sdxl/waiIllustriousSDXL_v150.safetensors` | 当前主要 CG checkpoint | 需要回到实际下载页核对作者、版本与许可;本包不提供下载镜像 |
| `control-lora-openposeXL2-rank256.safetensors` | SDXL 姿势控制 | 当前来源台账不完整,标为待补 |
| `PerfectHands_xiushou_SDXL.safetensors` | 某些旧 CG 流的低权重手部辅助 | 不属于 70 张七角色事件 CG 的统一必需项 |
## 公开 Dragonmaid Illustrious LoRA
下列原作者页来自既有调查,作者主要为 `Sqquirtle0007`。页面许可不是 SPDX 文件,上传、商用、合并和再分发权限必须逐版本复核。
| 角色/概念 | 本机常用文件 | 原页面 | 常用触发词 |
|---|---|---|---|
| House + Sheou | `01_House_dragonmaid_illuXL_v1.safetensors` | https://civitai.com/models/638636?modelVersionId=1572175 | `house dragonmaid`, `dragonmaid sheou` |
| Kitchen + Tinkhec | `02_Kitchen_dragonmaid_illuXL_v1.1.safetensors` | https://civitai.com/models/638206?modelVersionId=1582700 | `kitchen dragonmaid`, `dragonmaid tinkhec` |
| Parlor + Laundry + Lorpar | `03_Parlor_dragonmaid_illuXL_v1.1.safetensors` | https://civitai.com/models/498744?modelVersionId=1645092 | `parlor dragonmaid`, `laundry dragonmaid`, `dragonmaid lorpar` |
| Nurse + Laundry + Ernus + Nudyarl | `05_Nurse_dragonmaid_illuXL_v1.1.safetensors` | https://civitai.com/models/519282?modelVersionId=1568312 | `nurse dragonmaid`, `laundry dragonmaid`, `dragonmaid ernus`, `dragonmaid nudyarl` |
| Latys | `06_Latys_dragonmaid_illuXL_v2.safetensors` | https://civitai.com/models/1027639?modelVersionId=1361057 | `dragonmaid latys` |
| Chamber + Latys + Stern | `07_Chamber_dragonmaid_illuXL_v1.1.safetensors` | https://civitai.com/models/639374?modelVersionId=1600136 | `chamber dragonmaid`, `dragonmaid latys`, `dragonmaid stern` |
更完整的证据等级、多人能力和镜像页记录见 `06_提示词与资料索引` 下三份调查文档。
## 自训与历史推荐文件
`dragonmaid_curated_v4`、`dragonmaid_pilot20`、`dragonmaid_historical_recommended_v1` 和 `dragonmaid_joint_concat_test` 是本机实验或筛选命名,不等于公开作者发布名。公开包只记录文件名和参数,不分发权重。
联合 LoRA 需要区分:推理时硬叠、成品权重平均/拼接、从训练阶段使用独立 trigger 与 together 数据联合训练。Nurse + Laundry 的公开示例更接近第三种。一个文件能触发多个概念,不代表稳定多人同框。
## TTS
| 模型/项目 | 用途 | 官方来源 | 许可记录 |
|---|---|---|---|
| Qwen3-TTS-12Hz-1.7B-CustomVoice | 预设音色、指令控制、多语底声 | https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice | Apache-2.0,以模型页当前标注为准 |
| Qwen3-TTS-12Hz-1.7B-VoiceDesign | 描述式音色实验 | https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign | 以模型页当前标注为准 |
| GPT-SoVITS v2Pro | 参考音频 zero/few-shot TTS | https://github.com/RVC-Boss/GPT-SoVITS | 代码仓库标注 MIT;依赖和参考音频另查 |
| RVC WebUI | 可选音色转换 | https://github.com/RVC-Project/Retrieval-based-Voice-Conversion-WebUI | 代码与每个训练权重/数据权利分开核对 |
不要把 CustomVoice 输出写成“官方角色声优”或“针对七角色分别训练的模型”。本机角色预设调整的是 speaker、指令、采样和后处理参数,不自动改变底模权重。
## 本机哈希清单
`06_提示词与资料索引/SHA256_manifest.csv` 记录的是 2026-08-06 本地归档的 7 个人形与 6 个龙形映射。多个“龙形文件”与人形文件哈希相同,说明它们是同一多概念 LoRA 的重命名/复用,并不是 13 个独立训练模型。
哈希能确认本地文件身份,不能证明来源许可。
# CG 与提示词管线
## 本机已验证基线
- ComfyUI 环境:`D:\DMT-AI-Studio`
- GPU 环境记录:PyTorch `2.12.0+cu130`,RTX 5090 D 的 `sm_120` 已通过实际 CUDA 矩阵计算
- 启动入口:`D:\DMT-AI-Studio\scripts\start-comfyui-5090.cmd`
- 常用底模:`sdxl\waiIllustriousSDXL_v150.safetensors`
- 代表性事件 CG:1216×832,28 steps,CFG 4.8,`dpmpp_2m_sde` + `karras`
- 角色 LoRA 代表权重:Model 0.78 / CLIP 0.72;具体文件需按角色和模型页调整
这些是本机某批次的可复现记录,不是所有显卡、底模和 LoRA 的通用最佳值。
## 提示词顺序
```text
quality
-> event/action
-> shot/camera
-> blocking
-> identity/costume
-> environment contact
-> lighting
-> rendering finish
```
先写事件句,例如:
```text
她单手接住滑落的碗,另一只手仍在搅拌;台面上的面粉被动作带起,主角停在门口。
```
再给视线、肩膀、双手、身体、脚、尾巴和道具不同任务。至少写清一个接触关系和三层光:主光、补光、轮廓/分离光。
## 批量提示词 GUI
`02_批量提示词GUI/batch_prompt_tool_v2.py` 能:
- 解析 `1. ...`、`2、...`、多行编号和同一行多编号;
- 统一加前缀/后缀;
- 查找、替换或删除;
- 把 UI 工作流转换为 API 结构;
- 1~6 人按编号对齐;
- 设置重复次数、种子与文件名前缀;
- 导出任务包或提交到 `127.0.0.1:8188`;
- 记录提交 manifest。
GUI 会写本地 `batch_config_v2.json` 和 `runs_v2/`。它们属于用户运行数据,不在发布包的初始内容中。
## ComfyUI 节点版
`03_ComfyUI节点` 不读任意本地路径、不访问网络,也不需要额外依赖。节点使用 `OUTPUT_IS_LIST` 输出提示词与种子列表,适合把编号文档直接保存在工作流内。
节点版只负责文本解析、切片、重复和多人编号对齐;区域蒙版、LoRA、Conditioning 合并和保存文件名仍由工作流负责。
## 单人和多人边界
- 单人:一个角色 LoRA + 身份提示词 + 事件词。
- 双人:统一底模,角色 A/B 分区域或分蒙版,各自只加载身份 LoRA。
- 三人以上:先验证布局和遮挡,再逐人修复;不要靠堆更多形容词解决身份串色。
- 角、尾巴、服装、手、脚、道具接触应作为局部返修点。
- 小蓝只使用全年龄、非恋爱、完整遮盖内容。
## 包内 JSON
- `03_ComfyUI节点/workflows/`:无模型的最小解析预览。
- `04_ComfyUI工作流/01_通用模板/`:尺寸与用途模板,不代表完整真实生图链。
- `04_ComfyUI工作流/02_七角色代表API/`:从已生成批次反查的每角色代表 API 工作流。
- `04_ComfyUI工作流/prompt_blocks_sfw.json`:重新整理的全年龄提示词块。
原目录另有 70 个逐图 API JSON。它们与包内 `提示词_七角色各10.md`、`参数清单.csv` 高度重复,因此公开包只保留 7 个代表流,避免把批量运行产物当模板堆进来。
## 接受标准
- 有可读事件,不是空背景站桩图;
- 角色和房间透视、地平线与光向一致;
- 手、脚、衣服、尾巴与环境接触可信;
- 没有重复人物、拼图、卡框、无关龙或暴露;
- 身份特征没有跨角色污染;
- 参数足够恢复工作流。
ComfyUI 显示 success、文件数量正确,只能证明任务完成,不代表视觉通过。
# TTS 与音效管线
## 先纠正名称
`Qwen3-TTS` 不是 GPT-2,也不是 GPT-SoVITS 的“免费底模”。本项目出现过三条不同链路:
| 链路 | 本机用途 | 本机端口/入口 | 是否必须参考音频 |
|---|---|---|---|
| Qwen3-TTS 1.7B CustomVoice | 预设音色 + 指令控制的中/日/英底声、批量短语气 | `127.0.0.1:9881` | 否 |
| GPT-SoVITS v2Pro | zero/few-shot TTS 试听与旧工作台 | `127.0.0.1:9880` | 是 |
| RVC | 把已有 WAV 转为目标音色的可选后处理 | 本地模型/推理脚本 | 需要合法训练的音色权重 |
最终 H5 v2.1 的新增情绪语音记录为 Qwen3-TTS CustomVoice;旧的日语正式配音、GPT-SoVITS/RVC 试听和 Qwen 短语气批次是不同资产层,不应合并描述为一个模型。
## Qwen 批量流程
```text
需求表/CSV/JSON
-> 角色、语言、情绪、强度、语速、目标文件名
-> 9881 /health 确认 ready + loaded
-> /synthesize 生成原始 WAV
-> 去首尾静音、响度处理、时长保护
-> 角色/语言/情绪目录 + 同名 JSON 记录
-> 技术 QA
-> 人工试听
-> 游戏 manifest 绑定
```
本机曾完成 97 条中文、97 条日语、97 条英语短语气技术批次,共 291 个 24 kHz mono PCM16 WAV;这是当次验收记录,不是公开包内的音频数量。公开包不含这些 WAV。
## 短语气保护
- 单条最多尝试有限次数,不无限换 seed;
- 限制 `max_new_tokens`;
- 对异常超长音频停止批次;
- 用 RMS/峰值检测近静音;
- TTS 连接失败允许重试和服务重启;
- `loudnorm` 测得 `-inf` 时使用降级策略;
- 每种语言只读取对应文案列,不能把中文复用给日语/英语。
## GPT-SoVITS 与 RVC
GPT-SoVITS v2Pro 适合使用有权使用的参考音频做 zero/few-shot TTS。RVC 只负责音色转换,不能把公开角色/真人音色权重当成项目可自由分发的素材。
公开分享时只保留:代码入口、参数、模型官方链接、生成记录结构和验收方法。参考音频、训练数据、`.pth/.index` 一律不打包。
## 程序化音效
`05_语音与音效脚本/game_audio_examples/generate_sfx_pack.py` 用正弦音、扫频、包络和软噪声程序生成 12 个 UI/剧情音效,不读取外部采样:
```text
ui_click, ui_confirm, dialogue_advance, gallery_open,
theme_switch, game_start, save_confirm, load_confirm,
scene_enter, branch_choice, result_complete, result_defeat
```
脚本输出 48 kHz、mono、PCM16 WAV 与 `sfx_manifest.json`。这能说明声音文件的生成方式和格式,不等于每个声音的听感已经适合最终发行。
## 游戏接线
- WAV 放进清晰的角色/用途目录;
- manifest 使用真实相对路径;
- 正式配音优先时,不在同一行再叠情绪语音;
- 提供“日语配音/纯音效”之类的明确模式切换;
- 浏览器实际点击验证音频触发与自动播放限制;
- ZIP 用 CRC/`testzip()` 检查。
## 技术 QA 与人工 QA
技术检查:文件存在、可解码、采样率、声道、位深、时长、近静音、映射、重复、ZIP。
人工检查:咬字、年龄感、情绪、换气、金属音、尾音、音量体感、与 CG/台词同步。两种结果必须分别记录。
# 工作流全景
## 1. 先定义最小可玩的内容
剧本主体、角色出场顺序、分支方向和需要的功能由作者先定。不要从“我要收集七个人所有模型”开始,而是从一段能走完的故事开始:场景、出场角色、普通路线、可选支线、结算和回读。
当前 H5 版本的代表机制是:角色普通路线结束后,玩家可以继续挑战下一位,或进入当前角色的“玩家战败”支线。分支出现时保存独立检查点,支线结束后能一键回到选择前。
## 2. 把剧本拆成资产合同
每个节点至少记录:
- 节点 ID 与角色 ID;
- 场景事件句;
- 台词与语言版本;
- CG 文件名/生成状态;
- 语音 ID、情绪与目标文件名;
- 分支类型、目标节点和解锁项;
- 需要的 SFX/BGM;
- 验收状态与已知问题。
这样提示词、图片、声音和代码不会只靠文件名猜关系。
## 3. 模型/素材来源先入账
从 Civitai、Tensor.Art、PixAI、Hugging Face 或其他来源发现模型时,先记作者页、版本、触发词、底模、推荐权重、许可、访问日期和本地文件名。模型可以放本机归档,但公开分享包只提供链接和清单。
早期部分检索与 SD 提示词草稿按作者自述由 Grok 协助。最终使用的文件仍需人工核对来源、版本和可复现参数;“AI 搜到了”不算许可证据。
## 4. 提示词与 CG
编号 Markdown 存每张图变化的动作/神态/分镜;工作流存底模、LoRA、负面词、采样器、分辨率和输出规则。GUI 或 ComfyUI 节点把两者结合,先生成小样,再批量入队。
每张图保留:prompt、negative、checkpoint、LoRA/权重、sampler、scheduler、steps、CFG、seed、分辨率、denoise、控制输入和输出文件名。
## 5. 声音
台词先进入需求表/JSON,而不是直接粘进终端。Qwen3-TTS 和 GPT-SoVITS 是两套独立 TTS;RVC 是可选音色转换。批处理生成 WAV 与 JSON 记录,之后做格式、时长、近静音、响度和映射检查,再由人听。
程序化 UI/SFX 使用源码生成,不依赖外部采样;其他 CC0/第三方 SFX 必须保留单独许可证和作者来源。
## 6. 接入与 UX
在游戏副本中接线,不覆盖原始 ZIP。绑定 CG、voice、emotion voice、SFX、语言包、存档和回想室。桌面和手机分别验证:1440 px 与 390 px 是本轮已有证据的两个宽度,不代表所有设备都已覆盖。
## 7. 三类验收必须分开
- 技术验收:代码、JSON、格式、路径、哈希、浏览器错误、ZIP CRC。
- 视觉/听感验收:构图、身份一致性、手尾接触、音色、咬字、情绪、响度体感。
- 发布验收:来源、许可、AI 披露、同人声明、无权重/参考音频误分发。
任何一类通过都不能替代另外两类。
# 一个人怎么做游戏王龙女仆 Galgame:我的 ComfyUI、批量提示词、TTS 与 UX 工作流
这不是一套“点一下就自动做完游戏”的万能模板,而是我在制作《游戏王》龙女仆同人 Galgame 时,真正搭起来并反复修改的一条个人工作流。
我最开始卡在三件事上:角色模型去哪里找、几十张 CG 怎么批量管理、同一角色的画面和声音怎么尽量保持一致。最后我把流程拆成了几块:
```text
素材/模型来源记录
-> Grok 辅助整理资料与 SD 提示词草稿
-> Python GUI 批量读取编号 Markdown
-> ComfyUI/SDXL/Illustrious 生成与局部返修
-> 剧本、分支和 CG 清单绑定
-> Qwen3-TTS / GPT-SoVITS / RVC 语音实验
-> 程序化音效与网页端接线
-> 桌面/手机 UX 反复试玩调整
```
## 我分享了什么
- 我自己使用的 Windows 批量提示词 GUI 源码;
- 同一个工具的 ComfyUI 自定义节点版;
- 编号 Markdown、单人/多人提示词对齐示例;
- 6 个通用模板与 7 个角色代表 API 工作流;
- 70 条事件 CG 提示词与参数表;
- Qwen3-TTS 批量 GUI、服务适配和音频技术验收脚本;
- 12 个不依赖外部采样的程序化 UI/剧情音效生成脚本;
- 我整理过的模型文件名、触发词、SHA-256、作者页和许可状态;
- 剧本分支、自动分支存档、CG 回想、三语和响应式 UX 的迭代记录。
大模型、LoRA、第三方角色卡、参考音频和游戏 CG 没有放进下载包。原因很简单:我可以分享自己的流程和代码,但不能替模型作者、素材作者和原作权利方授予再分发权限。
## CG 管线:先解决“事件”,再堆画质词
我后来最明显的改动,是不再把 CG 写成“角色站在背景前”。每张图先写一句事件:谁做了什么、谁在反应、环境里有什么被碰到或改变。然后再确定镜头、手脚和道具接触、主光/补光/轮廓光,最后才补画质词。
事件 CG 的提示词顺序固定为:
```text
质量 -> 事件/动作 -> 镜头 -> 人物调度 -> 身份 -> 环境接触 -> 灯光 -> 渲染收尾
```
单人图通常只加载一个角色 LoRA。双人图不把两个强 LoRA 全局硬叠,而是用区域提示、蒙版或分角色重绘,最后低强度统一光影。角色角、尾巴、服装和手部接触仍然需要局部检查。
## 为什么做批量提示词 GUI
我有很多按编号写好的 Markdown:每条是一张 CG 的动作、表情或分镜。逐条复制到 ComfyUI 很快就会贴错角色、漏编号或覆盖掉共同镜头词,所以做了一个 Tkinter GUI:
- 读取编号 Markdown 或 TXT;
- 给整批统一加前缀/后缀;
- 查找、替换、删除;
- 单人或 2~6 人按编号对齐;
- 自动种子、重复次数和输出前缀;
- 可导出 API 任务,也可直接写入 ComfyUI 队列;
- 小蓝相关提示词保留 SFW 检查。
后来又把核心解析做成了 ComfyUI 节点,这样提示词可以直接保存在工作流里。
## 声音:Qwen 和 GPT-SoVITS 不是同一个底模
我一开始也把它们说混过。现在实际是两条独立路线:
- `Qwen3-TTS-12Hz-1.7B-CustomVoice`:官方 CustomVoice 模型,适合用预设音色和指令生成中/日/英底声;本机服务端口是 9881。
- `GPT-SoVITS v2Pro`:通过参考音频做 zero/few-shot TTS 的另一套系统;本机旧工作台端口是 9880。
- `RVC`:可选的音色转换后处理,不是文本到语音模型,也不应默认套在所有批次上。
我的批处理会保留语言、角色、情绪、种子、文件名和生成记录。技术验收会检查采样率、声道、位深、时长、近静音、映射和 ZIP,但最终听感仍要人工审核。
## 剧本与 UX
剧本主体、分支想法和功能需求由我提出和设计,再通过代码工具落地。现在比较有代表性的机制是:每次出现分支选项时,独立保存“选择之前”的检查点;看完战败支线后,可以一键回到刚才的抉择,不占用手动存档槽。
UX 不是一次画完的。我按自己的试玩体感改过多个版本,包括:
- 标题页、对话推进、内嵌分支选项和结算页;
- 6 个手动存档 + 1 个独立分支自动存档;
- CG 回想与主线/战败路线标识;
- 中文/英文/日语界面与剧情包;
- 配音/纯音效切换;
- 桌面 1440 px 和手机 390 px 的响应式调整。
## 下载包适合谁
适合已经装好 ComfyUI、愿意读 JSON 和 Python、正在做个人视觉小说/同人游戏的人。它不是新手一键整合包,也不附带模型权重。
建议先跑最小预览节点和 2 条提示词;确认解析、模型路径、LoRA 和保存位置后,再扩展批次。
## 使用与权利说明
这是非官方、非商业粉丝制作研究。《游戏王》、Dragonmaid 及相关角色权利归原权利方所有。项目与 KONAMI 无隶属或授权关系。
包内不会重新分发第三方模型、LoRA、角色卡、参考音频或权重。请回到原作者页面下载并逐项核对当前许可。生成式 AI 参与了封面、CG、部分提示词草稿和部分语音制作;请在 itch.io 页面启用对应 AI 披露/标签。
代码目前未单独指定开源许可证;可阅读和研究不等于自动获得商用、再许可或二次打包权。
如果你也在做个人 Galgame,希望这份东西至少能帮你少走几次“模型路径错了、两份 Markdown 编号串了、技术检查通过但听起来不对”的弯路。
# 我把龙女仆 Galgame 的制作过程整理成了一套可复查工作流
这次没有上传游戏本体,而是先把制作过程中最容易丢的部分整理出来:提示词是怎么编号的、工作流到底引用了哪个底模和 LoRA、批量任务怎样避免角色串位、TTS 如何保存生成记录、剧本分支和 UX 为什么会改成现在这样。
最大的教训是:个人项目最怕“结果还在,过程没了”。一张图看起来不错,但不知道 seed、LoRA 权重和工作流;一段语音能播放,但不知道是 Qwen、GPT-SoVITS 还是 RVC;某个分支能走通,但下次修改后没有检查点可回。
所以这个分享包把流程拆成了可检查的文件:
- 当前版批量提示词 GUI + 12 个测试;
- ComfyUI 批量节点 + 7 个测试;
- 13 个代表性工作流模板与参数表;
- Qwen3-TTS/GPT-SoVITS/RVC 的职责说明;
- 模型文件名、触发词、来源链接和 SHA-256;
- 自动分支存档、CG 回想与响应式 UX 的实现记录。
我没有附带大模型、LoRA、角色卡、参考音频和游戏 CG。分享工作方法,不等于有权重新打包别人的素材。
早期部分提示词和资料索引由 Grok 协助起草,之后经过人工改写和本机验证;CG 与部分声音属于生成式 AI 辅助内容。自动测试能证明文件格式和逻辑,不代表审美、听感和授权已经自动通过。
下一步我会继续把“从剧本节点到 CG/声音资产 ID”的绑定做得更清楚,让一次修改能追到具体的提示词、工作流、音频和界面状态。
