——
——
- ——
- ——
- ——
冲突:——
点击「开始对战」揭晓
SECRET WORLD · 30s
同一句世界观命题,交给多个模型匿名创作。我们只改动 model + provider,冻结提示词、 任务、评审与预算;每个世界被压成 30 秒可读的速读卡,由真实用户盲投。 榜单以全量 Bradley-Terry 计算,并给出置信区间——排名只代表「这个命题下的偏好」,不代表全能冠军。
命题:「雨落在人身上,会让他想起一段别人遗忘的记忆。设计这个世界。」
——
冲突:——
点击「开始对战」揭晓
SECRET WORLD · 30s
——
冲突:——
点击「开始对战」揭晓
SECRET WORLD · 30s
这里只回答一个问题:在「世界观写作」这类命题下,用户更偏好谁。任务、环境、 提示词与评审全程冻结,只有 model + provider 变化;结论不外推到未测命题。
用户对同一命题的两份匿名世界做盲投,用正则 Bradley-Terry 估计,并输出基于预注册 bootstrap 的 95% 区间; 票据必须绑定当前 Bench、版本和 A/B assignment,旧作用域票不会混入本榜。静态 Work 的匿名属于展示层匿名, 不能防止用户检查客户端数据。
速读卡把世界压成「名字 + 一句钩子 + 三条设定 + 一个冲突」,时间限制只用于收集第一印象的偏好; 完成率与耗时会随当前作用域的有效票累积后报告。结构化深度由独立 grader 负责,二者分开报告。
当前展示的是历史真实评测数据:run bench-001,6 个场景 × 8 个模型,48 次调用、42 张合格速读卡。 原始输出和校验结果已保留;由于旧运行缺少正式 per-cell receipt、完整 catalog snapshot 和 latency, 它不会被冒充成正式 Bench release。投票只接收当前作用域记录。
同一条固定参考音频、同一台词、同一技术门禁,交给多个模型匿名克隆。角色与场景用于评审语境, 不作为候选的隐藏指令;这里不只听音色,还看台词准确、情绪转场、韵律动作和自然度;没有完成统一测试的模型,不进入排名。
下方已有 4 个角色、16 个原创场景、2 次重复和 64 个候选请求。两个模型在每个场景收到同一角色参考、同一台词,且都不附加声音设计指令;人工听评完成前只展示真实运行数据,不填虚构分数。
| 维度 | 当前值 | 分析口径 | 覆盖 |
|---|
从那不勒斯街头的梦想宣言,到布加拉提的队长抉择、米斯达的追杀压力与 Diavolo 的隐匿网络。角色与场景均来自创作者运营材料池当前发布资源;16 条测试台词为本轮原创。每个角色固定一条参考声,四类场景各重复两次,两个候选始终使用同一参考。
这次在统一参考克隆上扩展了场景和重复:每个角色的 Higgs 与 Qwen 收到同一条参考音频、同一台词,候选请求不含 voice_prompt,并保留 2 次重复以观察输出稳定性。参考声由 Qwen voice design 预处理,仍存在参考源偏置;本批有 1 次网络失败和 1 条长静音异常,当前只有 2 个模型、0 张有效听评票,不能宣布模型胜负。正式稳定结论还需要授权真人或独立第三方参考声、人工盲听和更多模型。
黄金之风样片之后,继续覆盖低声威胁、情绪抬升、长句叙事和未说出口的亲密感。
这是下一批待跑案例;当前可试听样片见上方黄金之风专区。
“音色还原”回答像不像同一个人;“内容一致”回答台词有没有读对;“情绪表达”回答角色此刻到底有没有活起来。