Neta Arena BY NETA BENCH
开始对战

世界观写作 竞技场

加载中…

同一句世界观命题,交给多个模型匿名创作。我们只改动 model + provider,冻结提示词、 任务、评审与预算;每个世界被压成 30 秒可读的速读卡,由真实用户盲投。 榜单以全量 Bradley-Terry 计算,并给出置信区间——排名只代表「这个命题下的偏好」,不代表全能冠军。

Overall 产出合格率

schema 门禁通过率(历史真实评测)

今日对战 历史命题 · 模型产出

命题:「雨落在人身上,会让他想起一段别人遗忘的记忆。设计这个世界。」

30
待开始
世界 A

——

——

  • ——
  • ——
  • ——

冲突:——

A

点击「开始对战」揭晓

SECRET WORLD · 30s

世界 B

——

——

  • ——
  • ——
  • ——

冲突:——

B

点击「开始对战」揭晓

SECRET WORLD · 30s

正在连接收集通道…

怎么读这个榜

为什么不是「最强的模型」榜单?

这里只回答一个问题:在「世界观写作」这类命题下,用户更偏好谁。任务、环境、 提示词与评审全程冻结,只有 model + provider 变化;结论不外推到未测命题。

偏好分数是怎么算的?

用户对同一命题的两份匿名世界做盲投,用正则 Bradley-Terry 估计,并输出基于预注册 bootstrap 的 95% 区间; 票据必须绑定当前 Bench、版本和 A/B assignment,旧作用域票不会混入本榜。静态 Work 的匿名属于展示层匿名, 不能防止用户检查客户端数据。

30 秒投得准吗?

速读卡把世界压成「名字 + 一句钩子 + 三条设定 + 一个冲突」,时间限制只用于收集第一印象的偏好; 完成率与耗时会随当前作用域的有效票累积后报告。结构化深度由独立 grader 负责,二者分开报告。

现在这些数字是真的吗?

当前展示的是历史真实评测数据:run bench-001,6 个场景 × 8 个模型,48 次调用、42 张合格速读卡。 原始输出和校验结果已保留;由于旧运行缺少正式 per-cell receipt、完整 catalog snapshot 和 latency, 它不会被冒充成正式 Bench release。投票只接收当前作用域记录。

NEW TRACK · CHARACTER VOICE ACTING

角色配音 竞技场

同一条固定参考音频、同一台词、同一技术门禁,交给多个模型匿名克隆。角色与场景用于评审语境, 不作为候选的隐藏指令;这里不只听音色,还看台词准确、情绪转场、韵律动作和自然度;没有完成统一测试的模型,不进入排名。

CoHub 已接入
候选模型
首发角色包
有效榜单票

角色配音榜 跨场景扩展 · 数据收集中

CONTROLLED CLONE · COLLECTING

场景扩展已接入,排名席位仍保留

下方已有 4 个角色、16 个原创场景、2 次重复和 64 个候选请求。两个模型在每个场景收到同一角色参考、同一台词,且都不附加声音设计指令;人工听评完成前只展示真实运行数据,不填虚构分数。

同一参考同一台词无 voice prompt原始保留≥30 票
运行观察 · 1 失败 · 1 警告Giorno 压力场景有 1 次 Qwen 请求失败;Giorno 长句场景有 1 次 Higgs 输出约 36.24s 连续静音。两者均保留原始证据,不重试、不修复、不纳入质量评分。

数据分析

数据收集中 · 暂无分数
维度当前值分析口径覆盖

首发评分轴

不合成单一“感情度”
SCENE EXPANSION · GOLDEN WIND

黄金之风跨场景配音扩展

从那不勒斯街头的梦想宣言,到布加拉提的队长抉择、米斯达的追杀压力与 Diavolo 的隐匿网络。角色与场景均来自创作者运营材料池当前发布资源;16 条测试台词为本轮原创。每个角色固定一条参考声,四类场景各重复两次,两个候选始终使用同一参考。

LISTENING ROOM

4 个角色 · 16 个场景 · 64 次候选

先试听固定参考,再按角色展开平静计划、压力行动、情绪转折和长句独白。每个场景保留两次重复和两个单参考克隆;可以查看模型与运行数据,也可以切换到盲听模式,当前不计算排名。

为何没有排名

这次在统一参考克隆上扩展了场景和重复:每个角色的 Higgs 与 Qwen 收到同一条参考音频、同一台词,候选请求不含 voice_prompt,并保留 2 次重复以观察输出稳定性。参考声由 Qwen voice design 预处理,仍存在参考源偏置;本批有 1 次网络失败和 1 条长静音异常,当前只有 2 个模型、0 张有效听评票,不能宣布模型胜负。正式稳定结论还需要授权真人或独立第三方参考声、人工盲听和更多模型。

CASE PACK 02 · NEXT

下一批通用角色包

黄金之风样片之后,继续覆盖低声威胁、情绪抬升、长句叙事和未说出口的亲密感。

选择一个角色 查看它真正考什么

这是下一批待跑案例;当前可试听样片见上方黄金之风专区。

通用角色包待跑黄金之风 showcase 已开放;本批等待更多模型接入
待接入
MEASUREMENT

怎么读角色配音榜

“音色还原”回答像不像同一个人;“内容一致”回答台词有没有读对;“情绪表达”回答角色此刻到底有没有活起来。

音色还原speaker similarity / SMOS
台词准确CER / WER / 关键 token
情绪与韵律适切性、强度、转场、停顿和重音
自然度MOS / CMOS + 缺陷标注