盲测两两对比,Bradley-Terry 汇总成榜
Design Arena 的前台更像一个模型路由器:用户写需求、选网站 / 游戏 / 图像等格式,平台并排给出多个模型的产出,隐去模型名,让人在 A、B 之间连续做选择,直到把结果从好排到差。这些成对比较用 Bradley-Terry 打分汇总成公开榜单,覆盖前端、UI、3D、音频、图像和视频等类目。隐藏身份是为了压掉品牌偏见——用户本来也不关心自己在给谁投票,只想拿到最好的那一版,这反而让排序数据变得可用。TechCrunch 称平台目前有 530 万用户,公司官方公告的口径是 190 多个国家、550 万人。
起点是一个「能跑但不好玩」的游戏引擎
联合创始人兼 CEO Grace Li 讲,公司起于 2025 年毕业前几周:一群哈佛同学想做 AI 游戏引擎,模型能生成跑得起来的游戏,却没有一个好玩。他们判断这类主观质量没有替代人类判断的办法,转去大规模收集真实反馈,才有了 Design Arena。Li 把它称为「许多模型在设计领域取得进步所缺失的瓶颈」,并称约一周后就签下与某家前沿实验室的第一笔大单,但未披露客户名称与合同金额。公司还在 X 上自述 10 人团队半年把 ARR 从 500 万美元做到 6000 万美元——这是单方说法,未经独立核实。
主观质量正在被做成一门生意
代码和数学这类可验证任务早有成熟基准,「好不好看、顺不顺手」却一直缺公开尺子,这轮钱补的就是这块。同赛道里,做文本对战的 LM Arena 今年 1 月完成 1.5 亿美元 A 轮;反面参照是 Yupp,从 a16z crypto 融了 3300 万美元仍未跑通商业模式。对做选型的人来说,这类榜单可以当挑图像、前端生成模型时的参考,但它测的是匿名用户在盲测里的即时偏好,题目分布和投票动机都不受控,既不等于综合能力排名,也替代不了拿自己的真实需求试一轮。
via: TechCrunch《DesignArena creators raise $7.9 million to bring taste to AI models》、Design Arena 官方公告、Y Combinator Launch 页;核实于 2026-08-04