HyperAIHyperAI

Command Palette

Search for a command to run...

SVG Benchmark 静态图像生成基准数据集

日期

3 小时前

数据集组织

许可证

CC BY 4.0

SVG Benchmark 是由 Rapidata 于 2025 年发布的大模型静态图像生成评测数据集,旨在通过人工评估对比 30 个前沿大语言模型根据文本提示生成静态 SVG 的能力。 该数据采用两两对比的形式进行数据收集,包含 500 个来自人工撰写或公开数据集的英文提示词,188,754 组图像对比样本,以及基于人类投票的 1,355,161 条偏好反馈。评测模型范围覆盖 Claude 、 GPT 、 Gemini 、 DeepSeek 、 Qwen 、 Kimi 等 30 个主流大模型,评测维度分为匹配度(Alignment)、连贯性(Coherence)与主观偏好(Preference),三大维度均基于人工投票聚合,未使用自动化指标。

数据集构成:

该数据集共收到 1,355,161 条人类投票,其中:

  • 主观偏好:451,452 次
  • 匹配度:451,603 次
  • 连贯性:452,106 次

数据字段:

  • prompt: 字符串,生成图像的原始文本提示
  • image1 / image2: 图像,模型 1 和模型 2 生成的 SVG 光栅化 PNG 文件
  • model1 / model2: 字符串,对应图像的模型标识(model1 始终为字母序靠前的模型)
  • weighted_results_image*_preference / coherence / alignment: 浮点数,对应模型在三个维度的聚合得分(0 至 1)
  • detailed_results_*: 字符串,JSON 格式,包含该维度的逐条人工投票明细及投票者人口统计学信息
  • 注:部分样本可能仅参与单一或双维度评测,未参与评测的字段值为 null
    数据集示例
    数据集示例
    Citation
@dataset{yupp_svg_2025,
title={Yupp SVG Dataset: Exploration of the Reasoning and Coding Abilities of Frontier Models},
author={Yupp AI},
year={2025},
url={https://huggingface.co/datasets/yupp/yupp-svg-20251204}
}

用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供