HyperAIHyperAI

Command Palette

Search for a command to run...

Verbatim Spans 쿼리 조건 증거 추출 데이터 세트

날짜

한 달 전

조직

Paper URL

2605.21102

라이선스

Apache 2.0

Verbatim Spans는 TU Wien이 KRLabs와 협력하여 2026년 4월에 공개한 다중 도메인 질의 조건부 증거 추출 데이터셋입니다. 관련 연구 논문은 다음과 같습니다. ACL-Verbatim: 환각 없는 연구용 질문 답변본 연구의 목표는 검색 증강 생성(RAG) 및 추출형 질의응답 작업에 널리 활용될 수 있는 질의 조건 증거 추출 모델 학습을 위한 일반적인 벤치마크를 구축하는 것입니다. 이 데이터 세트는 174,383개의 훈련 데이터 행과 20,174개의 검증 데이터 행으로 구성되어 있으며, 자연어 처리 논문, 다중 도메인 질의응답, 코드 및 도구 출력 등 세 가지 주요 유형의 코퍼스를 포함합니다. 이는 각각 문단 수준, 문장 수준 및 코드 블록 수준의 증거 주석 작업에 해당합니다.

데이터 소스

  • ACL Silver: 문단 수준 주석 표준을 사용하는 자연어 처리 연구 논문을 다룹니다. 정제 및 필터링 후 20,916개의 훈련 데이터 포인트와 2,319개의 검증 데이터 포인트가 포함되어 있으며, 이는 원본 코퍼스의 일부만을 나타냅니다.
  • RAGBench는 금융, 의료, 법률 및 일반 질문 답변 영역을 포괄하는 데이터셋으로, 문장 수준의 주석 표준과 표본 크기 제한이 있는 균형 샘플링 방식을 사용합니다. 최종 데이터셋은 101,550개의 훈련 데이터 포인트와 15,276개의 검증 데이터 포인트로 구성됩니다.
  • Squeez: 코드 블록/라인 범위 주석 사양을 사용하여 코드와 SWE-bench 도구 출력 모두를 분석하고, 51,917줄의 학습 데이터와 2,579줄의 검증 데이터를 사용하여 구조화된 데이터를 추출합니다.

소환

@misc{Recski:2026,
title={ACL-Verbatim: hallucination-free question answering for research},
author={Gábor Recski and Szilveszter Tóth and Nadia Verdha and István Boros and Ádám Kovács},
year={2026},
eprint={2605.21102},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2605.21102},
}

AI로 AI 구축

아이디어에서 출시까지 — 무료 AI 코코딩, 즉시 사용 가능한 환경, 최적의 GPU 가격으로 AI 개발을 가속화하세요.

AI 협업 코딩
바로 사용 가능한 GPU
최적의 가격

HyperAI Newsletters

최신 정보 구독하기
한국 시간 매주 월요일 오전 9시 에 이번 주의 최신 업데이트를 메일로 발송합니다
이메일 서비스 제공: MailChimp
Verbatim Spans 쿼리 조건 증거 추출 데이터 세트 | 데이터 세트 | HyperAI초신경