Command Palette
Search for a command to run...
Verbatim Spans 쿼리 조건 증거 추출 데이터 세트
Verbatim Spans는 TU Wien이 KRLabs와 협력하여 2026년 4월에 공개한 다중 도메인 질의 조건부 증거 추출 데이터셋입니다. 관련 연구 논문은 다음과 같습니다. ACL-Verbatim: 환각 없는 연구용 질문 답변본 연구의 목표는 검색 증강 생성(RAG) 및 추출형 질의응답 작업에 널리 활용될 수 있는 질의 조건 증거 추출 모델 학습을 위한 일반적인 벤치마크를 구축하는 것입니다. 이 데이터 세트는 174,383개의 훈련 데이터 행과 20,174개의 검증 데이터 행으로 구성되어 있으며, 자연어 처리 논문, 다중 도메인 질의응답, 코드 및 도구 출력 등 세 가지 주요 유형의 코퍼스를 포함합니다. 이는 각각 문단 수준, 문장 수준 및 코드 블록 수준의 증거 주석 작업에 해당합니다.
데이터 소스
- ACL Silver: 문단 수준 주석 표준을 사용하는 자연어 처리 연구 논문을 다룹니다. 정제 및 필터링 후 20,916개의 훈련 데이터 포인트와 2,319개의 검증 데이터 포인트가 포함되어 있으며, 이는 원본 코퍼스의 일부만을 나타냅니다.
- RAGBench는 금융, 의료, 법률 및 일반 질문 답변 영역을 포괄하는 데이터셋으로, 문장 수준의 주석 표준과 표본 크기 제한이 있는 균형 샘플링 방식을 사용합니다. 최종 데이터셋은 101,550개의 훈련 데이터 포인트와 15,276개의 검증 데이터 포인트로 구성됩니다.
- Squeez: 코드 블록/라인 범위 주석 사양을 사용하여 코드와 SWE-bench 도구 출력 모두를 분석하고, 51,917줄의 학습 데이터와 2,579줄의 검증 데이터를 사용하여 구조화된 데이터를 추출합니다.
소환
@misc{Recski:2026,
title={ACL-Verbatim: hallucination-free question answering for research},
author={Gábor Recski and Szilveszter Tóth and Nadia Verdha and István Boros and Ádám Kovács},
year={2026},
eprint={2605.21102},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2605.21102},
}