Command Palette
Search for a command to run...
HelpSteer3 인간 선호도 데이터세트
HelpSteer3는 NVIDIA가 2025년에 발표한 인간 선호도 데이터 세트입니다. 관련 논문 결과는 다음과 같습니다.HelpSteer3-Preference: 다양한 작업 및 언어에 대한 사람이 주석을 단 선호도 데이터 공개"는 인간의 피드백과 강화 학습 기술을 통해 사용자 프롬프트에 대한 모델의 응답성을 개선하는 것을 목표로 합니다. 이 데이터셋은 40,476개의 선호도 샘플을 포함하고 있으며, 각 샘플에는 도메인, 언어, 맥락, 두 개의 응답, 두 응답 간의 전체 선호도 점수, 그리고 최대 3명의 주석 작성자가 제공한 개인 선호도 점수가 포함됩니다. 다국어 데이터(중국어, 한국어, 프랑스어, 스페인어, 일본어, 독일어, 러시아어, 포르투갈어, 이탈리아어, 베트남어, 네덜란드어)도 포함되어 있습니다.
소환
@misc{wang2025helpsteer3preferenceopenhumanannotatedpreference,
title={HelpSteer3-Preference: Open Human-Annotated Preference Data across Diverse Tasks and Languages},
author={Zhilin Wang and Jiaqi Zeng and Olivier Delalleau and Hoo-Chang Shin and Felipe Soares and Alexander Bukharin and Ellie Evans and Yi Dong and Oleksii Kuchaiev},
year={2025},
eprint={2505.11475},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2505.11475},
}
@misc{wang2025helpsteer3humanannotatedfeedbackedit,
title={HelpSteer3: Human-Annotated Feedback and Edit Data to Empower Inference-Time Scaling in Open-Ended General-Domain Tasks},
author={Zhilin Wang and Jiaqi Zeng and Olivier Delalleau and Daniel Egert and Ellie Evans and Hoo-Chang Shin and Felipe Soares and Yi Dong and Oleksii Kuchaiev},
year={2025},
eprint={2503.04378},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2503.04378},
}
@misc{wang2025rlbffbinaryflexiblefeedback,
title={RLBFF: Binary Flexible Feedback to bridge between Human Feedback & Verifiable Rewards},
author={Zhilin Wang and Jiaqi Zeng and Olivier Delalleau and Ellie Evans and Daniel Egert and Hoo-Chang Shin and Felipe Soares and Yi Dong and Oleksii Kuchaiev},
year={2025},
eprint={2509.21319},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2509.21319},
}