Command Palette
Search for a command to run...
Updesh 인도어 합성 텍스트 데이터 세트
Updesh는 Microsoft가 2025년에 공개한 인도어 합성 텍스트 데이터 세트로, 인도어에 대한 대규모 언어 모델(LLM)의 사후 학습을 용이하게 하기 위해 만들어졌습니다. 이 데이터 세트에는 아삼어, 벵골어, 구자라트어, 힌디어, 칸나다어, 말라얄람어, 마라티어, 네팔어, 오디아어, 펀자브어, 타밀어, 텔루구어, 우르두어 언어로 된 6,800,000개의 추론 데이터와 2,100,000개의 생성된 데이터가 포함되어 있습니다.
소환
@misc{chitale2026updeshsynthesizinggroundedinstruction, 제목={UPDESH: 13개 Indic에 대한 접지된 명령어 튜닝 데이터 합성}, 저자={Pranjal A. Chitale 및 Varun Gumma 및 Sanchit Ahuja 및 Prashant Kodali 및 Manan Uppadhyay 및 Deepthi Sudharsan 및 Sunayana Sitaram}, 연도={2026}, eprint={2509.21294}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2509.21294}, }