Command Palette
Search for a command to run...
Updesh インド語合成テキストデータセット
Updesh は、インド言語の大規模言語モデル (LLM) の事後トレーニングを容易にするために、2025 年に Microsoft によってリリースされたインド言語の合成テキスト データセットです。 データセットには、アッサム語、ベンガル語、グジャラート語、ヒンディー語、カンナダ語、マラヤーラム語、マラーティー語、ネパール語、オディア語、パンジャブ語、タミル語、テルグ語、ウルドゥー語の 6,800,000 件の推論データと 2,100,000 件の生成データが含まれています。
引用
@misc{chitale2026updeshsynthesizinggroundedinstruction、 title={UPDESH: 13 インド語のための接地された命令チューニングデータの合成}, author={プランジャール・A・チタレー、ヴァルン・グンマ、サンチット・アフージャ、プラシャント・コダリ、マナン・ウパディヤイ、ディープティ・スダルサン、スナヤナ・シタラム}、 年={2026}、 eprint={2509.21294}、 archivePrefix={arXiv}、 primaryClass={cs.CL}、 url={https://arxiv.org/abs/2509.21294}、 }