Command Palette
Search for a command to run...
Nemotron-Personas-India 인도 합성 인간 데이터셋
Nemotron-Personas-India는 NVIDIA에서 2025년에 공개한 인도 기반의 합성 인간 데이터셋입니다. 이 데이터셋은 인도의 실제 지리적 및 인구 통계학적 분포를 반영하여 합성 데이터의 다양성을 향상시키고, 모델 편향을 줄이며, 모델 붕괴를 방지하는 것을 목표로 합니다. 주로 인도의 모델 개발자들이 지역적 특성과 문화적 배경을 통합할 수 있는 독자적인 AI 시스템을 구축하는 데 도움을 주기 위해 사용됩니다. 이 데이터 세트는 각각 7개의 가상 캐릭터 역할을 가진 300만 개의 레코드로 구성되어 있으며, 총 약 2,100만 개의 캐릭터 설명과 약 77억 개의 토큰을 포함합니다. 이 중 29억 개의 토큰은 캐릭터 관련 정보입니다. 데이터는 인도의 36개 주 및 연방 직할령, 640개 행정 구역을 포괄하며, 약 56만 개의 고유 이름을 포함합니다. 영어, 데바나가리 문자, 라틴어의 세 가지 언어 버전으로 제공되며, 각 언어 버전별로 약 100만 개의 레코드가 있습니다. 이 데이터 세트는 2011년 인도 인구 조사 및 선거인 명부의 실제 인구 통계 및 지리적 분포 정보를 기반으로 합니다. 모든 캐릭터는 완전히 가상이며 실제 개인 식별 정보와는 무관합니다. 또한 18세 미만 미성년자의 데이터는 제외되었습니다.
데이터 필드:
데이터 세트는 27개의 유효 데이터 필드(UUID 제외)로 구성되어 있으며, 7개의 성격 속성 필드와 20개의 인구 통계학적 특징 필드로 나뉩니다.
- 인물 특성 항목: 직업 프로필, 언어 습관, 스포츠 관심사, 예술적 재능, 여행 선호도, 식습관 및 전반적인 성격을 포함합니다.
- 인구통계학적 특성 항목에는 문화적 배경, 기술 및 전문 지식, 관심사 및 취미, 직업 목표, 성별, 연령, 언어, 결혼 상태, 교육 수준, 직업 유형, 언어 사용, 거주 지역 및 국가(인도로 고정)가 포함됩니다.
소환
@software{nvidia/Nemotron-Personas-India,
author = {Praveen, Kiran and Vaidya, Utkarsh and Acharya, Evan and Ramaswamy, Lipika and Nathawani, Dhruv and Corneil, Dane and Meyer, Yev},
title = {{Nemotron-Personas-India: Synthetic Personas Aligned to Real-World Distributions for India},
month = {October},
year = {2025},
url = {https://huggingface.co/datasets/nvidia/Nemotron-Personas-India}