Command Palette
Search for a command to run...
네모트론-페르소나-일본(일본어 합성 캐릭터 데이터셋)
Nemotron-Personas-Japan은 NVIDIA에서 2025년에 공개한 합성 인간 형상 데이터셋입니다. 일본 인구의 다양성과 풍요로움을 보여주는 것을 목표로 하며, 주로 자율적인 AI 시스템 개발, 대규모 언어 모델 학습, 합성 데이터의 편향 감소 등을 지원하는 데 사용됩니다. 이 데이터 세트는 각각 6개의 가상 캐릭터를 포함하는 100만 개의 레코드로 구성되어 있으며, 총 약 600만 개의 캐릭터 설명과 약 14억 개의 토큰을 포함하고 있습니다. 이 중 8억 5천만 개의 토큰은 캐릭터와 관련되어 있습니다. 데이터는 일본의 47개 현 전체, 1,500개 이상의 직업군, 그리고 95만 개 이상의 고유 이름을 포괄합니다. 이 데이터 세트는 일본의 공식 인구 통계 데이터, 지리적 분포 및 성격 특성 분포를 기반으로 생성되었습니다. 모든 캐릭터는 완전히 가상이며 실제 개인 식별 정보와는 아무런 관련이 없습니다. 또한 18세 미만 미성년자의 데이터는 제외되었습니다. 데이터 필드: 데이터 세트는 22개의 유효 데이터 필드(UUID 제외)로 구성되어 있으며, 6개의 성격 속성 필드와 16개의 인구 통계학적 특징 필드로 나뉩니다.
- 캐릭터 속성 항목: 직업 프로필, 스포츠 취미, 예술적 재능, 여행 선호도, 식습관 및 전반적인 성격을 포함합니다.
- 인구통계학적 특성 항목에는 기술 및 전문 지식, 관심사 및 취미, 직업 목표, 성별, 연령, 언어, 결혼 여부, 교육 수준, 직업 유형, 거주 지역 및 국가(일본으로 고정)가 포함됩니다.
소환
@software{nvidia/Nemotron-Personas-Japan,
author = {Fujita, Atsunori and Gong, Vincent and Ogushi, Masaya and Yamamoto, Kotaro and Suhara, Yoshi and Corneil, Dane and Meyer, Yev},
title = {{Nemotron-Personas-Japan}: Synthetic Personas Aligned to Real-World Distributions},
month = {September},
year = {2025},
url = {https://huggingface.co/datasets/nvidia/Nemotron-Personas-Japan}
}