HyperAIHyperAI

Command Palette

Search for a command to run...

네모트론-페르소나스-한국 한국인 합성인간 데이터셋

날짜

7일 전

조직

NVIDIA(英伟达)

라이선스

CC BY 4.0

Nemotron-Personas-Korea는 한국인의 다양성과 특성을 종합적으로 반영하도록 설계된, NVIDIA가 2026년에 공개한 한국어 합성 캐릭터 데이터셋입니다. 이 데이터셋은 최초의 대규모 한국어 합성 캐릭터 데이터셋으로, 주로 Sovereign AI 합성 데이터의 다양성을 확장하고, 데이터 및 모델 편향을 완화하며, 모델 반응의 다양성을 향상시키는 데 사용됩니다. 이 데이터 세트는 각각 7개의 가상 캐릭터를 포함하는 100만 개의 레코드로 구성되어 있으며, 총 약 700만 개의 캐릭터 설명과 약 17억 개의 토큰을 포함하고 있습니다. 이 중 10억 개의 토큰은 캐릭터와 관련되어 있습니다. 데이터는 대한민국 17개 광역 자치구와 252개 시/군을 대상으로 하며, 총 209,167개의 고유한 이름이 포함되어 있습니다. 이 데이터 세트는 한국 통계청(KOSIS), 대법원, 국민건강보험공단, 한국농촌경제연구원, 네이버 클라우드에서 제공한 공식 정보를 기반으로 생성되었습니다. 모든 캐릭터는 완전히 가상이며 실제 개인 식별 정보와는 아무런 관련이 없습니다. 또한 19세 미만 미성년자의 데이터는 제외되었습니다. 데이터 필드: 데이터 세트는 25개의 유효 데이터 필드(UUID 제외)로 구성되어 있으며, 7개의 성격 속성 필드와 18개의 인구 통계학적 특징 필드로 나뉩니다.

  • 캐릭터 속성 항목: 직업 프로필, 스포츠 취미, 예술적 재능, 여행 선호도, 식습관, 가족 내 역할 및 전반적인 성격을 포함합니다.
  • 인구통계학적 특성 항목에는 문화적 배경, 기술 및 전문 지식, 관심사 및 취미, 성별, 연령, 언어, 혼인 상태, 가족 유형, 교육 수준, 직업 코드, 거주 상태, 병역 상태, 최종 학력, 주거 유형, 거주 지역 및 국가(한국으로 고정)가 포함됩니다.

소환

@software{nvidia/Nemotron-Personas-Korea,
author = {Kim, Hyunwoo and Ryu, Jihyeon and Lee, Jinho and Ryu, Hyungon and Praveen, Kiran and Prayaga, Shyamala and Thadaka, Kirit and Jennings, Will and Sadeghi, Bardiya and Sharabiani, Ashton and Choi, Yejin and Meyer, Yev},
title = {Nemotron-Personas-Korea: Synthetic Personas Aligned to Real-World Distributions for Korea},
month = {April},
year = {2026},
url = {https://huggingface.co/datasets/nvidia/Nemotron-Personas-Korea}
}

AI로 AI 구축

아이디어에서 출시까지 — 무료 AI 코코딩, 즉시 사용 가능한 환경, 최적의 GPU 가격으로 AI 개발을 가속화하세요.

AI 협업 코딩
바로 사용 가능한 GPU
최적의 가격

HyperAI Newsletters

최신 정보 구독하기
한국 시간 매주 월요일 오전 9시 에 이번 주의 최신 업데이트를 메일로 발송합니다
이메일 서비스 제공: MailChimp
네모트론-페르소나스-한국 한국인 합성인간 데이터셋 | 데이터 세트 | HyperAI초신경