HyperAIHyperAI

Command Palette

Search for a command to run...

4단계 이미지 출력/4K 화질/6배속 향상, PiD는 픽셀 확산을 사용하여 디코딩과 초해상도 출력을 통합합니다. SA-3DAO: 아티스트가 직접 제작한 3D 메시와 실제 이미지 1000쌍을 포함하는 데이터셋입니다.

Featured Image

PiD는 NVIDIA에서 출시한 새로운 잠재 공간 디코딩 패러다임입니다. 이는 기존의 VAE 디코딩 프로세스를 조건부 픽셀 확산 생성으로 재정의하여 디코딩과 초해상도 업샘플링을 단일 생성 모듈로 통합합니다. 기존의 잠재 확산 모델은 VAE를 통해 이미지에 잠재 변수를 복원하므로 출력 해상도가 제한적입니다. 또한, 재구성 중심의 디코더는 고주파 디테일을 복원하는 데 어려움을 겪고 잠재 변수의 아티팩트를 수정할 수 없습니다.PiD는 픽셀 공간 확산 백본 네트워크에 노이즈가 포함된 잠재 변수를 주입하기 위해 경량의 노이즈 인식 잠재 변수 어댑터(시그마 인식 어댑터)를 도입했습니다.이를 통해 모델은 완전히 잡음이 제거된 잠재 변수를 처리할 수 있을 뿐 아니라, 부분적으로 잡음이 제거된 잠재 변수에 대해서는 확산 과정을 조기에 종료할 수 있습니다. DMD2 증류 기술을 활용하면 단 네 단계의 잡음 제거만으로 추론을 완료할 수 있습니다.

HyperAI 웹사이트에 "PiD: 4K 초고해상도 이미지 생성 및 편집" 기능이 새로 추가되었으니 한번 사용해 보세요!

온라인 사용:https://go.hyper.ai/a34Cx

더 자세한 정보를 원하시면 저희 공식 웹사이트를 방문해 주세요.

https://hyper.ai

6월 19일부터 6월 26일까지 hyper.ai 공식 웹사이트의 주요 업데이트 사항을 간략하게 살펴보겠습니다.

* 고품질 공개 데이터 세트: 7개

* 엄선된 고품질 튜토리얼: 14개

* 커뮤니티 기사 해석 : 4개 기사

* 인기 백과사전 항목: 5개

공식 웹사이트를 방문하세요:하이퍼.AI

선택된 공개 데이터 세트

1. SAM 3D 아티스트 객체 3D 객체 재구성 데이터 세트

SAM 3D Artist Objects는 Meta에서 2026년 6월에 공개한 3D 메쉬 쌍 데이터셋입니다. 이 데이터셋은 실제 장면에서 객체의 형태와 배치를 재구성하는 알고리즘의 성능을 평가하는 데 사용되며, 이미지-3D 객체 변환 알고리즘의 성능 테스트, 모델 최적화 및 컴퓨터 비전 관련 연구에 널리 활용됩니다. SAM 3D Artist Objects 데이터셋은 전문 아티스트가 직접 제작한 3D 메쉬와 실제 이미지 1,000쌍으로 구성되어 있습니다.

온라인 사용:https://go.hyper.ai/rn2aF

2. RHELM 장기 기억 평가 데이터 세트

RHELM은 마이크로소프트가 2026년에 공개한 장기 기억 평가 데이터셋입니다. 복잡하고 동적인 시나리오에서 대규모 모델의 장기 기억, 다중 홉 추론, 시간 정보 합성 능력을 향상시키는 것을 목표로 합니다. 이 데이터셋은 대규모 언어 모델의 장기 시간 기억 평가, AI 비서의 장기 상호작용 능력 검증, 대규모 모델의 다중 홉 추론, 시간 정보 융합, 환각 탐지 등 다양한 연구 분야에서 널리 활용되고 있습니다.

온라인 사용:https://go.hyper.ai/OGkUl

3. MAKIEVAL 다국어 문화 지식 평가 데이터 세트

MAKIEVAL은 뮌헨대학교 MaiNLP 연구소와 뮌헨 기계학습센터가 공동으로 2026년에 공개한 다국어 문화 지식 평가 데이터셋입니다. 이 데이터셋은 대규모 언어 모델을 위한 다국어 문화 지식 평가의 대규모 벤치마크를 제공하는 것을 목표로 하며, 다국어 지식 표현 및 문화 지식 모델링 연구에 널리 활용되고 있습니다. MAKIEVAL 데이터셋에는 13개 언어, 19개 국가/지역, 6개 문화 영역에 걸쳐 7개의 대규모 언어 모델이 생성한 텍스트와, 해당 텍스트에서 자동으로 추출된 문화 엔티티, 그리고 위키데이터와의 정렬 결과가 포함되어 있습니다.

온라인 사용:https://go.hyper.ai/v7zip

4. Verbatim Spans 쿼리 조건 증거 추출 데이터 세트

Verbatim Spans는 2026년 4월 TU Wien과 KRLabs의 협력으로 출시된 다중 도메인 질의 조건부 증거 추출 데이터셋입니다. 이 데이터셋은 검색 증강(RAG) 및 추출형 질의응답 작업에 널리 적용 가능한 질의 조건부 증거 추출 모델 학습을 위한 일반적인 벤치마크를 구축하는 것을 목표로 합니다. Verbatim Spans는 174,383개의 학습 데이터 행과 20,174개의 검증 데이터 행으로 구성되어 있으며, 자연어 처리 논문, 다중 도메인 질의응답, 코드 및 도구 출력 등 세 가지 주요 유형의 코퍼스를 포함합니다.

온라인 사용:https://go.hyper.ai/hbpjR

5. Nemotron-SFT-Math-v4 수학적 추론 SFT 데이터셋

Nemotron-SFT-Math-v4는 NVIDIA에서 2026년 5월에 공개한 수학적 추론 데이터셋입니다. 이 데이터셋은 기존 수학 데이터셋의 문제점인 일관성 없는 품질, 비표준적인 추론 경로, 낮은 정확도, 제한된 시나리오 다양성을 해결하여 모델의 구조적 추론, 다중 경로 추론, 정답 검증 기능을 효과적으로 향상시키는 것을 목표로 합니다. 총 545,431개의 훈련 샘플로 구성되어 있으며, 여기에는 285,516개의 COT(콘텐츠 지향 추론) 샘플과 259,915개의 TIR(추적 추론) 도구 샘플이 포함되어 있습니다. 이 데이터셋은 대수학, 기하학, 정수론, 조합론 등 다양한 분야의 경진대회 및 연구 수준의 수학 시나리오를 다룹니다.

온라인 사용:https://go.hyper.ai/6ooPw

6. AI가 일자리와 해고 위험에 미치는 영향: AI 기반 고용 영향 데이터 세트

AI Impact on Jobs and Layoff Risk는 인공지능이 고용에 미치는 영향을 분석하는 구조화된 머신러닝 데이터셋입니다. 이 데이터셋은 현대 경제에서 AI 도입, 직무 자동화, 직무 특성, 인력 기술이 고용 결과에 미치는 영향을 탐구하는 것을 목표로 하며, 분류 모델링, 인력 분석, 자동화 영향 연구, 인사 관리 의사 결정 지원 등 다양한 분야에서 활용될 수 있습니다.

온라인 사용:https://go.hyper.ai/38bZl

7. 지구 기후 및 에너지 전환 2000-2026 지구 기후 및 에너지 데이터 세트

'2000-2026년 지구 기후 및 에너지 전환 데이터 세트'는 기후 변화, 에너지 전환 및 탄소 배출량 감축 연구를 위한 글로벌 기후 및 에너지 전환 데이터 세트로, 지구 기후 변화 및 에너지 전환 과정을 체계적으로 보여주는 것을 목표로 합니다. 이 데이터 세트는 2000년부터 2026년까지의 지구 및 지역별 기온 이상치를 포함하여 지구 기후 변화 및 에너지 전환 과정을 기록합니다.

온라인 사용:https://go.hyper.ai/ogrSa

선택된 공개 튜토리얼

1. PiD: 4K 초고해상도 이미지 생성 및 편집

PiD는 NVIDIA 팀에서 개발한 플러그 앤 플레이 방식의 초고해상도 디코더입니다. 기존 확산 모델은 VAE 디코더를 사용하여 잠재 표현을 이미지로 복원하며, 출력 해상도는 약 1024픽셀로 제한됩니다. PiD는 VAE 디코딩의 마지막 단계를 픽셀 공간 확산 처리로 대체하여, 후처리 없이 단 4단계의 노이즈 제거만으로 선명한 4K 이미지를 직접 생성할 수 있습니다. 기존 모델 아키텍처를 변경하지 않고도 기존 방식의 해상도 한계를 획기적으로 극복합니다.

온라인으로 실행:https://go.hyper.ai/a34Cx

데모 페이지

2. LTX-2.3-터보 비디오 생성기

LTX-2.3-turbo는 Lightricks에서 2026년 3월에 공개한 오픈 소스 비디오 생성 모델로, 오픈 소스 비디오 생성 기능의 한계를 뛰어넘도록 설계되었습니다. 이 모델은 고급 확산 변환기 아키텍처를 채택하고 이를 다중 모드 이해 기능과 결합하여 고품질의 다중 해상도 비디오 콘텐츠를 생성합니다.

온라인으로 실행:https://go.hyper.ai/oepch

데모 페이지

3. DiffBrush: 손글씨 텍스트 줄 생성

난카이대학교와 쿤룬공업대학은 2025년 8월 필기체 텍스트 라인 생성 모델인 DiffBrush를 공동 개발하여 발표했으며, 같은 해 10월 ICCV 2025에서 공식 채택되었습니다. Stable Diffusion VAE+UNet 아키텍처를 기반으로 하는 이 모델은 임의의 영어 텍스트 입력과 IAM 데이터셋의 496가지 필기체 스타일을 지원하며, 1024×64 크기의 회색조 이미지를 출력합니다. 텍스트 내용과 필기체 스타일은 독립적으로 제어 가능하며, 추론 배포가 간편하여 OCR 학습 데이터셋 생성, 필기체 데이터 증강, 문서 시뮬레이션 등에 바로 활용할 수 있습니다.

온라인으로 실행:https://go.hyper.ai/qVvl5

데모 페이지

4. 재사용: 일반적인 음성 향상 모델

RE-USE는 NVIDIA에서 2026년 3월에 출시한 범용 음성 향상 모델입니다. Mamba 아키텍처를 기반으로 하며, 다양한 샘플링 속도와 음질 저하 유형을 가진 잡음이 섞인 음성 신호를 처리할 수 있고, 언어에 구애받지 않습니다.

온라인으로 실행:https://go.hyper.ai/MJ0p5

데모 페이지

5. TADA-1b: 통합 음성-언어 모델

TADA-1b는 HumeAI 팀에서 2026년 2월에 출시한 통합 음성 및 언어 모델로, 음성 합성, 음성 복제, 다국어 더빙과 같은 오디오 생성 작업에 특화되어 있습니다. Llama 3.2-1B를 기반으로 하는 이 모델은 가볍고 빠르며 안정적인 오디오 생성 기능을 제공하여 영어 텍스트 음성 변환(TTS), 제로샷 음성 복제, 장문 내레이션, 음성 이어쓰기 등에 적합합니다.

온라인으로 실행:https://go.hyper.ai/nCSpT

데모 페이지

6. Gsplat 3D 가우시안 스플래시 학습 및 시각화

Gsplat은 버클리 대학교, NVIDIA, 상하이 공과대학교 등이 공동 개발한 오픈 소스 3DGS CUDA 가속 래스터화 라이브러리입니다. 기존 구현을 기반으로 심층 최적화를 거쳐 학습 메모리 사용량을 4배 줄이고 학습 시간을 151 TP3T 단축했습니다. 핵심 기술적 특징으로는 고효율 CUDA 차분 래스터화 엔진, 적응형 가우시안 밀도 제어 전략, COLMAP과 같은 주요 데이터 형식과 호환되는 유연한 데이터 백엔드, 그리고 Viser 기반의 실시간 웹 시각화 인터페이스 등이 있습니다. 응용 시나리오는 디지털 트윈, 자율 주행 환경 인식, 문화재 디지털화, 전자상거래 시각 합성 등을 포함합니다.

온라인으로 실행:https://go.hyper.ai/Zihdr

데모 페이지

7. DVD: 생성적 사전 정보를 기반으로 한 결정론적 비디오 깊이 추정

DVD(Deterministic Video Depth Estimation)는 2026년 3월 홍콩과학기술대학교(광저우) 연구팀이 제안한 최초의 결정론적 비디오 깊이 추정 프레임워크입니다. 사전 학습된 비디오 확산 모델(Wan2.1)을 단일 순방향 전파 깊이 회귀기로 변환함으로써, 생성 모델의 강력한 의미론적 사전 정보를 유지하면서 무작위성으로 인한 기하학적 착시 문제를 완전히 제거합니다.

온라인으로 실행:https://go.hyper.ai/AisLp

데모 페이지

8. 기초-1: 구조화된 텍스트를 음악 샘플로 변환

2026년 3월 RoyalCities 팀에서 출시한 Foundation-1은 전문 음악 제작 워크플로우를 위해 설계된 텍스트-샘플 오디오 생성 모델입니다. 공식 버전은 계층적이고 제어 가능한 생성 기능을 지원하여 사용자가 악기군, 하위 장르, 음색, 효과, 이론적 코드, 템포/조표, 마디 길이 등을 사용자 지정하여 리듬이 동기화되고 음색이 일치하는 음악 루프를 생성할 수 있도록 합니다. 또한, 이 소프트웨어는 완전한 대화형 생성 기능을 제공하는 통합 웹 데모를 제공합니다.

온라인으로 실행:https://go.hyper.ai/NxUAC

데모 페이지

9. Sketch-RNN: 벡터 스케치 생성 및 잠재 공간 보간

Sketch-RNN은 2017년 Google Brain 팀에서 발표한 벡터 스케치 시퀀스 생성 모델입니다. 이 모델은 획 간격 및 펜 상태 정보를 포함하는 손으로 그린 스케치 데이터에 특화되어 설계되었습니다. 스케치의 연속적인 잠재 표현을 학습하고 새로운 벡터 스케치 시퀀스를 생성할 수 있습니다. Sketch-RNN은 인코더-디코더 아키텍처를 사용합니다. 입력 스케치를 잠재 공간으로 매핑한 다음, 순환 신경망 디코더를 사용하여 획을 점진적으로 생성합니다.

온라인으로 실행:https://go.hyper.ai/HmcT9

Sketch-RNN 전체 구조도

10. Galaxy-Deconv: 약한 중력 렌즈 효과를 받는 은하 이미지에 대한 디컨볼루션 프레임워크

Galaxy-Deconv는 칭화대학교의 Tianyao Li와 노스웨스턴대학교의 Emma Alexander가 개발했습니다. 이 프로젝트는 약한 중력 렌즈 효과를 받는 은하 이미지 복원에 중점을 두고 있습니다. Galaxy-Deconv는 플러그 앤 플레이 방식의 ADMM 알고리즘을 사용하여 점 확산 함수(PSF) 흐림 및 노이즈의 영향을 받는 은하 이미지를 디컨볼루션합니다. 이 튜토리얼은 이미지 시뮬레이션, COSMOS 데이터 로딩, 디컨볼루션 추론, HDF5 데이터셋 검증 및 기본 디컨볼루션 연습을 포함하여 일반적인 은하 디컨볼루션 워크플로를 노트북 형태로 정리했습니다.

온라인으로 실행:https://go.hyper.ai/qGvI1

데모 페이지

11. NuExtract3: 멀티모달 문서 이해 및 구조화된 정보 추출 모델

NuExtract3는 NuMind에서 2026년 6월에 출시한 40억 개 매개변수를 사용하는 멀티모달 시각 언어 모델로, 특히 문서 이해를 위해 설계되었습니다. 이 모델은 구조화된 정보 추출 및 문서 이미지-마크다운 변환 기능을 통합하고, 텍스트, 이미지, 텍스트와 이미지가 혼합된 입력을 지원하며, 사용자가 제공한 JSON 템플릿을 기반으로 표, 수식, 레이아웃 정보를 완벽하게 보존하면서 구조화된 결과를 직접 출력할 수 있습니다.

온라인으로 실행:https://go.hyper.ai/xirTj

데모 페이지

12. DiffusionGemma: 이산 확산 기반의 고속 텍스트 생성 모델

DiffusionGemma는 Google DeepMind에서 이산 확산 기법을 사용하여 개발한 텍스트 생성 모델입니다. 총 260억 개의 파라미터를 가진 전문가 혼합(MoE) 아키텍처를 채택하고 있으며, 이 중 252억 개의 파라미터 중 38억 개만 유효합니다. 병렬 블록 수준 확산 샘플링을 통해 단일 H100 GPU에서 초당 1100개 이상의 토큰을 생성하는 초고속 텍스트 생성 속도를 구현합니다.

온라인으로 실행:https://go.hyper.ai/HV3eM

데모 페이지

13. TripoSplat: 단일 이미지에서 고품질 3D 가우시안 에셋을 생성합니다.

TripoSplat은 VAST-AI 연구소와 TripoAI가 2026년 5월에 공동 개발한 단일 이미지 기반 3D 가우시안 생성 기법입니다. 이 모델은 단일 2D 이미지를 고품질 3D 가우시안 모델로 변환할 수 있으며, 가우시안 분포의 개수를 제어할 수 있습니다. TripoSplat은 밀도 샘플링 가우시안(DeG) 기술을 활용하여 객체의 기하학적 복잡성에 따라 가우시안 중심을 적응적으로 분포시키고, VecSeq를 사용하여 무질서한 잠재 변수를 결정론적으로 재정렬함으로써 생성 학습의 안정성을 향상시킵니다.

온라인으로 실행:https://go.hyper.ai/wOxUG

데모 페이지

14. North Mini Code 1.0: 코드 생성 및 소프트웨어 엔지니어링 작업을 위한 에이전트 모델

North Mini Code 1.0은 Cohere와 Cohere Labs가 2026년 6월에 출시한 개방형 가중치 코드 모델로, 코드 생성, 엔드포인트 작업 및 에이전트 소프트웨어 엔지니어링 시나리오에 최적화되어 있습니다. 이 모델은 장시간 코딩 세션, 코드 추론, 도구 호출 및 교차 사고를 지원하며, 기능 구현, 스크립트 작성, 디버깅, 엔드포인트 작업 계획 및 다단계 소프트웨어 엔지니어링 워크플로에서 탁월한 성능을 발휘합니다.

온라인으로 실행:https://go.hyper.ai/ycCuG

데모 페이지

커뮤니티 기사 해석

1. MIT/IBM은 150만 개의 다양한 차트 샘플을 생성하는, 현재까지 가장 큰 규모의 합성 차트 데이터 세트인 ChartNet을 공개했습니다.

MIT, MIT-IBM 컴퓨팅 연구소, 그리고 IBM 연구소의 전문가 그룹은 그래프 이해 및 추론 능력을 향상시키기 위해 설계된 수백만 건의 레코드로 구성된 고품질 다중 모달 데이터 세트인 ChartNet을 제안했습니다.

전체 보고서 보기:https://go.hyper.ai/Kk87Q

2. 구글 딥마인드의 최신 논문은 인공지능의 궁극적인 목표를 밝힙니다. 일반 인공지능(AGI)에서 초인공지능(ASI)에 이르기까지 4가지 경로와 6가지 장애물이 있습니다.

구글 딥마인드는 여러 유수 대학과 협력하여 인공 일반 지능(AGI)에서 인공 초지능(ASI)으로의 진화를 둘러싼 심오한 질문들을 탐구하는 새로운 논문을 발표했습니다. 이 연구는 지능을 연속체로 보고, 인공지능이 인간의 평균 수준을 넘어 진화해 나가는 과정에서 직면할 수 있는 잠재적 경로와 병목 현상을 차분하게 분석합니다. 이 논문은 인공지능 개발의 장기적인 궤적을 이해하는 데 있어 체계적이고 객관적인 참고 자료를 제공합니다.

전체 보고서 보기:https://go.hyper.ai/AOObx

3. 구글의 AMIE 대화형 의료 시스템은 제미니 1.5의 광범위한 문맥 처리 기능을 활용하여 여러 환자 방문이 포함된 100가지 시나리오에서 일반의 수준의 추론 능력을 달성했습니다.

최근 구글 딥마인드와 구글 리서치의 연구에서 대화형 의료 시스템인 AMIE를 기반으로 하는 새로운 LLM 기반 지능형 에이전트 시스템이 개발되었습니다. 이 시스템은 임상 관리를 지원하고 다양한 후속 진료 시나리오에 맞춰 의사와 환자 간의 대화를 최적화합니다. AMIE는 제미니 모델의 장기적인 문맥 처리 능력을 활용하여 문맥 정보 검색과 구조적 추론을 결합함으로써 최신 임상 진료 지침 및 약물 처방 목록에 부합하는 결과를 도출합니다.

전체 보고서 보기:https://go.hyper.ai/65aHo

4. 재료 AI는 "설명 가능한 시대"로 나아가고 있습니다. 일본 연구팀이 고차원 분광학의 블랙박스를 해독하여 새로운 재료 발견을 위한 핵심 특징을 밝혀냈습니다.

일본 도쿄 과학 대학의 연구팀이 재료 과학 분야에서 고차원 스펙트럼 데이터를 처리할 수 있는 딥러닝 모델 해석 방법을 제안했습니다. 연구팀은 2681개의 산화물, 칼코게나이드 및 관련 화합물의 광 흡수 스펙트럼을 포함하는 제일원리 계산 데이터 세트를 구축했습니다. 스펙트럼 시작 에너지와 형태를 보정한 후, 표준 밀도 함수 계산과 비교했을 때, 계산 결과는 보고된 실험 스펙트럼과 훨씬 더 잘 일치하는 것으로 나타났습니다.

전체 보고서 보기:https://go.hyper.ai/VJbaU

인기 백과사전 기사

1. 대규모 언어 모델(LLM)

2. 구조

3. 세계행동모델(WAM)

4. 회전 위치 인코딩(RoPE)

5. 대규모 멀티태스크 언어 이해(MMLU)

다음은 "인공지능"을 이해하는 데 도움이 되는 수백 가지 AI 관련 용어입니다.

https://go.hyper.ai/wiki

위에 적힌 내용은 이번 주 편집자 추천 기사의 전체 내용입니다. hyper.ai 공식 웹사이트에 포함시키고 싶은 리소스가 있다면, 메시지를 남기거나 기사를 제출해 알려주세요!

다음주에 뵙겠습니다!

HyperAI 소개

HyperAI(hyper.ai)는 중국을 선도하는 인공지능 및 고성능 컴퓨팅 커뮤니티입니다.우리는 중국 데이터 과학 분야의 인프라가 되고 국내 개발자들에게 풍부하고 고품질의 공공 리소스를 제공하기 위해 최선을 다하고 있습니다. 지금까지 우리는 다음과 같습니다.

* 2100개 이상의 공개 데이터 세트에 대한 국내 가속 다운로드 노드를 제공합니다.

* 700개 이상의 고전 및 인기 온라인 강좌가 포함되어 있습니다.

* 300개 이상의 AI4Science 논문 사례 분석

* 700개 이상의 관련 용어 검색을 지원합니다.

* 중국에서 최초의 완전한 Apache TVM 중국어 문서 호스팅

학습 여정을 시작하려면 공식 웹사이트를 방문하세요.

https://hyper.ai