HyperAIHyperAI

Command Palette

Search for a command to run...

실사/애니메이션/동물 기반 비디오 생성을 지원합니다. 메이투안의 오픈 소스 다중 스타일 오디오 기반 비디오 생성 프레임워크인 LongCat 1.5는 백만 개 수준의 차트 이해 데이터 세트인 ChartNet을 사용하여 VLM의 차트 재구성 및 표 추출 기능을 향상시킵니다.

Featured Image

2026년 5월 메이투안 롱캣 팀에서 출시한 LongCat-Video-Avatar 1.5는 오디오 기반 비디오 생성(AI2V) 프레임워크로, 완전히 새로운 오픈 소스 플랫폼입니다.사용자는 정적인 참조 이미지와 오디오 클립만 제공하면 정확한 립싱크가 적용된 역동적인 아바타 비디오를 생성할 수 있습니다.이 모델은 속삭임 기반 음성 특징 추출 기술을 활용하고, 단계적 증류 기술을 통해 DiT 생성 과정을 단 8단계로 압축하여 고화질 영상은 물론 장편 비디오 콘텐츠 생성까지 가능하게 합니다. 실사 인물, 2D/3D 애니메이션 캐릭터, 동물 아바타 등 다양한 대상을 포괄하는 뛰어난 일반화 능력을 바탕으로 다중 장면 비디오 생성에 효율적이고 안정적인 솔루션을 제공합니다.

HyperAI 웹사이트에서 "LongCat-Video-Avatar 1.5 디지털 휴먼 모델"을 만나보실 수 있습니다! 지금 바로 사용해 보세요!

온라인 사용:https://go.hyper.ai/NROTv

더 자세한 정보를 원하시면 저희 공식 웹사이트를 방문해 주세요.

https://hyper.ai

6월 6일부터 6월 12일까지 hyper.ai 공식 웹사이트의 주요 업데이트 사항을 간략하게 살펴보겠습니다.

* 고품질 공개 데이터 세트: 6개

* 고품질 튜토리얼 선택: 3개

* 커뮤니티 기사 해석 : 3개 기사

* 인기 백과사전 항목: 5개

공식 웹사이트를 방문하세요:하이퍼.AI

선택된 공개 데이터 세트

1. ChartNet 차트를 이용한 다중 모달 데이터셋 이해

ChartNet은 MIT가 IBM 연구소 및 기타 기관과 협력하여 2026년에 공개한 대규모 고품질 멀티모달 데이터셋입니다. 이 데이터셋은 기하학적 시각 패턴, 구조화된 수치 데이터, 텍스트 설명을 활용한 공동 추론에서 기존 모델의 한계를 극복하는 것을 목표로 합니다. ChartNet은 420만 개의 합성 차트 샘플, 94,643개의 수동 검증된 차트 샘플, 그리고 3만 개의 실제 차트를 포함하며, 24가지 차트 유형과 6가지 플로팅 라이브러리를 아우릅니다.

온라인 사용:https://go.hyper.ai/0CNr7    

2. OpenSAL360 파노라마 비디오 살리언시 데이터셋

OpenSAL360은 현재 가장 규모가 큰 종합 비디오 시각적 중요도 데이터셋으로, 시각적 주의 집중, 중요도 예측 및 멀티모달 비디오 분석 연구를 지원하기 위해 설계되었습니다. 이 데이터셋은 YouTube에서 가져온 평균 길이 18.1초의 다양한 파노라마 비디오 500개와 2,000명 이상의 관찰자가 완료한 데이터 주석으로 구성되어 있습니다.

온라인 사용:https://go.hyper.ai/u7NqD

3. 영화 감상 감정 데이터셋

Movie Feelings는 영화가 불러일으키는 미묘한 감정적 느낌을 체계적으로 특징화하기 위해 설계된 영화 감정 특징 데이터셋으로, 긍정/부정 감정 또는 기본 감정에만 기반한 기존 분류 방식의 한계를 뛰어넘습니다. 이 데이터셋은 1920년부터 2024년까지 제작된 대표적이고 문화적으로 영향력 있는 영화 1,500편을 포함하며, 50가지 감정 상태를 포괄합니다.

온라인 사용:https://go.hyper.ai/b4m71

4. FigureBench: 과학 일러스트레이션을 위한 벤치마크 데이터 세트 생성.

FigureBench는 웨스트레이크 대학교 텍스트 인텔리전스 연구소에서 2026년에 발표한 과학 논문 삽화 생성 벤치마크 데이터셋입니다. 긴 과학 논문에서 고품질의 과학 삽화를 자동으로 생성하는 문제를 해결하고, 자동 과학 삽화 생성 연구를 위한 도전적이고 다양한 테스트 플랫폼을 제공하는 것을 목표로 합니다. 

온라인 사용:https://go.hyper.ai/Agaku

5. AI가 학생에게 미치는 영향: AI 기반 학습은 데이터 세트에 영향을 미칩니다.

AI 학생 영향 데이터셋은 고등 교육 학습 시나리오에서 생성형 AI 도구의 실제 영향을 체계적으로 분석하기 위해 설계된 다차원적 교육 행동 데이터셋입니다. 이 데이터셋은 5만 개의 학생 샘플과 16개의 구조화된 특징 필드를 포함하며, 학생들의 학업 배경, AI 사용 행동, 학습 행동, 기관 배경, 정신 건강 상태 및 적용 시나리오와 같은 데이터를 다룹니다.

온라인 사용:https://go.hyper.ai/zWoGM

6. 노이즈가 포함된 의료 문서 이미지 데이터셋

노이즈가 추가된 의료 문서 데이터셋은 OCR 및 의료 문서 이해 작업을 위해 설계된, 노이즈가 강화된 의료 문서 이미지 모음입니다. 이 데이터셋은 실제 의료 환경에서 문서를 스캔할 때 발생하는 복잡한 노이즈 간섭을 시뮬레이션하여, OCR 및 문서 이해 모델의 견고성과 일반화 능력을 실제 환경에서 향상시키는 것을 목표로 합니다. 데이터셋에는 병원 청구서 500개와 퇴원 요약서 500개를 포함한 총 1,000개의 고품질 합성 의료 문서 이미지가 포함되어 있습니다.

온라인 사용:https://go.hyper.ai/kL7gc

선택된 공개 튜토리얼

1. LongCat-Video-Avatar 1.5 디지털 휴먼 모델

2026년 5월 메이투안 팀에서 출시한 LongCat-Video-Avatar 1.5는 새롭게 업그레이드된 오픈 소스 오디오 기반 비디오 생성(AI2V) 프레임워크입니다. 정적인 참조 이미지와 구동 오디오 클립만으로 매우 사실적이고 완벽한 립싱크가 적용된 역동적인 아바타 비디오를 생성할 수 있으며, 복잡한 실제 장면은 물론 애니메이션이나 동물과 같은 스타일화된 대상도 손쉽게 처리합니다.

온라인으로 실행:https://go.hyper.ai/NROTv

데모 페이지

2. dots.tts: 완전 연속 자기회귀 텍스트 음성 변환 시스템

2026년 6월 rednote-hilab에서 출시된 dots.tts는 2B 파라미터를 사용하는 완전 연속형 엔드투엔드 자기회귀 텍스트 음성 변환 시스템입니다. 핵심 구성 요소는 시맨틱 인코더, LLM(로컬 맵), 그리고 자기회귀 흐름 매칭 음향 헤드입니다. dots.tts는 이산적인 음성 토큰을 사용하지 않고 48kHz AudioVAE 기반의 연속적인 오디오 표현을 직접 모델링합니다.

온라인으로 실행:https://go.hyper.ai/YT3g3

데모 페이지

3. Gemma4 12B-it: 그래프, 텍스트 및 오디오를 통합한 멀티모달 모델.

Gemma 4 12B는 Google DeepMind에서 출시한 Gemma 4 시리즈의 통합 멀티모달 모델입니다. 인코더가 필요 없는 아키텍처를 채택하여 이미지와 오디오를 LLM의 임베딩 공간에 직접 투영합니다. 별도의 인코더 없이 텍스트, 이미지, 오디오 모달리티를 처리할 수 있으며, 12B 파라미터 수준에서 강력한 추론, 인코딩 및 멀티모달 이해 기능을 구현합니다.

온라인으로 실행:https://go.hyper.ai/0713z

데모 페이지

커뮤니티 기사 해석

1. 과학자들은 220종의 해양 박테리아를 기반으로 게놈 규모 모델을 사용하여 종속영양 미생물 분류 체계를 재구성하고 8가지 유형의 대사 미생물군을 식별했습니다.

남캘리포니아 대학교가 주도하는 연구팀은 전 세계 해양 미생물 데이터베이스와 게놈 규모의 대사 모델을 활용하여 방대한 양의 해양 박테리아 게놈을 분석했습니다. 11가지 유형의 유기 기질 이용에 대한 미생물의 민감도를 정량화함으로써, 연구팀은 8개의 서로 다른 대사 군집을 식별했습니다.

전체 보고서 보기:https://go.hyper.ai/dfq8T

2. 깊이 추정 정확도는 0.9에 도달했습니다. Meta는 VLM³을 제안하여 시각 모델이 본질적으로 3D를 학습할 수 있음을 보여주고 Qwen3-VL-4B를 기반으로 여러 작업에 대한 통합 모델링을 구현했습니다.

Meta는 프린스턴 대학교와 협력하여 표준 시각 언어 모델을 기반으로 객체 수준의 3D 이해, 깊이 추정, 픽셀 매칭, 카메라 자세 해결 등 네 가지 유형의 작업에 대해 통합된 데이터 구성 방식과 훈련 패러다임을 통해 통합 모델링을 구현하는 VLM³을 제안했습니다. 또한, 세밀한 3D 인식 영역에서 표준 VLM의 성능 한계를 체계적으로 평가했습니다.

전체 보고서 보기:https://go.hyper.ai/NihJA

3. 케임브리지 대학교와 다른 연구진들은 지구 관측 임무를 위한 픽셀 수준의 기본 모델을 제안하여 여러 임무에서 최첨단(SOTA) 정확도를 달성했습니다.

케임브리지 대학교, 알토 대학교, 브리스톨 대학교의 공동 연구팀은 발로우 쌍둥이 알고리즘을 기반으로 하는 새로운 시계열 특징 학습 패러다임을 개발했습니다. 이 패러다임을 통해 모델은 지구 표면의 안정적인 시공간적 변화를 자율적으로 학습하여 시간적 샘플링 불변성을 갖는 원격 감지 특징 표현을 생성할 수 있습니다. 이러한 기반 위에 연구팀은 센티넬-1/센티넬-2 다중 모드 시계열 데이터를 위한 픽셀 수준 원격 감지 기초 모델인 TESSERA를 제안했습니다.

전체 보고서 보기:https://go.hyper.ai/S3KBr

인기 백과사전 기사

1. 세계행동모델(WAM)

2. 설명 가능한 인공지능(XAI)

3. 시각 언어 행동 모델(VLA)

4. 규칙 기반 시스템

5. 상호 랭크 융합

다음은 "인공지능"을 이해하는 데 도움이 되는 수백 가지 AI 관련 용어입니다.

https://go.hyper.ai/wiki

위에 적힌 내용은 이번 주 편집자 추천 기사의 전체 내용입니다. hyper.ai 공식 웹사이트에 포함시키고 싶은 리소스가 있다면, 메시지를 남기거나 기사를 제출해 알려주세요!

다음주에 뵙겠습니다!

HyperAI 소개

HyperAI(hyper.ai)는 중국을 선도하는 인공지능 및 고성능 컴퓨팅 커뮤니티입니다.우리는 중국 데이터 과학 분야의 인프라가 되고 국내 개발자들에게 풍부하고 고품질의 공공 리소스를 제공하기 위해 최선을 다하고 있습니다. 지금까지 우리는 다음과 같습니다.

* 2100개 이상의 공개 데이터 세트에 대한 국내 가속 다운로드 노드를 제공합니다.

* 700개 이상의 고전 및 인기 온라인 강좌가 포함되어 있습니다.

* 300개 이상의 AI4Science 논문 사례 분석

* 700개 이상의 관련 용어 검색을 지원합니다.

* 중국에서 최초의 완전한 Apache TVM 중국어 문서 호스팅

학습 여정을 시작하려면 공식 웹사이트를 방문하세요.

https://hyper.ai