HyperAIHyperAI

Command Palette

Search for a command to run...

15억 개의 파라미터를 가진 MiniCPM-RobotManip이 공식적으로 오픈 소스로 공개되었으며, NVIDIA는 텍스트, 이미지, 비디오 및 모션 시퀀스를 모두 지원하는 풀 모달 모델인 Cosmos3-Edge를 출시했습니다.

Featured Image

로봇이 인지하고, 이해하고, 행동할 수 있도록 하는 것은 지능형 에이전트를 현실 세계로 이끌어가는 데 핵심적인 요소입니다. MiniCPM의 MiniCPM-Robot 시리즈는 로봇 조작과 목표 추적이라는 두 가지 핵심 과제를 탐구합니다.**MiniCPM-RobotManip은 15억 개의 파라미터만으로 구현되는 시각-언어 기반 액션 모델입니다. MiniCPM-V 4.6 시각-언어 백본을 기반으로 확산형 액션 헤드를 결합하여 시각적 관찰과 언어 명령을 로봇 동작에 엔드투엔드로 매핑합니다.**MiniCPM-RobotTrack은 객체 목표 추적에 초점을 맞춰 0.9B 파라미터를 사용하여 실시간 에지 시각 추적 기능을 구현합니다. 경량 아키텍처, 스트리밍 컨텍스트 메모리 및 효율적인 시각 압축 기술을 통해 MiniCPM-Robot 시리즈는 소규모 모델을 사용하여 실제 로봇 시나리오에서 효율적인 추론이 가능하다는 것을 보여줍니다.

HyperAI 웹사이트에 "MiniCPM-Robot: 현실 세계를 위한 구현된 지능 모델"이 새롭게 추가되었습니다. 지금 바로 체험해 보세요!

온라인 사용:https://go.hyper.ai/0VsYI

7월 25일부터 7월 30일까지 hyper.ai 공식 웹사이트의 주요 업데이트 사항을 간략하게 살펴보겠습니다.

* 고품질 공개 데이터 세트: 9개

* 고품질 튜토리얼 선택: 8개

* 커뮤니티 게시글 분석: 2개 게시글

* 인기 백과사전 항목: 5개

공식 웹사이트를 방문하세요:하이퍼.AI

선택된 공개 데이터 세트

1.수학 그래프 수학 정리 종속성 그래프 데이터 세트

Math-Graph는 워싱턴 대학교 수학인공지능연구소에서 2026년에 발표한 수학 정리 의존성 그래프 데이터셋입니다. 이 데이터셋은 명제 수준에서 수학 정리 의존성 그래프를 구성합니다. 관련 논문은 "TheoremGraph: Bridging Formal and Informal Mathematics"입니다.

이 데이터셋은 비형식적 수학적 명제와 형식적 수학적 명제 쌍 47,952개를 포함하며, 두 가지 유형의 수학적 지식을 비형식 및 형식 수학 모두를 아우르는 일관된 의존성 그래프로 통합합니다. 데이터셋에는 논문 메타데이터, 수학적 명제(형식/비형식), 의존성 연결선, 그리고 LLM으로 생성된 자연어 설명이 포함됩니다.

온라인으로 실행:https://go.hyper.ai/bwVQf

2.Nemotron-SFT-Math-v4 수학적 추론 SFT 데이터셋

Nemotron-SFT-Math-v4는 NVIDIA에서 2026년 5월에 공개한 수학적 추론 데이터셋입니다. 관련 논문은 "Nemotron-Math: 다중 모드 지도 학습을 통한 효율적인 장기 컨텍스트 증류(Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision)"입니다. 이 데이터셋은 기존 수학 추론 데이터셋의 문제점인 일관성 없는 품질, 비표준적인 추론 궤적, 낮은 정확도, 제한된 시나리오 등을 해결하는 것을 목표로 합니다. Nemotron-SFT-Math-v4는 모델의 구조적 추론, 다중 궤적 추론, 정답 검증 기능을 효과적으로 향상시킵니다. 대규모 수학적 추론 모델의 미세 조정, 추론 궤적 분석, 정답 검증 알고리즘 개발, 장기 컨텍스트 추론 시스템 구축, 모델 추론 견고성 평가 등에 널리 활용되고 있습니다.

이 데이터셋은 545,431개의 훈련 샘플로 구성되어 있으며, 그중 285,516개는 COT 추론 샘플이고 259,915개는 TIR 도구 추론 샘플입니다. 이 데이터셋은 대수학, 기하학, 정수론, 조합론 등 다양한 분야의 경시대회 및 대학 연구 시나리오를 포괄합니다. 데이터는 수동 및 자동화 방식을 혼합하여 주석 처리되었으며, 고유 번호, 문제 텍스트, 다단계 대화, 표준 답변, 출처, 프로토콜 등의 표준화된 필드를 포함합니다.

온라인으로 실행:https://go.hyper.ai/Kv9E4

3.MathNet 멀티모달 수학 벤치마크 추론 데이터셋

MathNet은 MIT 연구팀이 킹 압둘라 과학기술대학교 및 기타 기관과 협력하여 2026년에 공개한 대규모, 다국어, 다중 모드 수학적 추론 데이터셋입니다. 관련 논문의 제목은 "MathNet: 수학적 추론 및 검색을 위한 글로벌 다중 모드 벤치마크"입니다.이 도구는 올림픽 수준의 수학적 추론 및 구조화된 검색 작업에서 대규모 모델의 기능을 평가하고 개선하는 것을 목표로 하며, 수학적 추론 평가, RAG 연구 및 멀티모달 AI 훈련에 널리 사용됩니다.

이 데이터셋(버전 v0)은 27,817개의 전문가 수준 수학 문제와 표준 해답을 포함합니다. 58개 국가 및 지역의 공식 수학 경시대회 문제를 17개 언어로 제공하며, 그중 5,148개 문제는 총 7,541개의 기하학적 및 그래픽 삽화를 포함하고 있습니다. 데이터셋은 대수학, 기하학, 정수론, 조합론, 미적분학, 확률 및 통계, 그리고 기타 올림피아드 수학 지식 영역을 포괄합니다. 이 데이터셋은 수학 문제 풀이, 수학적 의미 검색(구조적으로 동일하거나 유사한 문제 식별), 그리고 검색 성능 향상이라는 세 가지 벤치마크 작업을 지원합니다.

온라인으로 실행:https://go.hyper.ai/AWKaV

데이터 세트 예제
데이터 세트 예제
4Nemotron-Math-v2 수학적 추론 데이터셋

Nemotron-Math-v2는 NVIDIA Corporation에서 2025년에 공개한 수학적 추론 데이터셋입니다. 관련 연구는 "Nemotron-Math: 다중 모드 지도 학습을 통한 효율적인 장기 컨텍스트 수학적 추론 추출"이라는 제목으로 발표되었습니다. 이 데이터셋은 주로 LLM(Long-Context Model)을 훈련시켜 구조화된 수학적 추론을 수행하도록 하거나, 도구 활용 추론과 순수 언어 추론의 차이점을 연구하고, 장기 컨텍스트 또는 다중 경로 추론 시스템을 구축하는 데 사용됩니다.

이 데이터 세트는 약 347,000개의 고품질 수학 문제와 700만 개의 모델 생성 추론 궤적을 포함합니다. 각 문제는 추론 깊이의 높음/중간/낮음, 그리고 Python TIR 사용 여부에 따라 6가지 구성으로 해결되며, 결과는 LLM을 검증 도구로 사용하는 파이프라인을 통해 검증됩니다.

온라인으로 실행:https://go.hyper.ai/rYdfW

5. CHIMERA 일반 추론 합성 데이터셋

CHIMERA는 추론 학습을 위해 특별히 설계된 합성 추론 데이터셋입니다. 관련 논문은 "CHIMERA: 일반화 가능한 LLM 추론을 위한 컴팩트한 합성 데이터"입니다.

이 데이터셋은 광범위한 STEM 과목을 포괄하며, 8개 과목(수학, 컴퓨터 과학, 화학, 물리학, 문학, 역사, 생물학, 음성학)에 걸쳐 9,225개의 문항으로 구성된 장쇄 사고(Long Chain Thinking, CoT) 궤적을 제공합니다. 모든 예시는 대규모 언어 모델(LLM)을 통해 생성되었으며, 수동 주석 없이 자동으로 검증되었습니다.

온라인으로 실행:https://go.hyper.ai/JskxG

6. 개방형 강화 학습 추론 문제 데이터셋

Open-RL은 Turing에서 2026년에 공개한 다중 영역 추론 문제 데이터셋으로, 물리학, 수학, 생물학, 화학 분야의 독립적이고 검증 가능하며 명확한 STEM 추론 문제를 포함하고 있습니다. 각 문제는 다단계 추론을 필요로 하며, 기호 연산 및/또는 수치 계산을 포함하고, 객관적으로 검증 가능한 최종 답을 가지고 있습니다.

이 데이터셋은 강화 학습 미세 조정, 보상 모델링, 결과 중심 학습 및 검증 가능한 추론 벤치마킹에 적합합니다.각 문제는 여러 단계의 추론을 필요로 하며, 기호 연산과 수치 계산을 포함하고, 최종 답은 검증 가능해야 합니다.

온라인으로 실행:https://go.hyper.ai/WYDck

7. GPT-5.4 단계별 추론 데이터셋

GPT-5.4 단계별 추론 데이터셋은 긴 연쇄 추론(CoT) 모델링 및 복잡한 문제 해결 작업을 위해 설계된 고밀도 합성 추론 데이터셋입니다. 이 데이터셋은 "마스터-아키텍트" 워크플로우를 기반으로 구축되었으며, Gemini 3 플래시를 사용하여 까다로운 힌트를 생성하고, 이를 GPT-5.4 추론 코어와 결합하여 다단계 추론 및 결과 생성을 완료합니다.

이 데이터 세트는 수학, 프로그래밍, 의학 등 매우 복잡한 분야를 아우르는 약 1,500개의 최상위 수준 샘플을 포함합니다. 과제 난이도는 모두 "그랜드마스터" 및 "박사 이상" 수준으로 설정되어 있습니다. 데이터 샘플에는 완전한 다단계 추론 과정과 검증된 최종 솔루션이 포함되어 있어, 긴 논리적 추론 과정과 극한의 추론 능력을 평가하는 시나리오에 적합합니다.

온라인으로 실행:https://go.hyper.ai/CeBEp

8.수트라 10B 사전 훈련 교육 및 훈련 데이터 세트

Sutra 10B Pretraining은 대규모 언어 모델 사전 학습을 위한 고품질 교육용 데이터셋입니다. Sutra 프레임워크를 사용하여 생성된 이 데이터셋은 구조화된 교육 콘텐츠를 제공하고 언어 모델의 사전 학습을 최적화합니다. Sutra 시리즈 중 가장 큰 규모의 이 데이터셋은 밀도 높고 잘 선별된 데이터셋이 소규모 언어 모델에 최적의 사전 학습 성능을 제공할 수 있음을 보여주기 위해 설계되었습니다.

이 데이터 세트는 총 10,193,029개의 수업 기록(100억 개 이상의 토큰)을 포함하며, 융합 교육, 기술, 과학, 사회, 수학, 생활 기술, 예술 및 창의성, 언어 예술, 철학 및 윤리 등 9개 주요 영역을 다룹니다. 데이터는 기초부터 고급까지 10단계 난이도로 구성된 잘 정립된 교육 패러다임을 따르며, 체계적인 계층 구조를 보여줍니다.

온라인으로 실행:https://go.hyper.ai/skT3q

9. VisCoR-55K 시각적 추론 데이터셋

VisCoR-55K는 화중과학기술대학교와 알리바바 클라우드가 협력하여 2026년에 공개한 고품질 시각 추론 데이터셋입니다. 이 데이터셋은 약 55,000개의 시각 추론 샘플을 포함하고 있으며, 각 샘플은 대조 샘플을 사용한 해당 추론 과정을 생성합니다.일반, 추론, 수학, 그래프 작성, OCR의 다섯 가지 범주를 포괄하는 고품질 시각적 추론 데이터 세트입니다.목표는 신뢰할 수 있고 견고한 시각적 추론에서 시각적 언어 모델에 대한 연구를 촉진하는 것입니다.

온라인으로 실행:https://go.hyper.ai/kIlWk

선택된 공개 튜토리얼

1. 미니CPM 로봇: 현실 세계를 위한 구현된 지능 모델

MiniCPM-Robot은 OpenBMB에서 개발한 실세계 인지, 의사 결정 및 행동을 위한 체화된 지능 모델 제품군입니다. 초기 버전에는 로봇 조작을 위한 일반적인 VLA 모델인 MiniCPM-RobotManip과 체화된 목표물 추적을 위한 에지 모델인 MiniCPM-RobotTrack, 이렇게 두 가지 모델이 포함되어 있습니다.

온라인으로 실행:https://go.hyper.ai/0VsYI

데모 페이지
데모 페이지
2. Diamond-1.0: 자기회귀 음성 복원 모델

Diamond는 nineninesix.ai에서 2026년 7월에 개발한 음성 복원 모델입니다. 이 모델은 자기회귀 seq2seq 아키텍처를 사용하여 저비트레이트 인코딩, 배경 소음, 클리핑, 협대역 등으로 손상된 오디오를 44.1kHz의 스튜디오급 음성 품질로 복원합니다.

온라인으로 실행:https://go.hyper.ai/OHZ6o

데모 페이지
데모 페이지
3. Nanbeige4.2-3B: 소형 지능형 에이전트 모델

Nanbeige4.2-3B는 Nanbeige에서 2026년 7월에 개발한 소형 에이전트 모델로, Nanbeige4.2-3B-Base를 기반으로 합니다. 이 모델은 루프형 트랜스포머 아키텍처를 채택하여 트랜스포머 레이어를 재사용함으로써 파라미터 수를 늘리지 않고도 모델 용량을 확장했습니다. 총 40억 개의 파라미터 중 30억 개만 비임베디드 파라미터를 사용하여 Qwen3.5-9B 및 Gemma4-12B와 같은 더 큰 모델보다 에이전트 벤치마크 테스트에서 우수한 성능을 보여줍니다.

온라인으로 실행:https://go.hyper.ai/KI1QR

데모 페이지
데모 페이지
4. Fara 1.5-27B: 지능형 에이전트를 사용하는 멀티모달 컴퓨터

Fara1.5-27B는 Microsoft Research AI Frontiers에서 2026년 5월에 출시한 멀티모달 컴퓨터 에이전트입니다. 핵심 혁신은 비전 기반 인식 아키텍처에 있습니다. 스크린샷을 통해 브라우저를 관찰하고 DOM에 접근하지 않고 구조화된 도구 호출(클릭, 입력, 스크롤, 웹 페이지 검색 등)을 사용하여 엔드투엔드 작업을 완료합니다. 이 모델은 Qwen3.5-27B를 기반으로 하며 FaraGen1.5 멀티 에이전트 프로세스에서 생성된 학습 데이터를 사용하여 지도 학습 방식으로 미세 조정되었습니다.

온라인으로 실행:https://go.hyper.ai/9AwuJ

데모 페이지
데모 페이지
5. NVIDIA Cosmos3-Edge: 풀모달 추론 모델

Cosmos3-Edge는 NVIDIA 팀이 2026년 7월에 공개한 40억 개 파라미터를 가진 멀티모달 월드 파운데이션 모델입니다. 핵심 혁신 및 특징은 텍스트 생성과 이미지/비디오/액션과 같은 멀티모달 생성을 각각 처리하기 위해 자기회귀 트랜스포머와 확산 트랜스포머를 통합 프레임워크 내에 결합한 하이브리드 트랜스포머(MoT) 아키텍처를 채택한 것입니다.

온라인으로 실행:https://go.hyper.ai/yB4bz

데모 페이지
데모 페이지
6. Mage-Flow: 효율적인 원본 해상도 이미지 생성 및 편집을 위한 기본 모델

Mage-Flow는 마이크로소프트가 2026년 7월에 출시한 4B 크기의 소형 이미지 생성 및 편집 기반 모델입니다. 정교하게 설계된 토크나이저-백본-시스템 공동 최적화를 통해 4B 파라미터 규모에서 더 큰 모델(Qwen-Image 20B, FLUX.2 32B)과 유사한 품질을 달성하면서도 더 빠른 추론 속도와 더 적은 메모리 사용량을 유지합니다.

온라인으로 실행:https://go.hyper.ai/3cw36

데모 페이지
데모 페이지
7. LingBot-World-V2: 무한한 세계와 다양한 상호작용을 지원하는 이미지-비디오 생성

LingBot-World-V2는 Robbyant 팀에서 2026년 7월에 출시한 이미지-비디오 생성 모델입니다. 이 모델은 인과적 사전 학습을 통해 안정적인 출력 품질을 유지하면서 무한히 긴 상호작용을 구현합니다. 또한 실시간 720p 60fps 비디오 생성을 지원하며 공격, 활쏘기, 마법 시전 등 다양한 상호작용 기능을 갖추고 있습니다. 나아가 LingBot-World-V2는 세계 모델에 지능형 에이전트 프레임워크를 최초로 도입하여 행동 계획 에이전트와 환경 합성 에이전트를 통해 더욱 지능적인 장면 이해 및 상호작용 생성을 실현했습니다.

온라인으로 실행:https://go.hyper.ai/wecWC

데모 페이지
데모 페이지
8. MOSS-Transcribe-Diarize: 여러 화자가 참여하는 오디오의 전체 텍스트 변환 및 화자 분리 기능

MOSS-Transcribe-Diarize는 MOSI.AI(OpenMOSS) 팀에서 2026년 7월에 출시한 엔드투엔드 다중 화자 오디오 이해 모델입니다. 이 모델은 단 한 번의 추론으로 음성 전사 및 화자 분리를 동시에 완료하고 타임스탬프와 익명 화자 레이블(예: [S01], [S02])이 포함된 구조화된 텍스트를 출력할 수 있습니다.

온라인으로 실행:https://go.hyper.ai/TElI9

데모 페이지
데모 페이지
💡또한, 안정적 확산 튜토리얼 교환 그룹도 만들었습니다. 친구들을 환영합니다. QR 코드를 스캔하고 [SD 튜토리얼]에 댓글을 남겨 그룹에 가입하여 다양한 기술 문제를 논의하고 신청 결과를 공유하세요~

커뮤니티 기사 해석

1. 미국 아르곤 국립 연구소는 전산 화학 분야에서 시약의 가치를 평가하기 위해 13가지 벤치마크 테스트를 사용하는 ChemGraph를 제안했습니다.

아르곤 국립 연구소는 LLM 기반의 지능형 에이전트인 ChemGraph를 출시했습니다. ChemGraph는 계산 화학 분자 시뮬레이션 워크플로우 자동화를 위해 특별히 설계되었습니다. 벤치마크 테스트 결과, GPT-4o와 같은 대형 모델은 복잡한 작업에서 안정적인 성능을 보였지만, 작업을 전략적으로 세분화하면 GPT-4o-mini와 같은 소형 모델도 성능을 크게 향상시켜 대형 모델의 성능에 도달하거나 능가할 수 있음을 보여주었습니다. 이 연구는 과학 연구에서 저비용으로 인공지능을 자동화할 수 있는 새로운 접근 방식을 제시합니다.

전체 보고서 보기:https://go.hyper.ai/Cgo56

2. 스탠포드 대학교의 AI 기반 X선 과학자들은 대규모 모델 추론과 MCP 도구를 활용하여 싱크로트론 방사선원에서 단결정 회절 정렬 작업을 자율적으로 완료했습니다.

스탠포드 대학교와 SLAC 국립 가속기 연구소의 연구팀이 'AI X선 과학자' 시스템을 개발하여 스탠포드 싱크로트론 방사선원의 실제 빔라인에 배치했습니다. 연구팀은 실제 장비로 시스템을 이전하기 전에 가상 빔라인에서 먼저 디버깅을 진행했으며, 단결정 방향 행렬 계산 작업을 통해 AI가 여러 실험 단계를 자율적으로 완료하고 실제 환경에서 발생할 수 있는 예상치 못한 편차를 처리할 수 있는지 테스트했습니다.

전체 보고서 보기:https://go.hyper.ai/jF9qk

인기 백과사전 기사

1. 인간-기계 루프(HITL)

2. 자동 음성 인식(ASR)

3. 광학 문자 인식(OCR)

4. 세계행동모델(WAM)

5. 사고 중심 강화 학습 프레임워크(GTR)

다음은 "인공지능"을 이해하는 데 도움이 되는 수백 가지 AI 관련 용어입니다.

https://go.hyper.ai/wiki

정상회담 8월 마감

위에 적힌 내용은 이번 주 편집자 추천 기사의 전체 내용입니다. hyper.ai 공식 웹사이트에 포함시키고 싶은 리소스가 있다면, 메시지를 남기거나 기사를 제출해 알려주세요!

다음주에 뵙겠습니다!