HyperAIHyperAI

Command Palette

Search for a command to run...

ICML 26 우수 논문: 칭화대 JustGRPO, dLLM 추론 병목 현상 극복; 단순 지시 테스트에 작별을 고하다: Agents Last Exam, 지능형 에이전트의 장기적인 전문 역량을 종합적으로 평가.

Featured Image

새롭게 발표된 ICML 26에서는,칭화대학교 연구팀이 우수 논문상을 수상했습니다.

본 연구는 확산형 언어 모델(dLLM)에 초점을 맞춥니다. dLLM은 무질서한 생성과 병렬 디코딩 특성 덕분에 자연어 처리 분야에서 큰 발전을 이루었지만, 연구팀은 수학이나 프로그래밍과 같은 일반적인 추론 작업에서는 "유연성의 함정"에 빠진다고 지적합니다. 즉, 무질서한 생성 방식 때문에 모델이 불확실성이 높은 논리 단어를 건너뛰게 되어 추론 능력이 제한된다는 것입니다.

이 문제를 해결하기 위해 연구팀은 JustGRPO 모델을 제안했습니다. 이 접근 방식은 복잡한 강화 학습 적응 방식을 버리고, 학습 과정에서 자기회귀(AR) 시퀀싱과 표준 GRPO 알고리즘을 직접 도입하는 동시에 추론 과정에서는 dLLM의 병렬 디코딩 이점을 유지합니다. 이러한 최소화된 설계는 모델의 추론 잠재력을 효과적으로 끌어내어 GSM8K 벤치마크에서 89.11 TP3T의 정확도를 달성했습니다.

HyperAI 웹사이트에서 "JustGRPO: 표준 GRPO를 사용하여 확산 언어 모델의 추론 능력을 극대화하기"를 새롭게 선보입니다. 지금 바로 체험해 보세요!

논문 제목:유연성의 함정: 확산 언어 모델에서 임의 순서의 가치에 대한 재고찰

논문 링크:https://go.hyper.ai/hM7mt

온라인 사용:https://go.hyper.ai/c1a0C

더 자세한 정보를 원하시면 저희 공식 웹사이트를 방문해 주세요.

https://hyper.ai

7월 4일부터 7월 10일까지 hyper.ai 공식 웹사이트의 주요 업데이트 사항을 간략하게 살펴보겠습니다.

* 고품질 공개 데이터 세트: 10

* 엄선된 고품질 튜토리얼: 9개

* 커뮤니티 게시글 분석: 게시글 1개

* 인기 백과사전 항목: 5개

공식 웹사이트를 방문하세요:하이퍼.AI

선택된 공개 데이터 세트

1. 장기 에이전트 작업에 사용되는 에이전트 최종 시험 데이터 세트입니다.

Agents Last Exam(ALE) 데이터셋은 장기적인 전문 작업에서 컴퓨터 에이전트의 성능을 평가하는 데 초점을 맞춘 작업 데이터셋입니다. 이 데이터셋은 에이전트 평가를 위한 구조화된 설명을 제공하는 것을 목표로 합니다. 데이터셋에는 Agents Last Exam(ALE) 벤치마크 테스트의 153개 작업에 대한 정보가 포함되어 있으며, 작업 제목, 요약, 분류 체계, 전체 지침, 필수 작업 목록, 예상 소프트웨어 및 입력 파일 설명자와 같은 데이터를 제공합니다.

온라인 사용:https://go.hyper.ai/p8Y8D

2. WGO-Bench 로봇 비디오 벤치마크 데이터셋

WGO-Bench는 Macrodata Labs에서 공개한 로봇 비디오 벤치마크 데이터셋입니다. 이 데이터셋은 시각 언어 모델이 로봇 및 1인칭 시점 액션 비디오를 타임스탬프가 포함된 하위 작업 주석으로 변환하는 능력을 평가하는 것을 목표로 합니다. 주요 작업은 경계 감지와 하위 작업 주석입니다. 주석 레이블은 비디오 클립에서 보이는 모든 동작 이벤트와 상태 변화를 기술하는 데 중점을 둡니다.

온라인 사용:https://go.hyper.ai/TPr8O

3. RedlineBench 법률 계약 협상 벤치마크 데이터 세트

2026년 Crosby에서 출시한 RedlineBench는 법률 계약 협상 평가를 위한 벤치마크 데이터셋입니다. 이 데이터셋은 AI 에이전트가 실제 비즈니스 거래 시나리오에서 빨간 펜으로 주석을 달고 협상 결정을 내리는 능력을 측정하는 것을 목표로 합니다. RedlineBench 데이터셋에는 140개의 실행 가능한 Harbor 태스크가 포함되어 있으며, 각각 4개의 교대 라운드로 구성된 3개의 다중 라운드 협상 시나리오를 다룹니다.

온라인 사용:https://go.hyper.ai/b2EzE

4. 2026 FIFA 월드컵 경기 데이터 세트

FIFA 월드컵 2026 데이터셋은 2026 FIFA 월드컵 경기 데이터로 구성되어 있으며, 축구 데이터 분석 및 머신러닝 모델링을 위해 설계되었습니다. 이 데이터셋은 심층적인 축구 인텔리전스 분석, 통계 모델링 및 머신러닝 예측 작업을 지원하는 것을 목표로 합니다. 데이터셋은 구조화된 경기 데이터, 선수 데이터, 팀 데이터의 세 가지 핵심 구성 요소로 이루어져 있으며, 경기, 선수, 팀 수준의 다차원적인 통계 정보를 포함합니다.

온라인 사용:https://go.hyper.ai/idr4l

5. OmniVideo-100K 오디오 및 비디오 추론 명령 데이터 세트

OmniVideo-100K는 난징대학교가 중국과학원 자동화연구소와 협력하여 2026년 6월에 공개한 오디오 및 비디오 추론 데이터셋입니다. 이 데이터셋은 멀티모달 대규모 언어 모델의 명령어 미세 조정을 위해 설계되었으며, 장기적인 시간적 순서와 교차 모달 의존성에서 모델의 협업 능력을 향상시키는 것을 목표로 합니다. 데이터셋은 5,214개의 YouTube 동영상에서 추출한 10만 쌍의 질문-답변으로 구성되어 있으며, 정렬, 이해, 추론의 세 가지 인지 수준으로 분류된 10가지 오디오 및 비디오 질문-답변 작업 범주를 다룹니다.

온라인 사용:https://go.hyper.ai/aJIuZ

데이터 세트 예제

6. Nemotron-SFT-SWE-v3 명령어 미세 조정 데이터 세트

Nemotron-SFT-SWE-v3는 NVIDIA에서 2026년에 공개한 소프트웨어 엔지니어링 명령어 미세 조정 데이터셋으로, SWE-Bench 스타일 작업에서 대규모 언어 모델의 코드 이해 및 수정 기능을 향상시키도록 설계되었습니다. 이 데이터셋은 OpenHands, SWE-agent, mini-SWE-agent 등 다양한 에이전트 프레임워크를 사용하여 에이전트 궤적에서 수집된 237,970개의 샘플로 구성되어 있으며, 자동화 및 합성 방식을 통해 레이블이 지정되었습니다.

온라인 사용:https://go.hyper.ai/qOzpP

7. Open-SWE-Traces 에이전트 명령어 미세 조정 데이터 세트

NVIDIA에서 2026년에 공개한 Open-SWE-Traces는 대규모 언어 모델에서 에이전트 명령어를 미세 조정하기 위한 데이터셋입니다. 이 데이터셋은 소프트웨어 엔지니어링 분야에서 모델의 코드 수정 및 다단계 도구 호출 기능을 향상시키는 것을 목표로 합니다. SWE-agent와 OpenHands 프레임워크를 사용하여 수집된 이 데이터셋은 Minimax-M2.5 및 Qwen3.5-122B-A10B 알고리즘으로 합성된 207,489개의 에이전트 상호작용 궤적을 포함하며, 다양한 프로그래밍 언어를 다룹니다.

온라인 사용:https://go.hyper.ai/WckNP

8. RadImageNet-VQA 의료 영상 시각적 질문 답변 데이터셋

RadImageNet-VQA는 영상의학 분야의 시각적 질의응답(VQA) 작업에 사용되는 대규모 의료 데이터셋입니다. CT/MRI 영상에서 의료 멀티모달 모델의 시각적 이해 및 질의응답 추론 능력을 향상시키는 것을 목표로 합니다. 의료 영상 질의응답 작업, 영상의학 영상 분석 모델의 학습 및 평가, 멀티모달 의료 AI의 연구 및 응용 개발에 널리 활용되고 있습니다.

온라인 사용:https://go.hyper.ai/WzGOV

9. AgentWorldBench 언어 세계 모델 벤치마크 데이터셋

Qwen이 2026년에 출시한 AgentWorldBench는 언어 환경 모델링 및 추론 능력을 평가하기 위해 설계된 종합적인 언어 환경 모델 벤치마크 데이터셋입니다. 이 데이터셋은 평균 22.8회의 상호작용 라운드를 포함하는 2,170개의 샘플로 구성되어 있으며, Tool Decathlon, Terminal-Bench 1.0/2.0, OSWorld-Verified와 같은 주요 벤치마크에서 얻은 실제 모델 궤적을 기반으로 구축되었습니다.

온라인 사용:https://go.hyper.ai/y1s1b

10. GeneBench-Pro 공개 패키지: 유전자 사례 벤치마크 데이터 세트

GeneBench-Pro 공개 패키지는 OpenAI에서 공개한 유전자 분석용 벤치마크 데이터셋입니다. 이 데이터셋은 유전체학 및 생의학 분야의 AI 에이전트를 위한 재현 가능한 연구 사례 연구 평가 환경을 제공하는 것을 목표로 합니다. 데이터셋에는 통계 유전학, 임상 유전체학, 집단 유전학, 단일 세포 분석, 3차원 유전체학, 기능 유전체학 등 유전체학 및 생물정보학 분야의 10개 독립적인 문제 사례가 포함되어 있습니다.

온라인 사용:https://go.hyper.ai/qd9PF

선택된 공개 튜토리얼

1. JustGRPO: 표준 GRPO를 사용하여 확산 언어 모델의 추론 능력을 극대화합니다

JustGRPO 모델은 칭화대학교 LeapLab 팀에서 2026년 1월에 발표했습니다. 이 모델의 핵심 특징 및 혁신은 확산 언어 모델(DLM)을 학습 과정에서 표준 자기회귀 모델처럼 취급하고 그룹 상대 정책 최적화(GRPO)를 직접 적용하는 최소한의 강화 학습 방식입니다. 궤적 근사, 주변 가능도 추정, 또는 확산 관련 특정 적응 기법 없이도 최첨단 추론 성능(GSM8K 89.1%)을 달성합니다. 

온라인으로 실행:https://go.hyper.ai/c1a0C

데모 페이지

2. 관상동맥 질환 예측: 프래밍햄 데이터셋 기반

프래밍햄 데이터셋은 미국 국립심장폐혈액연구소(NHLBI)에서 1948년 9월에 공개한 심장 질환 연구용 데이터셋입니다. 이 데이터셋을 기반으로 여러 머신러닝 분류 모델을 구축하여 향후 10년 이내에 관상동맥 심장 질환(CHD)이 발생할 위험을 예측했습니다. 본 프로젝트는 데이터 정제, 탐색적 데이터 분석, 특징 엔지니어링, 클래스 불균형 처리, 하이퍼파라미터 튜닝, 앙상블 학습 등 핵심 단계를 포괄적으로 다루었습니다.

온라인으로 실행:https://go.hyper.ai/tMRDG

상관 분석

3. 유전 알고리즘 소개: 자연 선택 기반 전역 최적화 알고리즘

유전 알고리즘(GA)은 다윈의 자연 선택 이론에서 영감을 받은 최적화 알고리즘입니다. 생물학적 진화에서 나타나는 선택, 교차, 돌연변이 메커니즘을 모방하여 탐색 공간에서 최적의 해를 효율적으로 찾아냅니다. 이 튜토리얼에서는 유전 알고리즘의 핵심 개념을 쉽게 설명하고, 구형 함수 최적화 예제를 통해 GA의 전체 과정을 단계별로 보여줍니다.

온라인으로 실행:https://go.hyper.ai/Bm7Pr

수렴 곡선

4. Higgs Audio v3 TTS: 대화형 다국어 음성 합성 모델

2026년 6월 Boson AI에서 출시한 Higgs Audio v3 TTS는 음성 에이전트 시나리오에 최적화된 대화형 텍스트 음성 변환(TTS) 모델입니다. 약 40억 개의 파라미터를 가진 자기회귀 디코더를 기반으로, Higgs 토크나이저를 사용하여 초당 25프레임으로 음성을 8개의 코드북에 담긴 개별 오디오 토큰으로 인코딩하고, 24kHz 샘플링 속도로 파형을 재구성합니다. 이 모델은 100개 이상의 언어에 대한 제로샷 합성을 지원하고, 제로샷 음성 복제를 직접 수행할 수 있으며, 인라인 제어 태그를 통해 감정, 스타일, 운율, 일시 정지 및 음향 효과를 세밀하게 제어할 수 있습니다.

온라인으로 실행:https://go.hyper.ai/Sj9mk

데모 페이지

5. Shakespeare 데이터셋에서 nanoGPT를 사용하여 GPT를 미세 조정합니다.

nanoGPT Shakespeare는 2023년 1월 Andrej Karpathy가 공개한 nanoGPT 프로젝트를 기반으로 구축된 셰익스피어풍 텍스트 생성 프레임워크입니다. 이 프레임워크는 2019년 2월 OpenAI에서 공개한 GPT-2(124M)를 사전 학습 기반으로 사용하며, Transformer 미세 조정 전략을 도입하여 일반 소비자용 GPU에서도 빠르게 학습시켜 셰익스피어풍 텍스트를 생성할 수 있습니다.

온라인으로 실행:https://go.hyper.ai/iqcyS

6. 세그멘테이션-3.0: "파워셋" 다중 화자 세그멘테이션 모델

2023년 9월 Pyannote 팀에서 출시한 Segmentation-3.0은 pyannote.audio 3.0.0으로 학습된 경량 화자 분할 모델로, 주로 프레임 수준 음성 분석 작업에 사용됩니다. 이 모델은 10초 분량의 16kHz 모노 오디오 파일을 입력으로 받아 다중 화자 분류 행렬을 출력합니다. PyanNet 아키텍처를 기반으로 SincNet, LSTM 및 선형 레이어로 구성되며, 약 147만 개의 파라미터를 가지고 있습니다.

온라인으로 실행:https://go.hyper.ai/rXNuo

데모 페이지

7. Qwythos-9B-Claude-Mythos-5-1M GGUF 추론 배포

Qwythos-9B-Claude-Mythos-5-1M은 Empero에서 2026년 6월에 개발한 추론 기반 대규모 언어 모델로, 모든 매개변수를 사용하여 Qwythos3.5-9B로 학습되었습니다. 이 모델은 향상된 추론 기능을 자랑하며, 기존 Qwythos3.5-9B 대비 MMLU에서 34점, gsm8k-strict에서 30점 향상되었습니다. Qwythos3.5에 명시된 툴콜 형식을 준수하는 네이티브 함수 호출을 지원하며, YaRN 로프 스케일링이 기본적으로 활성화되어 1M의 초장문 컨텍스트를 지원합니다. 또한 Qwythos3.5-9B의 멀티모달 비전 기능을 계승합니다. 이 모델은 검열 제한의 영향을 받지 않으며 사이버 보안 및 생물 의학과 같은 특수 기술 문제를 처리할 수 있습니다.

온라인으로 실행:https://go.hyper.ai/dxqRP

데모 페이지

8. 의도치 않은 편향 독성의 직소 분류 - EDA 탐색적 데이터 분석 튜토리얼

2018년, Kaggle과 Jigsaw는 악성 댓글을 분류하는 대회를 개최했습니다. 그러나 불균형한 학습 데이터로 인해 모델에 의도치 않은 편향이 발생하여 "게이"와 같은 정체성 관련 용어를 악성 댓글과 잘못 연관시키는 문제가 생겼고, 중립적인 댓글조차 악성 댓글로 잘못 분류되었습니다. 이러한 문제를 해결하기 위해 해당 팀은 특정 정체성 집단에 대한 편향을 없애는 것을 목표로 하는 새로운 대회를 시작했습니다.

온라인으로 실행:https://go.hyper.ai/LnJ2r

 워드 클라우드 페이지

9. Qwen-AgentWorld-35B-A3B: 7개의 주요 에이전트 상호 작용 영역을 포괄하는 최초의 언어 세계 모델.

Qwen-AgentWorld-35B-A3B는 알리바바 그룹의 Qwen 팀에서 2026년 6월에 출시한 네이티브 언어 기반 월드 모델입니다. 이는 기존의 대규모 대화형 언어 모델과는 다릅니다. Qwen3.5-35B-A3B-Base를 기반으로 구축되었으며, 에이전트의 행동 및 상호 작용 기록을 입력으로 받아 장문의 추론을 통해 다음 환경 상태를 예측합니다. 이를 통해 단말기, 검색, 도구 호출 등 에이전트의 상호 작용 환경을 시뮬레이션합니다.

온라인으로 실행:https://go.hyper.ai/PbwGD

데모 페이지

커뮤니티 기사 해석

1. OpenAI는 129개 질문과 10개 영역에 걸쳐 AI 연구 역량을 평가하는 GeneBench-Pro를 출시했습니다.

최근 OpenAI 연구팀은 GeneBench의 업데이트 버전인 GeneBench-Pro를 제안했는데, 이는 더 넓은 범위의 산업 및 학술 분야를 포괄합니다. GeneBench-Pro는 더 이상 유전체학에만 국한되지 않고 분자 및 정량 생물학, 약물유전체학, 암 생물학, 미생물 유전체학, 임상 적용 등 다단계 통계적 추론이 필요한 시나리오까지 확장되었습니다.

전체 보고서 보기:https://go.hyper.ai/yS7Cv

인기 백과사전 기사

1. 세계행동모델(WAM)

2. 글리치 토큰

3. 조화평균

4. 섀도우 모드 테스트

5. 베이지안 모델 평균화

다음은 "인공지능"을 이해하는 데 도움이 되는 수백 가지 AI 관련 용어입니다.

https://go.hyper.ai/wiki

위에 적힌 내용은 이번 주 편집자 추천 기사의 전체 내용입니다. hyper.ai 공식 웹사이트에 포함시키고 싶은 리소스가 있다면, 메시지를 남기거나 기사를 제출해 알려주세요!

다음주에 뵙겠습니다!

HyperAI 소개

HyperAI(hyper.ai)는 중국을 선도하는 인공지능 및 고성능 컴퓨팅 커뮤니티입니다.우리는 중국 데이터 과학 분야의 인프라가 되고 국내 개발자들에게 풍부하고 고품질의 공공 리소스를 제공하기 위해 최선을 다하고 있습니다. 지금까지 우리는 다음과 같습니다.

* 2100개 이상의 공개 데이터 세트에 대한 국내 가속 다운로드 노드를 제공합니다.

* 700개 이상의 고전 및 인기 온라인 강좌가 포함되어 있습니다.

* 300개 이상의 AI4Science 논문 사례 분석

* 700개 이상의 관련 용어 검색을 지원합니다.

* 중국에서 최초의 완전한 Apache TVM 중국어 문서 호스팅

학습 여정을 시작하려면 공식 웹사이트를 방문하세요.

https://hyper.ai