HyperAIHyperAI

Command Palette

Search for a command to run...

텍스트/LaTeX/HTML 테이블을 한 번에 처리! OvisOCR2는 엔드 투 엔드 지능형 문서 파싱을 구현하며, 14,000개 이상의 요소 주석과 수만 개의 언어 명령어를 지원합니다! Voxel51은 실내 장면 마이크로 인터랙션 데이터셋인 SceneFun3D를 공개했습니다.

Featured Image

ATH-MaaS, 알리바바 및 기타 팀이 2026년 7월에 출시한 OvisOCR2는 0.8B(약 1.7GB)의 파라미터만으로 구성된 컴팩트한 엔드투엔드 문서 파싱 모델입니다. Qwen3.5-0.8B를 기반으로 구축된 이 모델은 문서 이미지를 자연스러운 읽기 순서를 유지하는 구조화된 마크다운 형식으로 직접 변환하고 텍스트, 수식, 표 및 표시 영역을 정확하게 파싱할 수 있습니다.혁신적인 하이브리드 데이터 엔진과 다단계(SFT, RL, OPD) 학습 방식을 통해 OvisOCR2는 OmniDocBench v1.6 벤치마크에서 96.58점을 달성하여 기존 파이프라인 방식보다 우수한 성능을 보인 최초의 엔드투엔드 모델이 되었습니다.이 제품은 매우 낮은 구축 비용과 뛰어난 성능 사이에서 완벽한 균형을 이룹니다.

HyperAI 웹사이트에서 "OvisOCR2: 0.8B 엔드투엔드 문서 구문 분석 모델"을 만나보실 수 있습니다. 한번 사용해 보세요!

온라인 사용:https://go.hyper.ai/1qOnc

더 자세한 정보를 원하시면 저희 공식 웹사이트를 방문해 주세요.

https://hyper.ai

7월 18일부터 7월 24일까지 hyper.ai 공식 웹사이트의 주요 업데이트 사항을 간략하게 살펴보겠습니다.

* 고품질 공개 데이터 세트: 9개

* 엄선된 고품질 튜토리얼: 9개

* 커뮤니티 게시글 분석: 게시글 1개

* 인기 백과사전 항목: 5개

8월에 마감되는 주요 컨퍼런스: 6개

공식 웹사이트를 방문하세요:하이퍼.AI

선택된 공개 데이터 세트

1. SceneFun3D 3D 장면 기능 상호작용 데이터셋

SceneFun3D는 Voxel51에서 2024년에 공개한 3D 장면 기능 상호작용 데이터셋입니다. 이 데이터셋은 미세한 상호작용 요소에 대한 세밀한 이해에 초점을 맞추고 있으며, 요소 위치 파악, 깁슨 함수 추론, 모션 파라미터 추정, 자연어 작업 설명 등을 포함합니다. SceneFun3D는 710개의 고해상도 실제 실내 장면으로 구성되어 있으며, 14,867개의 기능 상호작용 요소 주석, 9개의 기능 범주, 14,279개의 모션 파라미터, 그리고 10,913개 이상의 자연어 작업 지시문을 담고 있습니다.

온라인 사용:https://go.hyper.ai/g81mC

2. 바그데누 산스크리트어 암송 코퍼스 데이터셋

Vāgdhenu는 산스크리트어 음성 합성 훈련, 운율 연구 및 언어 접근성 향상 애플리케이션에 주로 활용되는 1인 산스크리트어 낭송 녹음 코퍼스입니다. 이 데이터셋은 총 1,467개의 세그먼트로 구성되어 있으며, 전체 오디오 재생 시간은 약 5.3시간입니다. 데이터셋은 다양한 구절을 포함하는 두 개의 독립적인 하위 집합(style_a와 style_b)으로 이루어져 있습니다.

온라인 사용:https://go.hyper.ai/D7Q6H

3. 수학 그래프 수학 정리 종속성 그래프 데이터셋

워싱턴 대학교 수학인공지능연구소에서 2026년에 발표한 Math-Graph는 수학 정리의 명제 수준 의존성 그래프를 구축하는 수학 정리 의존성 그래프 데이터셋입니다. 이 데이터셋은 비형식적 수학 명제와 형식적 수학 명제의 47,952쌍을 포함하며, 이 두 가지 유형의 수학적 지식을 하나의 일관된 의존성 그래프로 통합합니다. 논문 메타데이터, 수학 명제, 의존성 연결선, LLM으로 생성된 자연어 설명 등 비형식 및 형식 수학을 모두 포괄합니다.

온라인 사용:https://go.hyper.ai/CtIDb

4. GLM-5.2 에이전트 상호작용 궤적 데이터셋

GLM-5.2 Agent는 TeichAI가 Teich를 사용하여 생성한 GLM-5.2 모델의 에이전트 상호작용 궤적 원시 데이터셋입니다. 이 데이터셋은 에이전트 모델의 학습 및 설계를 위한 표준화되고 분석 가능한 세션 기록을 제공하여 후속 미세 조정 및 향상된 도구 호출 기능을 지원하는 것을 목표로 합니다.

온라인 사용:https://go.hyper.ai/itLRp

5. EVA-Bench 엔드투엔드 음성 에이전트 벤치마크 데이터셋

ServiceNow에서 출시한 EVA-Bench는 음성 에이전트의 작업 완료 능력과 상호 작용 경험을 평가하기 위해 설계된 엔드투엔드 음성 에이전트 평가 벤치마크 데이터 세트입니다. 이 데이터 세트는 항공사 고객 서비스 관리, 의료 인력 서비스, 기업 IT 서비스 관리 등 세 가지 기업 영역을 포괄하는 213개의 시나리오로 구성되어 있습니다. EVA-Bench는 다중 턴 음성 상호 작용, 도구 호출, 작업 완료 및 음성 시나리오의 안정성을 종합적으로 평가할 수 있도록 지원합니다.

온라인 사용:https://go.hyper.ai/51B4l

6. 메타인지-벤치 데이터셋

ginigen-ai에서 공개한 Metacognition-Bench는 대규모 언어 모델의 메타인지 능력을 측정하는 벤치마크 데이터셋입니다. 이 데이터셋은 단순히 최종 답변의 정확도를 평가하는 것이 아니라, 모델이 추론 오류를 감지하고 스스로 수정하는 기능적 메타인지 능력을 측정하는 것을 목표로 합니다. Metacognition-Bench는 수학, 물리학, 생물학, 법학, 의학, 경제학, 통계학, 윤리학, 컴퓨터 과학 등 121개 분야에 걸쳐 300개의 메타인지 함정 문제를 포함하고 있습니다. 또한 자기 수정, 함정 회피, 변환 감지, 충돌 해결, 점진적 발견, 다중 제약 조건 처리, 전문가 패널, 불확실성 의사 결정 등 8가지 유형의 메타인지 행동 유형을 포괄합니다.

온라인 사용:https://go.hyper.ai/8qdca

7. SVG 벤치마크: 스틸 이미지 생성용 벤치마크 데이터셋입니다.

SVG 벤치마크는 Rapida에서 2025년에 공개한 대규모 정적 이미지 생성 모델 평가 데이터셋입니다. 이 데이터셋은 최첨단 대규모 언어 모델 30개의 텍스트 프롬프트 기반 정적 SVG 생성 능력을 사람 평가를 통해 비교하는 것을 목표로 합니다. 데이터셋은 쌍대 비교 형식으로 구성되어 있으며, 사람이 직접 작성했거나 공개된 데이터셋에서 가져온 500개의 영어 프롬프트, 188,754개의 이미지 비교 샘플, 그리고 사람 투표 기반의 1,355,161개의 선호도 응답을 포함합니다.

온라인 사용:https://go.hyper.ai/13Rn2

8. IFStruct v1.0 구조화된 출력 규정 준수 벤치마크 데이터 세트

IFStruct v1.0은 Liquid AI에서 2026년에 공개한 구조화된 출력 준수 벤치마크 데이터셋입니다. 이 데이터셋은 대규모 언어 모델이 지정된 스키마에 부합하는 구조화된 출력을 생성하는 능력을 체계적으로 평가하는 것을 목표로 합니다. 데이터셋에는 2,000개의 프롬프트 단어가 포함되어 있으며, 각 단어는 모델이 목표 패턴에 따라 여러 인스턴스를 생성하도록 요구합니다. 프롬프트 단어는 자연스러운 대화, 명시적인 경로 안내, 원시 JSON 스키마, 코드 블록 요구 사항, 추가 텍스트 없음 등 다양한 스타일로 제시되며, 모두 엄격한 기본 스키마 유효성 검사 사양을 따릅니다.

온라인 사용:https://go.hyper.ai/3NUcg

9. EdgeBench 지능형 에이전트용 실세계 학습 벤치마크 데이터셋

EdgeBench는 ByteDance Seed에서 2026년에 공개한 지능형 에이전트를 위한 실제 환경 학습 벤치마크 데이터셋입니다. 이 데이터셋은 자율 AI 에이전트가 실제 환경에서 학습하는 능력을 평가하는 것을 목표로 합니다. 총 134개의 실제 과제로 구성되어 있으며, 그중 51개는 오픈소스입니다. EdgeBench는 과학 컴퓨팅 및 머신러닝, 시스템 및 소프트웨어 엔지니어링, 최적화, 지식 추론, 형식 추론, 게임 이론의 6가지 능력 범주를 포괄합니다.

온라인 사용:https://go.hyper.ai/FqmX7

선택된 공개 튜토리얼

1. OvisOCR2: 0.8B 엔드투엔드 문서 구문 분석 모델

ATH-MaaS 팀에서 2026년 7월에 출시한 OvisOCR2 모델은 0.8B 크기의 컴팩트한 엔드투엔드 문서 파싱 모델입니다. 이 모델은 Qwen3.5-0.8B 데이터셋을 기반으로 사후 학습을 통해 구축되었으며, 실제 데이터와 합성 데이터를 결합한 정교한 데이터 엔진과 SFT, RL, OPD를 통합한 다단계 학습 전략을 활용합니다.

온라인으로 실행:https://go.hyper.ai/1qOnc

데모 페이지
데모 페이지
2. RoBERTa 트윗 감정 분석 텍스트 추출

RoBERTa 모델은 페이스북 AI 팀에서 2019년 7월에 출시했습니다. 핵심 혁신 및 특징으로는 BERT 모델에 동적 마스킹 전략, 더 큰 배치 학습 크기, 더 많은 학습 데이터 도입 등이 있으며, 이를 통해 자연어 처리 벤치마크 성능이 크게 향상되었습니다.

온라인으로 실행:https://go.hyper.ai/8iZIz

3. handson-ml2 머신러닝 실습 튜토리얼

이 자료는 머신러닝 기초부터 딥러닝까지 모든 것을 다루는 실용적인 머신러닝 튜토리얼 모음집입니다. 이 튜토리얼은 오렐리앙 제론의 고전 저서 "Hands-On Machine Learning with Scikit-Learn, Keras, and TensorFlow"(2판)를 기반으로 합니다.

온라인으로 실행:https://go.hyper.ai/jEyUh

4. 케라스 딥러닝 기초 튜토리얼 - 유방암 분류

이 튜토리얼은 Paras Jindal이 2026년 7월 Kaggle에 공개한 딥러닝 입문 프로젝트에서 비롯되었습니다. 이 프로젝트는 Keras Sequential API를 사용하여 양성 및 악성 유방암 세포 특징 데이터의 이진 분류를 수행하는 신경망 모델을 구축합니다.

온라인으로 실행:https://go.hyper.ai/s1X9X

모델 요약 및 비교
모델 요약 및 비교
5. 추천 엔진 (공동 구매 추천 엔진)

공동 구매 추천 엔진은 2022년 2월에 공개된 크리스 데오트의 Kaggle Notebook "함께 구매되는 상품 추천"을 기반으로 하는 추천 시스템입니다. 핵심 혁신은 과거 거래 데이터를 분석하여 자주 함께 구매되는 상품을 추천하는 공동 구매 매트릭스를 구축하는 데 있으며, 과거 구매 빈도, 공동 구매 패턴, 인기 상품 백업이라는 세 가지 전략을 통합했습니다. 이 알고리즘은 H&M 개인 맞춤형 패션 추천 대회에서 MAP@12 점수 0.021을 달성했습니다.

온라인으로 실행:https://go.hyper.ai/fiegd

6. 타이타닉 데이터 과학 솔루션: 머신 러닝 기초부터 배우기

타이타닉 – 재난으로부터 배우는 머신러닝은 Kaggle 플랫폼에서 가장 고전적인 입문 대회 중 하나입니다. 이 대회의 목표는 승객들의 개인 정보(객실 등급, 성별, 나이, 가족 구성원 수 등)를 기반으로 타이타닉호 침몰에서 생존했을 가능성을 예측하는 것입니다.

온라인으로 실행:https://go.hyper.ai/gGUJO

데이터 분석
데이터 분석
7. 재난 트윗 분류: BERT를 활용한 자연어 처리 텍스트 분류

이 튜토리얼은 Kaggle의 xhlulu 님의 클래식 노트북을 기반으로 BERT를 사용하여 재난 관련 트윗을 이진 분류하는 방법을 보여줍니다. 완전한 자연어 처리 프로젝트를 통해 데이터 로딩 → 토큰화 인코딩 → 모델 구축 → 학습 및 미세 조정 → 추론 및 예측에 이르는 BERT 텍스트 분류 파이프라인을 처음부터 구축하는 과정을 안내합니다. 사전 학습된 BERT를 사용자 지정 이진 분류 작업에 적용하는 방법과 [CLS] 토큰 및 시그모이드 출력 레이어와 같은 주요 설계 선택의 원리를 이해하게 될 것입니다.

온라인으로 실행:https://go.hyper.ai/ENFgs

8. Ternary-Bonsai-27B: 7.2GB 3진 양자화 추론 27B

Ternary Bonsai 27B는 Prism ML 팀에서 2026년 7월에 개발한 추론 기반 대규모 언어 모델입니다. 이 모델은 Qwen3.6-27B를 기반으로 하며, 엔드투엔드 3진 양자화를 사용합니다. 하이브리드 어텐션 메커니즘(~75% 선형 어텐션 / ~25% 풀 어텐션)을 채택하고 있으며, 최대 262K에 달하는 초장문 컨텍스트를 지원하고, 100K 토큰 컨텍스트에서 최대 약 14.7GB의 메모리만 필요로 합니다. 또한 DSpark 투기적 디코딩 가속 레이어를 제공하여 손실 없는 디코딩 속도를 1.34배 향상시킵니다.

온라인으로 실행:https://go.hyper.ai/OfSLw

데모 페이지
데모 페이지
9. Lyft 모션 예측: ResNeXt50 FPN 기반 자율 주행 차량 궤적 예측

Lyft Motion Prediction은 Lyft가 2020년에 주최한 Kaggle 대회입니다. 이 대회의 목표는 자율 주행 시나리오에서 상황 정보를 기반으로 에이전트(차량, 보행자 등)의 다음 5초(50 타임 스텝, 10Hz) 동안의 움직임 궤적을 예측하는 것입니다.

온라인으로 실행:https://go.hyper.ai/vJYkN

데모 페이지
데모 페이지
💡또한, 안정적 확산 튜토리얼 교환 그룹도 만들었습니다. 친구들을 환영합니다. QR 코드를 스캔하고 [SD 튜토리얼]에 댓글을 남겨 그룹에 가입하여 다양한 기술 문제를 논의하고 신청 결과를 공유하세요~

커뮤니티 기사 해석

1. 하버드 의과대학을 비롯한 연구진은 10,000개 이상의 종양 샘플을 이용한 학습을 바탕으로, 기존의 22개 방법보다 평균적으로 우수한 성능을 보이는 범암 기본 모델인 COMPASS를 제안했습니다.

하버드 의과대학, 로슈 제약, 그리고 저장대학교의 연구팀이 모든 암종에 적용 가능한 기본 모델인 COMPASS를 개발했습니다. 이 모델은 33가지 암 유형에서 추출한 10,184개의 종양 샘플을 사용하여 학습되었으며, 7가지 암 유형과 6가지 면역 체크포인트 억제제를 포함하는 16개의 임상 코호트에서 평가되었습니다. 연구 결과, COMPASS는 평균적으로 기존 22개 모델보다 우수한 성능을 보였으며, 다양한 코호트에서 평균 8.51 TP3T만큼 예측 정확도를 향상시켰습니다.

전체 보고서 보기:https://go.hyper.ai/FyRsC

인기 백과사전 기사

1. 기술

2. 세계행동모델(WAM)

3. 스케일링 법칙

4. 초당 프레임 수

5. 자동 음성 인식

다음은 "인공지능"을 이해하는 데 도움이 되는 수백 가지 AI 관련 용어입니다.

https://go.hyper.ai/wiki