HyperAIHyperAI

Command Palette

Search for a command to run...

얼리버드 티켓 예매 마감 임박! 베이징에서 열리는 AI 컴파일러 기술 살롱이 곧 개최됩니다!

Featured Image

8월 1일, 제9회 Meet AI Compiler 기술 박람회가 베이징에서 다시 개최됩니다!이번 에피소드에는 베이징 인공지능 연구원(BAAI), TileRT 팀, 텐센트, 화웨이 어센드, 지위안 이노베이션의 전문가들과 업계 유명 인사가 특별 게스트로 출연합니다. 이들은 FlagTree 언어 확장, TileRT 초저지연 추론, FalconGEMM 연산자 최적화, AscendNPU IR 오픈소스 공동 개발, 그리고 인공지능 구현 사례를 심층 분석하여 언어 표현, 연산자 계산, 추론 실행, 시나리오 응용 등 다양한 측면에서 AI 컴파일러의 협력적 진화를 보여주는 것을 목표로 합니다.

현장 좌석은 한정되어 있으니 미리 등록하세요!여러분의 생각을 가져오세요, 실시간으로 함께 토론해 봅시다!

이벤트 세부 정보

⏰ 시간: 8월 1일 (토요일) 13:30~18:10

📍 위치: 베이징시 하이뎬구 중관춘 창업거리 12번 건물 5층 다목적홀

👬 참가자 수: 150명 (좌석이 한정되어 있으니, 서둘러 등록해 주세요) 

🙌🏻 등록 링크:https://hdxu.cn/1KkIr

전체 일정은 다음과 같습니다 ⬇️

손님 및 일정

게스트 공유

주제 공유:FlagTree: Triton-TLE 언어 확장, Tile IR 백엔드 및 컴파일러 최적화 사례

내용물:본 발표는 세 부분으로 구성됩니다. 첫 번째 부분에서는 Triton이 직면한 과제와 TLE(Tracked Operators)가 세 단계의 언어 확장을 통해 하드웨어 세부 정보를 점진적으로 노출하여 이식성, 유지보수성 및 성능 간의 균형을 개선하는 방법을 소개합니다. 두 번째 부분에서는 Tile IR을 Triton 컴파일러 FlagTree에 통합하는 엔지니어링 사례를 살펴보고, 새로운 유형의 컴파일러 백엔드인 FlagTree가 Triton 연산자의 성능 최적화 공간을 어떻게 확장하는지 소개합니다. 세 번째 부분에서는 레이아웃 최적화 및 명령어 재배열과 같은 주요 컴파일러 최적화 기법을 체계적으로 분석하여 칩 간 고성능 연산자를 위한 완벽한 컴파일 최적화 경로를 제시합니다.

이 공유 세션을 시청하면 다음 내용을 배울 수 있습니다.

1. TLE는 온칩 메모리를 어떻게 제어하고, 분산형 모델과 생산자-소비자 모델을 어떻게 표현하며, 벤더의 네이티브 언어를 어떻게 인라인화합니까?

2. TLE 및 Tile IR 백엔드는 Triton 키 연산자의 성능 한계를 어떻게 향상시킬 수 있습니까?

3. 컴파일러 최적화 기법이 데이터 레이아웃 변환 오버헤드를 줄이고, 명령어 실행 효율을 향상시키며, Triton 연산자의 성능을 더욱 끌어내는 방법.

주제 공유:TileRT: 속도가 곧 지능 – 초저지연 대규모 모델 추론을 위한 계산적 탐색 및 공동 설계

내용물:대규모 모델이 수조 개의 매개변수를 가지게 되고 에이전트 기반 시대로 접어들면서, 극도로 빠른 추론 속도는 복잡한 작업 흐름을 지원하고 모델의 잠재력을 최대한 발휘하는 데 핵심적인 요소가 되었습니다. 그러나 시스템이 지연 시간 한계를 더욱 넘어서려고 할 때, 기존 시스템 아키텍처와 실행 병목 현상은 종종 극복하기 어려운 장애물이 됩니다.

이 보고서는 AI 컴파일러, 런타임 아키텍처 진화, 모델-시스템 공동 설계의 관점에서 초저지연으로 대규모 모델 컴퓨팅을 위한 소프트웨어 스택을 구축하는 방법을 보여주는 TileRT의 최신 연구 결과를 소개합니다.

이 공유 세션을 시청하면 다음 내용을 배울 수 있습니다.

1. 속도는 곧 지능이다: 에이전트 시대에 대규모 모델의 추론 측면에서 "속도"가 점차 핵심 지표가 되는 이유를 탐구합니다.

2. 시스템 아키텍처 탐색: 이 섹션에서는 GLM-5를 예시로 사용하여 TileRT의 아키텍처 진화를 소개하고, 기본 연산 스케줄링을 재구성함으로써 추론 성능을 크게 향상시키는 방법을 논의합니다.

3. 모델-시스템 공동 설계 및 운영 사례: 모델과 시스템의 공동 설계를 통해 수조 개의 매개변수를 가진 모델의 단일 배치 추론에서 발생하는 초당 처리량(TPS) 1000회 처리량(TPS) 속도 병목 현상을 극복하는 방법을 공유합니다.

주제 공유:FalconGEMM: 더 낮은 복잡도의 행렬 곱셈으로 하드웨어 성능 한계를 뛰어넘다

내용물:행렬 곱셈(GEMM)은 대규모 모델의 학습 및 추론을 위한 핵심 연산 능력입니다. 그러나 모델 크기가 기하급수적으로 증가함에 따라 표준 알고리즘의 O(N³) 복잡도는 하드웨어의 물리적 한계에 지속적으로 접근하고 있습니다. 칩 연산 능력이 정점에 도달했을 때 어떻게 성능을 계속 끌어낼 수 있는지는 대규모 모델 인프라 구축에 있어 중요한 과제가 되었습니다. 연산자 최적화가 정점에 도달한 상황에서 저복잡도 행렬 곱셈이 성능 한계를 극복하는 원리, 가치 및 엔지니어링 과제를 이해하는 것이 중요합니다. 수학계에서 50년 이상 연구해 온 한 가지 방법은 저복잡도 행렬 곱셈(LCMA, Strassen 및 AlphaTensor 등)입니다. 이는 곱셈 횟수를 줄이는 대신 메모리 접근 및 덧셈 횟수를 늘려 하드웨어 한계를 극복하는 것을 목표로 합니다. 그러나 메모리 접근량 증가, 알고리즘 선택, 플랫폼 간 호환성이라는 세 가지 주요 엔지니어링 과제로 인해 오랫동안 이론적인 수준에 머물러 있었습니다.

본 보고서는 LCMA를 이론 단계에서 상용 소프트웨어 스택으로 체계적으로 구현하는 FalconGEMM 프로젝트를 소개합니다. 이 프로젝트는 컴파일러 자동 코드 생성, 그룹 병렬 융합을 통한 메모리 접근 최적화, 성능 모델 기반 알고리즘 결정 등 세 가지 수준을 포괄합니다. 또한, 다양한 GPU/CPU 플랫폼과 실제 대규모 모델 워크로드에서 최상위 공식 라이브러리를 종합적으로 능가하는 성능을 달성했습니다.

이 공유 세션을 시청하면 다음 내용을 배울 수 있습니다.

1. 연산자 최적화가 한계에 도달했을 때 성능 한계를 극복하는 저복잡도 행렬 곱셈의 원리, 가치 및 엔지니어링 과제를 이해합니다.

2. FalconGEMM의 기술 솔루션 및 플랫폼 간 모범 사례 공유

주제 공유:AscendNPU IR: 컴파일 플랫폼은 오픈 소스이며 Ascend와의 다국어 통합을 지원합니다.

내용물:Ascend 컴파일러 구성 요소인 AscendNPU IR이 완전히 오픈 소스로 공개되었습니다. Ascend를 타사 프로그래밍 프레임워크에 연결하는 MLIR 액세스 계층으로서, 유연한 통합, 완벽한 표현식, Ascend 친화적인 컴파일 최적화 기능을 제공하며, Ascend 연산자의 성능 향상을 위해 다양한 프런트엔드 DSL을 지원합니다.

이 공유 세션을 시청하면 다음 내용을 배울 수 있습니다.

1. AscendNPU IR의 전반적인 기술 아키텍처 및 설계 철학을 이해합니다.

2. Ascend 950 확장을 위한 Ascend NPU IR의 새로운 기능을 이해하십시오.

3. AscendNPU IR 커뮤니티 구축 활동과 참여 방법을 이해합니다.

주제 공유:체화된 지능 분야를 위한 범용 AI 컴파일러

내용물:본 보고서는 체화된 지능 및 멀티모달 대규모 모델을 위한 범용 컴파일러를 소개하며, 완전한 알고리즘 파이프라인의 캡처, 내보내기, 그룹화, 컴파일, 런타임 배포 및 성능 최적화에 중점을 두고, 엣지 컴퓨팅, 안정적인 운영, 크로스 프레임워크 적응성 및 로봇 모델의 엔지니어링 확장성과 관련된 주요 문제를 해결합니다.

이 공유 세션을 시청하면 다음 내용을 배울 수 있습니다.

1. 구현된 지능 모델 배포와 기존 모델 배포를 구분 짓는 핵심 과제, 특히 여러 모델, 여러 프레임워크 및 다단계 파이프라인으로 인해 발생하는 엔지니어링 복잡성과 유지 관리 비용을 이해합니다.

2. 범용 컴파일러가 동적 추적을 통해 알고리즘의 전체 흐름을 어떻게 포착하고, 전처리, VLA 모델, LLM, 후처리 등의 모듈을 컴파일 및 배포 가능한 DAG 템플릿으로 구성하는지 숙달하십시오.

3. 그룹화된 컴파일과 통합 런타임 아키텍처가 다양한 백엔드를 지원하고, 다양한 칩의 장점을 활용하면서 통합된 배포 체인을 유지하는 방법을 이해합니다.

4. 구현된 도메인 컴파일러와 배포 플랫폼 간의 인터페이스 패러다임을 이해합니다.

주최자 및 파트너

HyperAI(hyper.ai)는 국제적으로 선도적인 인공지능 및 고성능 컴퓨팅 커뮤니티입니다.이 플랫폼은 업계 정보 보고서, 가속화된 데이터 세트 다운로드, 온라인 튜토리얼 데모, 인기 있는 모델 성능 평가, 최첨단 논문 권장 사항, 고가치 결과 해석, 최고의 컨퍼런스 일정 통합과 같은 일련의 서비스를 제공하여 글로벌 데이터 과학 및 인공지능 산업의 개발자와 애호가들이 학습하고 이해하고 실습할 수 있도록 돕고, 커뮤니티와 함께 인공지능의 미래를 구축하는 것을 목표로 합니다.

공식 웹사이트를 방문하세요:https://hyper.ai/

OpenBayes Bayesian Computing은 중국을 대표하는 고성능 컴퓨팅 서비스 제공업체입니다.기존 소프트웨어 생태계와 머신 러닝 모델을 차세대 이기종 칩에 접목하여 산업체와 대학의 과학 연구에 더 빠르고 사용하기 쉬운 데이터 과학 컴퓨팅 제품을 제공합니다. 해당 제품은 수십 개의 대규모 산업 시나리오나 주요 과학 연구 기관에서 채택되었습니다.

공식 웹사이트를 방문하세요:https://openbayes.com/

MLC.AI 커뮤니티는 2022년 6월에 설립되었습니다. Apache TVM의 주요 발명가이자 머신 러닝 분야의 저명한 젊은 학자인 천톈치가 팀을 이끌고 MLC 온라인 과정을 시작했으며, 이를 통해 머신 러닝 컴파일의 핵심 요소와 핵심 개념을 체계적으로 소개했습니다.

2022년 11월, MLC.AI 커뮤니티 자원봉사자들의 공동 노력으로 최초의 완전한 TVM 중국어 문서가 출시되어 HyperAI 공식 웹사이트에 성공적으로 호스팅되었습니다. 이를 통해 머신 러닝 컴파일에 관심이 있는 국내 개발자에게 새로운 기술인 문서에 접근하고 학습할 수 있는 기본 설정을 제공하게 되었습니다.

MLC 온라인 과정:https://mlc.ai/

TVM 중국어 문서:https://tvm.hyper.ai/

행사장 지원

이번 행사의 장소는 중관춘 과학도시 관리위원회와 베이징 중관춘 과학도시 혁신개발유한공사가 제공했습니다.

행사장 공간이 한정되어 있어 150석만 예약 가능합니다. 자리를 확보하시려면 최대한 빨리 등록하시기 바랍니다.

8월 1일 오후 1시 30분부터 5시 30분까지 그곳에서 뵙겠습니다!