HyperAI
Command Palette
Search for a command to run...
大语言模型
大型语言模型(Large Language Model, LLM)是自然语言处理领域的先进工具,通过深度学习技术训练而成,旨在理解和生成人类语言。LLM的目标是捕捉语言的复杂结构和语义,提供高度准确的语言理解和生成能力。其应用价值广泛,包括但不限于机器翻译、文本摘要、情感分析、对话系统和内容创作等,能够显著提升自动化语言处理的效率和质量。
排行榜
共计 10 个模型
基准测试
1.3B
BLiMP
MiniPile
DB-bio
Visual Genome
Alpaca
CAB
MT-Bench
BFCL-v3
GSM8K
HumanEval
DragonBall
HarmfulQ
LRE
Pile
ASAP
SuperGLEBer
A-OKVQA
AlpacaEval 2.0
C4
DDxReasoning
GQA
MNLI m/mm
MSCOCO
PersonalReddit
TruthfulQA
ALFWorld
CCHall
Copain
Do-Not-Answer
LaMP
MATH
MLLMU-Bench
MTBench
NLI
SchemaBench
UNER
ACLU
AndroidWorld
ARC challenge
Avg
BFCL
CNN/DM
ETAPP
EU AI Act
GDPR
Global-MMLU
HIPAA
KnowUnDo
Llama-3.1
Llama2-13B
MGSM-eu
MMLU
MultiJail
No Robots
NovelHuman
Qwen2.5-7B
Reward-Bench
ToolQuery
Advbench-X
AitW
AQuA
ARC (AI2 Reasoning Challenge)
ARC (Challenge)
ArxivClusteringS2Sood
Average
Belebele
BioInstruct
BlocksWorld-100
BoolQ
Business Plan
City*
CLSCLusteringS2S
cMedQA
CNNood
Com$^{2}$-hard
Com$^{2}$-main
Commonsense Reasoning
Company*
CREAK
CSRT
DialogSum
DYNToM
EcomRetrievalid
ECQA
ELUDe
emotion
Environment
Fact*
Consumer Spendings
FineWeb-edu
forbidden question dataset
G0-avg
G1
G1-avg
G2
G2-avg
Gemma-2
GPQA
HaluEval
HellaSwag
Hh-rlhf Red-team
Idefics2
Idefics2-8B
Invention*
Irony
Law
Llama-3.1-8B-Instruct
Llama2-7B
Llama3-8B
LLaVA-7B
LLaVA-Bench
MATHOAI
MBPP
Medical
Ministral-8B
Mistral-12B
MRPC
multilingual MMLU
NQ
OpenBookQA
OpinionQA
Phi-3.5
Phi-3.5-Mini-Instruct
Popular (Length 100)
Popular (Length 1000)
Popular (Length 500)
Praetor-Test-Point
Preference Bench
PreferenceBench
PRISM
Product
Qwen2.5
Qwen2.5-14B
RewardBench
RTE
Salad Bench
Sensemaking
ShareGPT
SpecBench
Stance
StrategyQA
StrucText-Eval
SubPOP
TenkgnadClusteringS2Sood
TOFU
TriviaQA
TruthQA
TweetSentimentExtraction
Unpopular
VideoRetrievalood
WebShop
Wiki Knowledge Learning
Wiki2023
Wikipedia
X-AdvBench
XSUMid
Yi1.5-6B
Yi1.5-9B