跳到主要内容

eval

基准、评测方法、评判模型、可观测性

27 篇,已拆 0 篇。回总览

2026

  • How Much Do LLMs Hallucinate in Document Q&A Scenarios? A 172-Billion-Token Study Across Temperatures, Context Lengths, and Hardware Platforms — paper=how-much-do-llms-hallucinate-in@arXiv:2603.08274v1

2025

  • The Leaderboard Illusion — paper=the-leaderboard-illusion@arXiv:2504.20879v2

2024

  • Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference — paper=chatbot-arena-an-open-platform-for@arXiv:2403.04132v1
  • DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models — paper=deepseekmath-grpo@arXiv:2402.03300v3
  • Evaluating Very Long-Term Conversational Memory of LLM Agents — paper=evaluating-very-long-term-conversational-memory@arXiv:2402.17753v1
  • Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context — paper=gemini-1-5-unlocking-multimodal-understanding@arXiv:2403.05530v5
  • Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone — paper=phi-3-technical-report-a-highly@arXiv:2404.14219v4
  • What Matters in Transformers? Not All Attention is Needed — paper=what-matters-in-transformers-not-all@arXiv:2406.15786v6

2023

  • Are Emergent Abilities of Large Language Models a Mirage? — paper=emergent-abilities-a-mirage@arXiv:2304.15004v2
  • GPQA: A Graduate-Level Google-Proof Q&A Benchmark — paper=gpqa@arXiv:2311.12022v1
  • Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena — paper=judging-llm-as-a-judge-with@arXiv:2306.05685v4
  • Large Language Models as Optimizers — paper=large-language-models-as-optimizers@arXiv:2309.03409v3
  • Llama 2: Open Foundation and Fine-Tuned Chat Models — paper=llama-2-open-foundation-and-fine@arXiv:2307.09288v2
  • LLaMA: Open and Efficient Foundation Language Models — paper=llama@arXiv:2302.13971v1
  • QLoRA: Efficient Finetuning of Quantized LLMs — paper=qlora@arXiv:2305.14314v1
  • Ragas: Automated Evaluation of Retrieval Augmented Generation — paper=ragas@arXiv:2309.15217v2
  • Segment Anything — paper=segment-anything@arXiv:2304.02643v1
  • When "A Helpful Assistant" Is Not Really Helpful: Personas in System Prompts Do Not Improve Performances of Large Language Models — paper=when-a-helpful-assistant-is-not@arXiv:2311.10054v3

2022

  • MTEB: Massive Text Embedding Benchmark — paper=mteb@arXiv:2210.07316v3
  • Robust Speech Recognition via Large-Scale Weak Supervision — paper=robust-speech-recognition-via-large-scale@arXiv:2212.04356v1
  • TabLLM: Few-shot Classification of Tabular Data with Large Language Models — paper=tabllm@arXiv:2210.10723v2

2021

  • On the Opportunities and Risks of Foundation Models — paper=on-the-opportunities-and-risks-of@arXiv:2108.07258v3
  • Training Verifiers to Solve Math Word Problems — paper=training-verifiers-to-solve-math-word@arXiv:2110.14168v2

2020

  • Measuring Massive Multitask Language Understanding — paper=mmlu@arXiv:2009.03300v3
  • Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks — paper=rag@arXiv:2005.11401v4

2016

  • Gaussian Error Linear Units (GELUs) — paper=gaussian-error-linear-units-gelus@arXiv:1606.08415v5

2015

  • Deep Residual Learning for Image Recognition — paper=deep-residual-learning-for-image-recognition@arXiv:1512.03385v1