跳到主要内容

theory

表示学习、涌现、可解释性、理论分析

26 篇,已拆 0 篇。回总览

2025

  • Making Large Language Models Efficient Dense Retrievers — paper=making-large-language-models-efficient-dense@arXiv:2512.20612v1
  • SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training — paper=sft-memorizes-rl-generalizes-a-comparative@arXiv:2501.17161v2

2024

  • Late Chunking: Contextual Chunk Embeddings Using Long-Context Embedding Models — paper=late-chunking-contextual-chunk-embeddings-using@arXiv:2409.04701v3

2023

  • Are Emergent Abilities of Large Language Models a Mirage? — paper=emergent-abilities-a-mirage@arXiv:2304.15004v2
  • GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints — paper=gqa@arXiv:2305.13245v3
  • Reinforcement Learning for Generative AI: State of the Art, Opportunities and Open Research Challenges — paper=reinforcement-learning-for-generative-ai-state@arXiv:2308.00031v4
  • Textbooks Are All You Need — paper=textbooks-are-all-you-need@arXiv:2306.11644v2
  • Tree of Thoughts: Deliberate Problem Solving with Large Language Models — paper=tree-of-thoughts@arXiv:2305.10601v2

2022

  • BERTopic: Neural topic modeling with a class-based TF-IDF procedure — paper=bertopic@arXiv:2203.05794v1
  • Emergent Abilities of Large Language Models — paper=emergent-abilities-of-large-language-models@arXiv:2206.07682v2
  • RLPrompt: Optimizing Discrete Text Prompts with Reinforcement Learning — paper=rlprompt@arXiv:2205.12548v3
  • Robust Speech Recognition via Large-Scale Weak Supervision — paper=robust-speech-recognition-via-large-scale@arXiv:2212.04356v1
  • Will we run out of data? Limits of LLM scaling based on human-generated data — paper=will-we-run-out-of-data@arXiv:2211.04325v2

2021

  • Learning Transferable Visual Models From Natural Language Supervision — paper=clip@arXiv:2103.00020v1
  • NeuS: Learning Neural Implicit Surfaces by Volume Rendering for Multi-view Reconstruction — paper=neus@arXiv:2106.10689v3
  • Physics-based Deep Learning — paper=physics-based-deep-learning@arXiv:2109.05237v4

2020

  • Denoising Diffusion Probabilistic Models — paper=denoising-diffusion-probabilistic-models@arXiv:2006.11239v2
  • Intrinsic Dimensionality Explains the Effectiveness of Language Model Fine-Tuning — paper=intrinsic-dimensionality-explains-the-effectiveness-of@arXiv:2012.13255v1
  • On Layer Normalization in the Transformer Architecture — paper=on-layer-normalization-in-the-transformer@arXiv:2002.04745v2

2019

  • ALBERT: A Lite BERT for Self-supervised Learning of Language Representations — paper=albert@arXiv:1909.11942v6
  • Root Mean Square Layer Normalization — paper=root-mean-square-layer-normalization@arXiv:1910.07467v1

2018

  • BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding — paper=bert@arXiv:1810.04805v2

2016

  • Layer Normalization — paper=layer-normalization@arXiv:1607.06450v1

2015

  • Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift — paper=batch-normalization-accelerating-deep-network-training@arXiv:1502.03167v3

2013

  • Auto-Encoding Variational Bayes — paper=auto-encoding-variational-bayes@arXiv:1312.6114v11
  • Efficient Estimation of Word Representations in Vector Space — paper=word2vec@arXiv:1301.3781v3