跳到主要内容

systems

训练系统、并行、分布式、硬件

11 篇,已拆 0 篇。回总览

2023

  • Large Language Models Cannot Self-Correct Reasoning Yet — paper=large-language-models-cannot-self-correct@arXiv:2310.01798v2

2022

  • Large Language Models are Zero-Shot Reasoners — paper=zero-shot-cot@arXiv:2205.11916v4
  • Precise Zero-Shot Dense Retrieval without Relevance Labels — paper=hyde@arXiv:2212.10496v1
  • Robust Speech Recognition via Large-Scale Weak Supervision — paper=robust-speech-recognition-via-large-scale@arXiv:2212.04356v1
  • TabLLM: Few-shot Classification of Tabular Data with Large Language Models — paper=tabllm@arXiv:2210.10723v2

2021

  • On a new statistical technique for the real-time recognition of ultra-low multiplicity astrophysical neutrino burst — paper=on-a-new-statistical-technique-for@arXiv:2106.12345v1

2019

  • Fast Transformer Decoding: One Write-Head is All You Need — paper=fast-transformer-decoding-one-write-head@arXiv:1911.02150v1
  • Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model — paper=mastering-atari-go-chess-and-shogi@arXiv:1911.08265v2
  • ZeRO: Memory Optimizations Toward Training Trillion Parameter Models — paper=zero@arXiv:1910.02054v3

2017

  • Attention Is All You Need — paper=attention-is-all-you-need@arXiv:1706.03762v7
  • Einstein's Patents and Inventions — paper=einsteins-patents-and-inventions@arXiv:1709.00666v2