Before 2020, the largest vision and language models had similar training compute. After that, language models rapidly scaled to use more training compute, driven by the success of transformer-based architectures. Standalone vision models never caught up. Instead, the largest models have recently become multimodal, integrating vision and other modalities into large models such as GPT-4 and Gemini.
| Series | Model | Domain | Training compute (FLOP) | Organization | Publication date |
|---|---|---|---|---|---|
| Language | RNN LM | Language | 5.4e+16 | Johns Hopkins University | 2010-09-26 |
| Language | LSTM LM | Language | 1.7e+16 | RWTH Aachen University | 2012-09-09 |
| Language | DistBelief NNLM | Language | 2.6e+18 | 2013-01-16 | |
| Language | RCTM | Language | 9.3e+15 | University of Oxford | 2013-10-01 |
| Language | RNTN | Language | 1.4e+16 | Stanford University | 2013-10-01 |
| Language | Word2Vec (large) | Language | 3.9e+16 | 2013-10-16 | |
| Language | TransE | Language | 1.3e+18 | Universite de Technologie de Compiègne – CNRS, Google | 2013-12-05 |
| Language | RNNsearch-50* | Language | 1.6e+18 | Jacobs University Bremen, University of Montreal / Université de Montréal | 2014-09-01 |
| Language | Seq2Seq LSTM | Language | 5.6e+19 | 2014-09-10 | |
| Language | SPN-4+KN5 | Language | 4.4e+16 | Singapore University of Technology & Design, DSO National Laboratories | 2014-09-14 |
| Language | SNM-skip | Language | 3.0e+20 | 2014-12-03 | |
| Language | genCNN + dyn eval | Language | 3.4e+16 | Chinese Academy of Sciences, Huawei Noah's Ark Lab, Dublin City University | 2015-03-17 |
| Language | Variational (untied weights, MC) LSTM (Large) | Language | 5.9e+15 | University of Cambridge | 2015-12-16 |
| Language | Named Entity Recognition model | Language | 9.7e+16 | Carnegie Mellon University (CMU) | 2016-03-04 |
| Language | GNMT | Language | 6.6e+21 | 2016-09-26 | |
| Language | Pointer Sentinel-LSTM (medium) | Language | 7.5e+15 | MetaMind Inc, Salesforce | 2016-09-26 |
| Language | VD-LSTM+REAL Large | Language | 2.1e+16 | Salesforce Research, Stanford University | 2016-11-04 |
| Language | NAS with base 8 and shared embeddings | Language | 1.0e+16 | Google Brain | 2016-11-05 |
| Language | BIDAF | Language | 3.5e+18 | University of Washington, Allen Institute for AI | 2016-11-05 |
| Language | MoE-Multi | Language | 9.4e+19 | Jagiellonian University, Google Brain | 2017-01-23 |
| Language | Transformer | Language | 7.4e+18 | Google Research, Google Brain | 2017-06-12 |
| Language | ConvS2S (ensemble of 8 models) | Language | 5.6e+19 | Meta AI | 2017-07-25 |
| Language | AWD-LSTM - 3-layer LSTM (tied) + continuous cache pointer (WT2) | Language | 3.0e+17 | Salesforce Research | 2017-08-07 |
| Language | EI-REHN-1000D | Language | 1.1e+16 | Korea Advanced Institute of Science and Technology (KAIST) | 2017-08-14 |
| Language | GL-LWGC-AWD-MoS-LSTM + dynamic evaluation (WT2) | Language | 4.6e+17 | Ben-Gurion University of the Negev | 2017-08-29 |
| Language | ISS | Language | 3.4e+15 | Duke University, Microsoft | 2017-09-15 |
| Language | AWD-LSTM+WT+Cache+IOG (WT2) | Language | 3.2e+15 | NTT Communication Science Laboratories | 2017-09-26 |
| Language | Fraternal dropout + AWD-LSTM 3-layer (WT2) | Language | 3.1e+17 | Jagiellonian University, Mila - Quebec AI (originally Montreal Institute for Learning Algorithms), University of Montreal / Université de Montréal | 2017-10-31 |
| Language | AWD-LSTM-MoS + dynamic evaluation (WT2, 2017) | Language | 3.4e+18 | Carnegie Mellon University (CMU) | 2017-11-10 |
| Language | ELMo | Language | 3.3e+15 | University of Washington, Allen Institute for AI | 2018-02-01 |
| Language | QRNN | Language | 6.9e+17 | Salesforce Research | 2018-02-01 |
| Language | 4 layer QRNN (h=2500) | Language | 5.9e+17 | Salesforce Research | 2018-03-22 |
| Language | Dropout-LSTM+Noise(Bernoulli) (WT2) | Language | 1.3e+17 | Columbia University, New York University (NYU), Princeton University | 2018-05-03 |
| Language | aLSTM(depth-2)+RecurrentPolicy (WT2) | Language | 7.3e+16 | University of Manchester, Alan Turing Institute | 2018-05-22 |
| Language | GPT-1 | Language | 1.8e+19 | OpenAI | 2018-06-01 |
| Language | Big Transformer for Back-Translation | Language | 4.8e+20 | Facebook AI Research, Google Brain | 2018-08-28 |
| Language | (ensemble): AWD-LSTM-DOC (fin) × 5 (WT2) | Language | 6.7e+17 | NTT Communication Science Laboratories, Tohoku University | 2018-08-30 |
| Language | Transformer + Simple Recurrent Unit | Language | 1.1e+19 | ASAPP, Cornell University, Google, Princeton University | 2018-09-17 |
| Language | LSTM+NeuralCache | Language | 9.8e+14 | KU Leuven, ESAT - PSI, Apple | 2018-09-24 |
| Language | Transformer (Adaptive Input Embeddings) WT103 | Language | 4.5e+19 | Facebook AI Research | 2018-09-28 |
| Language | BERT-Large | Language | 2.8e+20 | 2018-10-11 | |
| Language | TrellisNet | Language | 2.8e+18 | Carnegie Mellon University (CMU), Bosch Center for Artificial Intelligence, Intel Labs | 2018-10-15 |
| Language | Mesh-TensorFlow Transformer 2.9B (translation) | Language | 6.8e+19 | Google Brain | 2018-11-05 |
| Language | Mesh-TensorFlow Transformer 4.9B (language) | Language | 1.6e+20 | Google Brain | 2018-11-05 |
| Language | Fine-tuned-AWD-LSTM-DOC (fin) | Language | 5.2e+16 | Samsung R&D Institute Russia | 2018-11-12 |
| Language | Multi-cell LSTM | Language | 2.0e+15 | University of Hyderabad | 2018-11-15 |
| Language | Transformer-XL (257M) | Language | 3.8e+20 | Carnegie Mellon University (CMU), Google Brain | 2019-01-09 |
| Language | GPT-2 (1.5B) | Language | 1.9e+21 | OpenAI | 2019-02-14 |
| Language | SciBERT | Language | 8.9e+19 | Allen Institute for AI | 2019-03-26 |
| Language | Cross-lingual alignment | Language | 2.6e+18 | Tel Aviv University, Massachusetts Institute of Technology (MIT) | 2019-04-04 |
| Language | WeNet (Penn Treebank) | Language | 7.3e+17 | Amazon | 2019-04-08 |
| Language | BERT-Large-CAS (PTB+WT2+WT103) | Language | 1.5e+20 | Amazon | 2019-04-20 |
| Language | AWD-LSTM-DRILL + dynamic evaluation† (WT2) | Language | 4.1e+17 | IDIAP | 2019-05-14 |
| Language | XLNet | Language | 6.2e+21 | Carnegie Mellon University (CMU), Google Brain | 2019-06-01 |
| Language | Transformer-XL Large + Phrase Induction | Language | 3.8e+20 | Massachusetts Institute of Technology (MIT), University of Illinois Urbana-Champaign (UIUC) | 2019-06-04 |
| Language | AWD-LSTM + MoS + Partial Shuffled | Language | 3.2e+17 | University of Texas at Austin | 2019-06-10 |
| Language | RoBERTa Large | Language | 8.5e+21 | Facebook, University of Washington | 2019-07-01 |
| Language | Megatron-LM (1.2B) | Language | 1.1e+22 | NVIDIA | 2019-09-17 |
| Language | Megatron-LM (8.3B) | Language | 9.1e+21 | NVIDIA | 2019-09-17 |
| Language | Megatron-BERT | Language | 2.2e+22 | NVIDIA | 2019-09-17 |
| Language | DistilBERT | Language | 1.2e+19 | Hugging Face | 2019-10-02 |
| Language | T5-3B | Language | 9.0e+21 | 2019-10-23 | |
| Language | T5-11B | Language | 3.3e+22 | 2019-10-23 | |
| Language | Base LM + kNN LM + Continuous Cache | Language | 3.1e+19 | Stanford University, Facebook AI Research | 2019-11-01 |
| Language | XLM-RoBERTa | Language | 2.1e+22 | Facebook AI | 2019-11-05 |
| Language | CamemBERT | Language | 8.3e+20 | Facebook, INRIA, Sorbonne University | 2019-11-10 |
| Language | Sandwich Transformer | Language | 2.4e+19 | Allen Institute for AI, Facebook AI Research | 2019-11-10 |
| Language | Transformer-XL DeFINE (141M) | Language | 1.7e+18 | University of Washington, Allen Institute for AI | 2019-11-27 |
| Language | MMLSTM (WT-2) | Language | 1.9e+17 | Beijing University of Posts and Telecommunications, University of West London | 2019-12-05 |
| Language | MMLSTM (PTB) | Language | 5.8e+16 | Beijing University of Posts and Telecommunications, University of West London | 2019-12-05 |
| Language | Meena | Language | 1.1e+23 | Google Brain | 2020-01-28 |
| Language | TaLK Convolution | Language | 2.7e+19 | Carleton University | 2020-02-08 |
| Language | ALBERT-xxlarge | Language | 2.4e+21 | Toyota Technological Institute at Chicago, Google | 2020-02-09 |
| Language | Turing-NLG | Language | 1.6e+22 | Microsoft | 2020-02-13 |
| Language | Feedback Transformer | Language | 7.7e+18 | LORIA, University of Lorraine, Facebook AI Research | 2020-02-21 |
| Language | TransformerXL + spectrum control | Language | 2.6e+19 | University of California Los Angeles (UCLA), JD.com | 2020-03-11 |
| Language | Tensor-Transformer(1core)+PN (WT103) | Language | 1.6e+18 | University of California (UC) Berkeley | 2020-03-17 |
| Language | ELECTRA | Language | 3.1e+21 | Stanford University, Google, Google Brain | 2020-03-23 |
| Language | UnifiedQA | Language | 1.6e+19 | Allen Institute for AI, University of Washington | 2020-05-02 |
| Language | GPT-3 175B (davinci) | Language | 3.1e+23 | OpenAI | 2020-05-28 |
| Language | GShard (dense) | Language | 4.8e+22 | 2020-06-30 | |
| Language | DeLighT | Language | 3.8e+18 | University of Washington, Allen Institute for AI, Facebook AI Research | 2020-08-03 |
| Language | ERNIE-GEN (large) | Language | 2.0e+20 | Baidu | 2020-08-06 |
| Language | LUKE | Language | 1.8e+22 | University of Washington, National Institute of Informatics | 2020-10-02 |
| Language | mT5-XXL | Language | 8.2e+22 | Google, Google Research | 2020-10-20 |
| Language | German ELECTRA Large | Language | 1.4e+21 | deepset, Bayerische Staatsbibliothek Muenchen | 2020-10-21 |
| Language | KEPLER | Language | 1.7e+21 | Tsinghua University, Mila - Quebec AI (originally Montreal Institute for Learning Algorithms), HEC, CIFAR AI Research, Princeton University, University of Montreal / Université de Montréal | 2020-11-23 |
| Language | CPM-Large | Language | 2.6e+20 | Tsinghua University, Beijing Academy of Artificial Intelligence / BAAI | 2020-12-01 |
| Language | DensePhrases | Language | 2.1e+18 | Korea University, Princeton University | 2020-12-23 |
| Language | CT-MoS (WT2) | Language | 5.4e+17 | Google, National Tsing Hua University | 2020-12-25 |
| Language | ERNIE-Doc (247M) | Language | 3.0e+19 | Baidu | 2020-12-31 |
| Language | Switch | Language | 8.2e+22 | 2021-01-11 | |
| Language | SRU++ Large | Language | 2.1e+19 | ASAPP | 2021-02-24 |
| Language | Generative BST | Language | 1.4e+22 | Facebook AI Research | 2021-03-05 |
| Language | PLUG | Language | 3.6e+22 | Alibaba | 2021-04-19 |
| Language | ByT5-XXL | Language | 8.1e+22 | Google, Google Research | 2021-05-28 |
| Language | EMDR | Language | 1.9e+21 | Mila - Quebec AI (originally Montreal Institute for Learning Algorithms), McGill University, DeepMind | 2021-06-09 |
| Language | DeBERTa | Language | 2.6e+22 | Microsoft | 2021-06-10 |
| Language | Adaptive Input Transformer + RD | Language | 8.6e+19 | Microsoft Research Asia, Soochow University | 2021-06-28 |
| Language | ERNIE 3.0 | Language | 2.2e+22 | Baidu | 2021-07-05 |
| Language | Codex | Language | 7.3e+22 | OpenAI | 2021-07-07 |
| Language | Jurassic-1-Jumbo | Language | 3.7e+23 | AI21 Labs | 2021-08-11 |
| Language | XLMR-XXL | Language | 3.4e+22 | Facebook AI Research | 2021-08-17 |
| Language | FLAN 137B | Language | 2.0e+24 | Google Research | 2021-09-03 |
| Language | PermuteFormer | Language | 2.8e+18 | Peking University | 2021-09-06 |
| Language | HyperCLOVA 204B | Language | 2.0e+23 | NAVER | 2021-09-10 |
| Language | PLATO-XL | Language | 9.9e+21 | Baidu | 2021-09-20 |
| Language | Turing ULRv5 | Language | 2.9e+22 | Microsoft | 2021-09-28 |
| Language | Megatron-Turing NLG 530B | Language | 8.6e+23 | Microsoft, NVIDIA | 2021-10-11 |
| Language | Yuan 1.0 | Language | 3.5e+23 | Inspur | 2021-10-12 |
| Language | base LM+GNN+kNN | Language | 5.3e+19 | Shannon.AI, Nanjing University, Nanyang Technological University, Zhejiang University (ZJU) | 2021-10-17 |
| Language | S4 | Language | 7.8e+19 | Stanford University | 2021-10-31 |
| Language | CodeT5-base | Language | 1.6e+21 | Salesforce, Nanyang Technological University | 2021-11-01 |
| Language | Gopher (280B) | Language | 6.3e+23 | DeepMind | 2021-12-08 |
| Language | GLaM | Language | 3.6e+23 | 2021-12-13 | |
| Language | Contriever | Language | 1.6e+20 | Meta AI, University College London (UCL), PSL University, Université Grenoble Alpes | 2021-12-16 |
| Language | XGLM-7.5B | Language | 2.2e+22 | Meta AI, Facebook AI Research | 2021-12-20 |
| Language | ERNIE 3.0 Titan | Language | 1.0e+24 | Baidu, Peng Cheng Laboratory | 2021-12-23 |
| Language | InstructGPT 175B | Language | 3.2e+23 | OpenAI | 2022-01-27 |
| Language | AlphaCode | Language | 2.4e+23 | DeepMind | 2022-02-02 |
| Language | RETRO-7B | Language | 1.7e+22 | DeepMind | 2022-02-07 |
| Language | GPT-NeoX-20B | Language | 9.3e+22 | EleutherAI | 2022-02-09 |
| Language | LaMDA | Language | 3.6e+23 | 2022-02-10 | |
| Language | ST-MoE | Language | 2.9e+23 | Google, Google Brain, Google Research | 2022-02-17 |
| Language | PolyCoder | Language | 1.1e+21 | Carnegie Mellon University (CMU) | 2022-02-26 |
| Language | Segatron-XL large, M=384 + HCP | Language | 2.6e+19 | Microsoft Research, University of Waterloo | 2022-03-21 |
| Language | Chinchilla | Language | 5.8e+23 | DeepMind | 2022-03-29 |
| Language | PaLM (540B) | Language | 2.5e+24 | Google Research | 2022-04-04 |
| Language | Sparse all-MLP | Language | 5.3e+20 | Meta AI | 2022-04-14 |
| Language | OPT-175B | Language | 4.3e+23 | Meta AI | 2022-05-02 |
| Language | UL2 | Language | 1.2e+23 | Google Research, Google Brain | 2022-05-10 |
| Language | Gato | Multimodal, Robotics, Games, Language | 4.0e+21 | DeepMind | 2022-05-12 |
| Language | GPT-2 Medium (FlashAttention) | Language | 8.9e+20 | Stanford University, University at Buffalo | 2022-05-27 |
| Language | DITTO | Language | 3.3e+18 | Tsinghua University, Apple, Westlake University, Chinese University of Hong Kong (CUHK) | 2022-06-06 |
| Language | Minerva (540B) | Language | 2.7e+24 | 2022-06-29 | |
| Language | CodeT5-large | Language | 2.7e+21 | Salesforce | 2022-07-05 |
| Language | NLLB | Language | 1.8e+22 | Meta AI | 2022-07-06 |
| Language | BLOOM-176B | Language | 3.7e+23 | Hugging Face, BigScience | 2022-07-11 |
| Language | AlexaTM 20B | Language | 2.0e+23 | Amazon | 2022-08-02 |
| Language | GLM-130B | Language | 3.5e+23 | Tsinghua University | 2022-08-04 |
| Language | BlenderBot 3 | Language | 4.3e+23 | McGill University, Meta AI, Mila - Quebec AI (originally Montreal Institute for Learning Algorithms) | 2022-08-10 |
| Language | U-PaLM (540B) | Language | 2.5e+24 | 2022-10-20 | |
| Language | Flan-PaLM 540B | Language | 2.5e+24 | 2022-10-20 | |
| Language | Mogrifier RLSTM (WT2) | Language | 1.4e+17 | DeepMind | 2022-11-03 |
| Language | Galactica | Language, Biology | 3.2e+23 | Meta AI | 2022-11-16 |
| Language | Fusion in Encoder | Language | 1.3e+20 | Samsung | 2022-11-18 |
| Language | GPT-3.5 | Language | 2.6e+24 | OpenAI | 2022-11-28 |
| Language | Vega v2 | Language | 7.8e+22 | Wuhan University, JD Explore Academy, Shanghai AI Lab, Nanyang Technological University, Washington University in St Louis, Chongqing University of Posts and Telecommunications, University of Sydney | 2022-12-04 |
| Language | Hybrid H3-2.7B | Language | 6.5e+21 | Stanford University, University at Buffalo | 2022-12-28 |
| Language | LLaMA-65B | Language | 5.5e+23 | Meta AI | 2023-02-24 |
| Language | Falcon-40B | Language | 2.4e+23 | Technology Innovation Institute | 2023-03-15 |
| Language | PanGu-Σ | Language | 4.7e+23 | Huawei Noah's Ark Lab | 2023-03-20 |
| Language | BloombergGPT | Language | 2.4e+23 | Bloomberg, Johns Hopkins University | 2023-03-30 |
| Language | Incoder-6.7B | Language | 3.0e+21 | Facebook AI Research, University of Washington, University of California (UC) Berkeley, Carnegie Mellon University (CMU), Toyota Technological Institute at Chicago | 2023-04-09 |
| Language | StarCoder | Language | 8.5e+22 | Hugging Face, ServiceNow, Northeastern University, Mila - Quebec AI (originally Montreal Institute for Learning Algorithms), Carnegie Mellon University (CMU), Johns Hopkins University, Leipzig University, ScaDS.AI, Queen Mary University of London, Roblox, Sea AI Lab, Technion - Israel Institute of Technology, Monash University, CSIRO, Data61, McGill University, Saama, University of British Columbia (UBC), Massachusetts Institute of Technology (MIT), Technical University of Munich, IBM, University of Vermont, UnfoldML, SAP, University of Notre Dame, Columbia University, New York University (NYU), University of Allahabad, Discover Dollar, Toloka, Telefonica, Stanford University, Weizmann Institute of Science, Alan Turing Institute, Wellesley College, EleutherAI, Forschungszentrum Julich | 2023-05-09 |
| Language | PaLM 2 | Language | 7.3e+24 | 2023-05-10 | |
| Language | InternLM | Language | 1.0e+24 | Shanghai AI Lab, SenseTime | 2023-07-06 |
| Language | Claude 2 | Language | 3.9e+24 | Anthropic | 2023-07-11 |
| Language | Llama 2-7B | Language | 8.4e+22 | Meta AI | 2023-07-18 |
| Language | Llama 2-70B | Language | 8.1e+23 | Meta AI | 2023-07-18 |
| Language | Jais | Language | 4.9e+22 | Cerebras Systems, Mohamed bin Zayed University of Artificial Intelligence (MBZUAI), Inception G42 | 2023-08-29 |
| Language | Falcon-180B | Language | 3.8e+24 | Technology Innovation Institute | 2023-09-06 |
| Language | Amazon Titan | Language, Image generation | 4.8e+24 | Amazon | 2023-09-28 |
| Language | FinGPT-13B | Language | 1.6e+23 | University of California Los Angeles (UCLA), Columbia University, New York University (NYU) | 2023-10-07 |
| Language | CODEFUSION (Python) | Language | 7.9e+18 | Microsoft, Microsoft Research | 2023-10-26 |
| Language | Skywork-13B | Language | 2.5e+23 | Kunlun Inc. | 2023-10-30 |
| Language | Yi-34B | Language | 6.1e+23 | 01.AI | 2023-11-02 |
| Language | Grok-1 | Language | 2.9e+24 | xAI | 2023-11-04 |
| Language | Nemotron-3-8B | Language | 1.8e+23 | NVIDIA | 2023-11-15 |
| Language | Inflection-2 | Language | 1.0e+25 | Inflection AI | 2023-11-22 |
| Language | Qwen-72B | Language | 1.3e+24 | Alibaba | 2023-11-30 |
| Language | Llama Guard | Language | 1.6e+23 | Meta AI | 2023-12-07 |
| Language | Mixtral 8x7B | Language | 7.7e+23 | Mistral AI | 2023-12-11 |
| Language | FunSearch | Language, Search | 3.9e+23 | Google DeepMind | 2023-12-14 |
| Language | nekomata-14b | Language | 2.6e+23 | rinna | 2023-12-21 |
| Language | Qwen1.5-72B | Language | 1.3e+24 | Alibaba | 2024-02-04 |
| Language | Gemini 1.5 Pro | Language, Multimodal | 1.6e+25 | Google DeepMind | 2024-02-15 |
| Language | MegaScale (Production) | Language | 3.9e+24 | ByteDance, Peking University | 2024-02-23 |
| Language | Mistral Large | Language | 1.1e+25 | Mistral AI | 2024-02-26 |
| Language | Aramco Metabrain AI | Language | 1.0e+25 | Saudi Aramco | 2024-03-04 |
| Language | Inflection-2.5 | Language | 8.0e+24 | Inflection AI | 2024-03-07 |
| Language | DBRX | Language | 2.6e+24 | Databricks | 2024-03-27 |
| Language | Llama 3-70B | Language | 7.9e+24 | Meta AI | 2024-04-18 |
| Language | Yi-Large | Language | 1.8e+24 | 01.AI | 2024-05-13 |
| Language | ALLaM 7B | Language | 9.0e+22 | Saudi Data and Artificial Intelligence Authority | 2024-05-21 |
| Language | ALLaM adapted 70B | Language | 1.1e+24 | Saudi Data and Artificial Intelligence Authority | 2024-05-21 |
| Language | Qwen2-72B | Language | 3.0e+24 | Alibaba | 2024-06-07 |
| Language | Llama-3.1-Nemotron-70B-Instruct | Language | 7.9e+24 | NVIDIA, Meta AI | 2024-06-12 |
| Language | Nemotron-4 340B | Language | 1.8e+25 | NVIDIA | 2024-06-14 |
| Language | DeepSeek-Coder-V2 236B | Language | 1.3e+24 | DeepSeek | 2024-06-17 |
| Language | Llama 3.1-405B | Language | 3.8e+25 | Meta AI | 2024-07-23 |
| Language | Mistral Large 2 | Language | 2.1e+25 | Mistral AI | 2024-07-24 |
| Language | AFM-server | Language | 4.3e+24 | Apple | 2024-07-29 |
| Language | AFM-on-device | Language | 4.5e+23 | Apple | 2024-07-29 |
| Language | GLM-4-Plus | Language | 3.6e+25 | Zhipu AI | 2024-08-29 |
| Language | DeepSeek-V2.5 | Language | 1.8e+24 | DeepSeek | 2024-09-06 |
| Language | Qwen2.5-32B | Language | 3.5e+24 | Alibaba | 2024-09-17 |
| Language | Qwen2.5 Instruct (72B) | Language | 7.9e+24 | Alibaba | 2024-09-19 |
| Language | Qwen2.5-72B | Language | 7.8e+24 | Alibaba | 2024-09-19 |
| Language | Telechat2-115B | Language | 6.9e+24 | China Telecom | 2024-09-20 |
| Language | Yi-Lightning | Language | 1.5e+24 | 01.AI | 2024-10-18 |
| Language | Doubao-pro | Language | 2.5e+25 | ByteDance | 2024-10-28 |
| Language | Hunyuan-Large | Language | 3.5e+24 | Tencent | 2024-11-06 |
| Language | Llama 3.3 70B | Language | 6.9e+24 | Meta AI | 2024-12-06 |
| Language | EXAONE 3.5 32B | Language | 1.3e+24 | LG AI Research | 2024-12-09 |
| Language | DeepSeek-V3 | Language | 3.4e+24 | DeepSeek | 2024-12-24 |
| Language | DeepSeek-R1 | Language | 4.0e+24 | DeepSeek | 2025-01-20 |
| Language | QwQ-32B | Language | 3.5e+24 | Alibaba | 2025-03-06 |
| Language | EXAONE Deep 32B | Language | 1.3e+24 | LG AI Research | 2025-03-16 |
| Language | Pangu Ultra | Language | 1.1e+25 | Huawei | 2025-04-10 |
| Language | Qwen3-235B-A22B | Language | 4.8e+24 | Alibaba | 2025-04-29 |
| Language | Kimi K2 | Language | 3.0e+24 | Moonshot | 2025-07-11 |
| Language | EXAONE 4.0 (32B) | Language | 2.7e+24 | LG AI Research | 2025-07-15 |
| Language | Qwen3-Coder-480B-A35B | Language | 1.6e+24 | Alibaba | 2025-07-22 |
| Language | GLM 4.5 | Language | 4.4e+24 | Zhipu AI, Tsinghua University | 2025-08-05 |
| Language | gpt-oss-20b | Language | 5.5e+23 | OpenAI | 2025-08-05 |
| Language | gpt-oss-120b | Language | 4.9e+24 | OpenAI | 2025-08-05 |
| Language | Qwen3-Max | Language | 1.5e+25 | Alibaba | 2025-09-05 |
| Vision | Feedforward NN | Vision | 3.5e+14 | University of Montreal / Université de Montréal | 2010-05-13 |
| Vision | iCCCP | Vision | 1.1e+15 | Massachusetts Institute of Technology (MIT) | 2010-06-13 |
| Vision | Pooling CNN (NORB) | Vision | 1.5e+15 | University of Bonn | 2010-09-15 |
| Vision | Pooling CNN (Caltech 101) | Vision | 1.2e+15 | University of Bonn | 2010-09-15 |
| Vision | Deep Autoencoders | Vision | 3.7e+16 | University of Toronto | 2011-04-29 |
| Vision | High Performance CNN (NORB) | Vision | 2.6e+16 | IDSIA, SUPSI | 2011-07-16 |
| Vision | CNN Committee (MNIST) | Vision | 5.2e+16 | IDSIA | 2011-09-18 |
| Vision | CNN Committee (NIST) | Vision | 2.6e+16 | IDSIA | 2011-09-18 |
| Vision | CNN committee (traffic sign) | Vision | 9.9e+14 | IDSIA | 2011-10-03 |
| Vision | Dropout (CIFAR) | Vision | 4.3e+15 | University of Toronto | 2012-06-03 |
| Vision | Dropout (ImageNet) | Vision | 2.7e+17 | University of Toronto | 2012-06-03 |
| Vision | Dropout (MNIST) | Vision | 6.0e+15 | University of Toronto | 2012-06-03 |
| Vision | Unsupervised High-level Feature Learner | Vision | 6.0e+17 | 2012-07-12 | |
| Vision | AlexNet | Vision | 4.7e+17 | University of Toronto | 2012-09-30 |
| Vision | DNN EM segmentation | Vision | 4.8e+17 | IDSIA, SUPSI | 2012-12-03 |
| Vision | Hierarchical Scene Labeling (Stanford Background) | Vision | 2.4e+17 | New York University (NYU) | 2013-08-01 |
| Vision | Visualizing CNNs | Vision | 5.3e+17 | New York University (NYU) | 2013-11-12 |
| Vision | Image generation | Vision | 4.8e+14 | University of Amsterdam | 2013-12-20 |
| Vision | SPPNet | Vision | 3.4e+18 | Microsoft, Xi’an Jiaotong University, University of Science and Technology of China (USTC) | 2014-06-18 |
| Vision | ACF-WIDER | Vision | 7.6e+13 | Chinese Academy of Sciences | 2014-07-15 |
| Vision | VGG19 | Vision | 1.1e+19 | University of Oxford | 2014-09-04 |
| Vision | VGG16 | Vision | 1.2e+19 | University of Oxford | 2014-09-04 |
| Vision | GoogLeNet / InceptionV1 | Vision | 1.5e+18 | Google, University of Michigan, University of North Carolina | 2014-09-17 |
| Vision | TA-CNN | Vision | 1.1e+16 | Chinese University of Hong Kong (CUHK) | 2014-11-29 |
| Vision | Fractional Max-Pooling | Vision | 1.0e+17 | University of Warwick | 2014-12-18 |
| Vision | ADAM (CIFAR-10) | Vision | 6.2e+14 | University of Amsterdam, OpenAI, University of Toronto | 2014-12-22 |
| Vision | MSRA (C, PReLU) | Vision | 2.4e+19 | Microsoft Research | 2015-02-06 |
| Vision | U-Net | Vision | 5.1e+16 | University of Freiburg | 2015-05-18 |
| Vision | DCNN | Vision | 4.8e+17 | University of Maryland, Rutgers University | 2015-08-07 |
| Vision | SAF R-CNN | Vision | 1.2e+19 | Beijing Institute of Technology, Sun Yat-sen University, Panasonic R&D, National University of Singapore | 2015-10-28 |
| Vision | Inception v3 | Vision | 1.0e+20 | Google, University College London (UCL) | 2015-12-02 |
| Vision | ResNet-101 (ImageNet) | Vision | 7.0e+18 | Microsoft | 2015-12-10 |
| Vision | ResNet-152 (ImageNet) | Vision | 1.0e+19 | Microsoft | 2015-12-10 |
| Vision | R-FCN | Vision | 7.2e+17 | Tsinghua University, Microsoft Research | 2016-06-21 |
| Vision | ResNet-200 | Vision | 3.0e+19 | Microsoft Research Asia | 2016-09-17 |
| Vision | Xception | Vision | 4.4e+20 | 2016-10-07 | |
| Vision | NASv3 (CIFAR-10) | Vision | 2.2e+21 | Google Brain | 2016-11-05 |
| Vision | PolyNet | Vision | 6.4e+19 | Chinese University of Hong Kong (CUHK) | 2016-11-17 |
| Vision | HR-ResNet101 | Vision | 7.1e+18 | Carnegie Mellon University (CMU) | 2016-12-13 |
| Vision | EnhanceNet | Vision | 1.3e+17 | Max Planck Institute for Intelligent Systems | 2016-12-23 |
| Vision | JFT | Vision | 8.4e+20 | Google Research, Carnegie Mellon University (CMU) | 2017-07-10 |
| Vision | RetinaNet-R101 | Vision | 2.1e+18 | Facebook AI Research | 2017-08-07 |
| Vision | PyramidNet | Vision | 2.3e+15 | Korea Advanced Institute of Science and Technology (KAIST) | 2017-09-06 |
| Vision | YOLOv3 | Vision | 1.3e+19 | University of Washington | 2018-04-08 |
| Vision | ResNeXt-101 32x48d | Vision | 8.7e+21 | 2018-05-02 | |
| Vision | Big-Little Net | Vision | 2.5e+17 | IBM | 2018-07-10 |
| Vision | AlphaX-1 | Vision | 8.9e+17 | Facebook AI Research, Brown University | 2019-10-02 |
| Vision | Noisy Student (L2) | Vision | 2.6e+22 | Carnegie Mellon University (CMU), Google | 2019-11-11 |
| Vision | Once for All | Vision | 6.2e+20 | MIT-IBM Watson AI Lab, Massachusetts Institute of Technology (MIT), IBM | 2020-04-29 |
| Vision | DETR | Vision | 4.0e+20 | 2020-05-26 | |
| Vision | ViT-Huge/14 | Vision | 4.3e+21 | Google Brain, Google Research | 2020-10-22 |
| Vision | DeiT-B | Vision | 7.9e+19 | Meta AI, Sorbonne University | 2021-01-15 |
| Vision | Meta Pseudo Labels | Vision | 4.8e+22 | Google Brain, Google AI | 2021-03-01 |
| Vision | Transformer local-attention (NesT-B) | Vision | 2.4e+19 | Google Cloud, Google Research | 2021-05-26 |
| Vision | ViT-G/14 | Vision | 5.8e+22 | Google Brain, Google Research | 2021-06-08 |
| Vision | CoAtNet | Vision | 4.3e+22 | Google, Google Research, Google Brain | 2021-06-09 |
| Vision | Denoising Diffusion Probabilistic Models (LSUN Bedroom) | Vision | 7.8e+19 | University of California (UC) Berkeley | 2021-06-11 |
| Vision | EfficientNetV2-XL | Vision | 9.6e+19 | Google, Google Brain | 2021-06-23 |
| Vision | SEER | Vision | 1.8e+22 | Facebook AI Research, INRIA | 2021-07-29 |
| Vision | YOLOX-X | Vision | 6.3e+20 | Megvii Inc | 2021-08-06 |
| Vision | Masked Autoencoders ViT-H | Vision | 4.6e+20 | Facebook AI Research | 2021-11-11 |
| Vision | Swin Transformer V2 (SwinV2-G) | Vision, Video | 1.1e+21 | Microsoft Research Asia | 2021-11-18 |
| Vision | BASIC-L | Vision | 4.1e+22 | 2021-11-19 | |
| Vision | Florence | Vision | 4.8e+22 | Microsoft | 2021-11-22 |
| Vision | Detic | Vision | 2.3e+19 | Meta AI, University of Texas at Austin | 2022-01-07 |
| Vision | ViT-G (model soup) | Vision | 3.4e+21 | University of Washington, Columbia University, Google, Meta AI, Tel Aviv University | 2022-03-10 |
| Vision | CoCa | Vision | 7.3e+22 | Google Research | 2022-06-14 |
| Vision | InternImage | Vision | 2.4e+21 | Shanghai AI Lab, Tsinghua University, Nanjing University, SenseTime, Chinese University of Hong Kong (CUHK) | 2022-11-10 |
| Vision | EVA-01 | Vision | 1.5e+22 | Beijing Academy of Artificial Intelligence / BAAI, Huazhong University of Science and Technology, Zhejiang University (ZJU), Beijing Institute of Technology | 2022-11-14 |
| Vision | ViT-22B | Vision | 1.9e+23 | 2023-02-10 | |
| Vision | SigLIP 400M | Vision | 4.9e+21 | Google DeepMind | 2023-03-27 |
| Vision | Segment Anything Model | Vision | 7.8e+21 | Meta AI | 2023-04-05 |
| Vision | DINOv2 | Vision | 7.4e+21 | Facebook AI Research, INRIA | 2023-04-14 |
| Vision | LLaVA-OV-72B | Multimodal, Vision | 3.0e+24 | ByteDance, Nanyang Technological University, Chinese University of Hong Kong (CUHK), Hong Kong University of Science and Technology (HKUST) | 2024-08-06 |
| Vision | Movie Gen Video | Video, Vision | 1.6e+24 | Meta AI | 2024-10-04 |
| Language and Vision | CLIP (ViT L/14@336px) | Multimodal, Vision, Language, Video | 1.0e+22 | OpenAI | 2021-01-05 |
| Language and Vision | M6-T | Multimodal, Language, Vision | 5.5e+21 | Alibaba | 2021-03-05 |
| Language and Vision | ALIGN | Multimodal, Vision, Language | 2.6e+22 | Google Research | 2021-06-11 |
| Language and Vision | Zidong Taichu | Multimodal, Speech, Vision, Language | 8.0e+20 | Chinese Academy of Sciences, Wuhan AI Computing Center | 2021-08-11 |
| Language and Vision | NÜWA | Multimodal, Vision, Image generation, Video, Language | 7.2e+21 | Microsoft Research, Peking University | 2021-11-24 |
| Language and Vision | Flamingo | Multimodal, Vision, Language, Video | 2.2e+23 | DeepMind | 2022-04-29 |
| Language and Vision | BEIT-3 | Multimodal, Vision, Language | 7.0e+19 | Microsoft | 2022-08-22 |
| Language and Vision | PaLI | Language, Vision, Multimodal | 1.7e+23 | 2022-09-14 | |
| Language and Vision | BLIP-2 (Q-Former) | Vision, Language | 1.2e+21 | Salesforce Research | 2023-01-30 |
| Language and Vision | GPT-4 | Multimodal, Language, Vision | 2.1e+25 | OpenAI | 2023-03-15 |
| Language and Vision | LLaVA | Multimodal, Vision, Language | 7.8e+22 | University of Wisconsin Madison, Microsoft Research, Columbia University | 2023-04-17 |
| Language and Vision | InstructBLIP | Multimodal, Language, Vision | 1.9e+20 | Salesforce Research, Hong Kong University of Science and Technology (HKUST), Nanyang Technological University | 2023-05-11 |
| Language and Vision | ONE-PEACE | Multimodal, Vision, Speech, Language | 1.8e+20 | Alibaba, Huazhong University of Science and Technology | 2023-05-18 |
| Language and Vision | PaLI-X | Multimodal, Language, Vision, Video | 5.6e+23 | Google Research | 2023-05-29 |
| Language and Vision | ChatGLM3-6B | Multimodal, Language, Vision | 5.0e+22 | Zhipu AI | 2023-10-27 |
| Language and Vision | LLaVA 1.5 | Multimodal, Language, Vision | 7.8e+22 | University of Wisconsin Madison, Microsoft Research | 2023-11-05 |
| Language and Vision | GPT-4 Turbo | Multimodal, Vision, Language, Image generation | 2.2e+25 | OpenAI | 2023-11-06 |
| Language and Vision | CogVLM-17B | Multimodal, Vision, Language | 6.3e+22 | Tsinghua University, Zhipu AI, Beihang University | 2023-11-06 |
| Language and Vision | Volcano 13B | Language, Multimodal, Vision | 4.6e+22 | Korea University, Korea Advanced Institute of Science and Technology (KAIST), LG | 2023-11-13 |
| Language and Vision | SPHINX (Llama 2 13B) | Vision, Language, Multimodal | 3.0e+22 | Shanghai AI Lab, Chinese University of Hong Kong (CUHK), ShanghaiTech University | 2023-11-13 |
| Language and Vision | Gemini 1.0 Pro | Multimodal, Language, Vision | 1.8e+24 | Google DeepMind | 2023-12-06 |
| Language and Vision | Gemini 1.0 Ultra | Multimodal, Language, Vision | 5.0e+25 | Google DeepMind | 2023-12-06 |
| Language and Vision | CogAgent | Vision, Language | 6.7e+22 | Tsinghua University, Zhipu AI | 2023-12-14 |
| Language and Vision | Claude 3 Opus | Multimodal, Language, Vision | 1.6e+25 | Anthropic | 2024-03-04 |
| Language and Vision | MM1-30B | Multimodal, Language, Vision | 4.9e+23 | Apple | 2024-03-14 |
| Language and Vision | Reka Core | Multimodal, Language, Vision, Video, Speech | 8.4e+24 | Reka AI | 2024-04-15 |
| Language and Vision | VILA1.5-13B | Multimodal, Language, Vision | 2.3e+21 | NVIDIA, Massachusetts Institute of Technology (MIT) | 2024-05-03 |
| Language and Vision | GPT-4o | Multimodal, Language, Audio, Speech, Vision | 3.8e+25 | OpenAI | 2024-05-13 |
| Language and Vision | OpenVLA | Robotics, Vision, Language | 1.1e+23 | Stanford University, University of California (UC) Berkeley, Toyota Research Institute, Google DeepMind, Massachusetts Institute of Technology (MIT), Physical Intelligence | 2024-06-13 |
| Language and Vision | Claude 3.5 Sonnet | Multimodal, Language, Vision | 2.7e+25 | Anthropic | 2024-06-20 |
| Language and Vision | GPT-4o mini | Language, Multimodal, Vision | 7.4e+24 | OpenAI | 2024-07-18 |
| Language and Vision | Grok-2 | Language, Vision, Multimodal | 3.0e+25 | xAI | 2024-08-13 |
| Language and Vision | Llama 3.2 11B | Multimodal, Vision, Language | 5.8e+23 | Meta AI | 2024-09-24 |
| Language and Vision | NVLM-X 72B | Vision, Language | 3.0e+24 | NVIDIA | 2024-10-22 |
| Language and Vision | NVLM-H 72B | Vision, Language | 3.0e+24 | NVIDIA | 2024-10-22 |
| Language and Vision | NVLM-D 72B | Vision, Language | 3.0e+24 | NVIDIA | 2024-10-22 |
| Language and Vision | Amazon Nova Pro | Multimodal, Language, Video, Vision | 6.0e+24 | Amazon | 2024-12-03 |
| Language and Vision | Eagle 2 | Vision, Robotics, Language | 4.7e+22 | NVIDIA, Nanjing University, Tsinghua University, Hong Kong Polytechnic University, Johns Hopkins University, New York University (NYU) | 2025-01-20 |
| Language and Vision | Grok 3 | Language, Vision, Multimodal | 3.5e+26 | xAI | 2025-02-17 |
| Language and Vision | Claude 3.7 Sonnet | Language, Vision, Multimodal | 3.3e+25 | Anthropic | 2025-02-24 |
| Language and Vision | GPT-4.5 | Language, Vision, Multimodal | 2.1e+26 | OpenAI | 2025-02-27 |
| Language and Vision | Llama 4 Scout | Multimodal, Language, Vision | 4.1e+24 | Meta AI | 2025-04-05 |
| Language and Vision | Llama 4 Maverick | Multimodal, Language, Vision | 2.2e+24 | Meta AI | 2025-04-05 |
| Language and Vision | Llama 4 Behemoth (preview) | Multimodal, Language, Vision | 5.2e+25 | Meta AI | 2025-04-05 |
| Language and Vision | Seed1.5-VL | Vision, Language, Multimodal, Video | 1.4e+24 | ByteDance | 2025-05-11 |
| Language and Vision | Grok 4 | Language, Multimodal, Vision, Speech | 5.0e+26 | xAI | 2025-07-09 |
Epoch's work is free to use, distribute, and reproduce provided the source and authors are credited under the Creative Commons BY license.

