-
Attention Is All You Need
Paper • 1706.03762 • Published • 139 -
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Paper • 1810.04805 • Published • 32 -
DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter
Paper • 1910.01108 • Published • 23 -
Language Models are Few-Shot Learners
Paper • 2005.14165 • Published • 21
Collections
Discover the best community collections!
Collections including paper arxiv:2403.08295
-
Qwen/Qwen3-8B
Text Generation • 8B • Updated • 15.8M • • 1.3k -
Qwen/Qwen3-4B
Text Generation • 4B • Updated • 4.79M • • 682 -
Qwen/Qwen3-0.6B
Text Generation • 0.8B • Updated • 28.8M • • 1.52k -
google/gemma-3-4b-it
Image-Text-to-Text • 4B • Updated • 1.27M • • 1.46k
-
Mamba: Linear-Time Sequence Modeling with Selective State Spaces
Paper • 2312.00752 • Published • 153 -
Elucidating the Design Space of Diffusion-Based Generative Models
Paper • 2206.00364 • Published • 18 -
GLU Variants Improve Transformer
Paper • 2002.05202 • Published • 5 -
StarCoder 2 and The Stack v2: The Next Generation
Paper • 2402.19173 • Published • 160
-
An Interdisciplinary Comparison of Sequence Modeling Methods for Next-Element Prediction
Paper • 1811.00062 • Published • 2 -
mT5: A massively multilingual pre-trained text-to-text transformer
Paper • 2010.11934 • Published • 5 -
Bootstrap Your Own Skills: Learning to Solve New Tasks with Large Language Model Guidance
Paper • 2310.10021 • Published • 2 -
Gemma: Open Models Based on Gemini Research and Technology
Paper • 2403.08295 • Published • 52
-
Attention Is All You Need
Paper • 1706.03762 • Published • 139 -
PyTorch: An Imperative Style, High-Performance Deep Learning Library
Paper • 1912.01703 • Published • 2 -
google-bert/bert-base-uncased
Fill-Mask • 0.1B • Updated • 111M • • 2.74k -
openai-community/gpt2
Text Generation • 0.1B • Updated • 13.9M • 3.41k
-
Qwen2.5 Technical Report
Paper • 2412.15115 • Published • 381 -
Qwen2.5-Coder Technical Report
Paper • 2409.12186 • Published • 159 -
Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement
Paper • 2409.12122 • Published • 5 -
Qwen2.5-VL Technical Report
Paper • 2502.13923 • Published • 218
-
Gemma: Open Models Based on Gemini Research and Technology
Paper • 2403.08295 • Published • 52 -
LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models
Paper • 2403.13372 • Published • 187 -
Branch-Train-MiX: Mixing Expert LLMs into a Mixture-of-Experts LLM
Paper • 2403.07816 • Published • 45 -
MEGAVERSE: Benchmarking Large Language Models Across Languages, Modalities, Models and Tasks
Paper • 2311.07463 • Published • 14
-
Scaling Instruction-Finetuned Language Models
Paper • 2210.11416 • Published • 8 -
Mamba: Linear-Time Sequence Modeling with Selective State Spaces
Paper • 2312.00752 • Published • 153 -
Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context
Paper • 2403.05530 • Published • 65 -
Yi: Open Foundation Models by 01.AI
Paper • 2403.04652 • Published • 66
-
Attention Is All You Need
Paper • 1706.03762 • Published • 139 -
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Paper • 1810.04805 • Published • 32 -
DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter
Paper • 1910.01108 • Published • 23 -
Language Models are Few-Shot Learners
Paper • 2005.14165 • Published • 21
-
Attention Is All You Need
Paper • 1706.03762 • Published • 139 -
PyTorch: An Imperative Style, High-Performance Deep Learning Library
Paper • 1912.01703 • Published • 2 -
google-bert/bert-base-uncased
Fill-Mask • 0.1B • Updated • 111M • • 2.74k -
openai-community/gpt2
Text Generation • 0.1B • Updated • 13.9M • 3.41k
-
Qwen/Qwen3-8B
Text Generation • 8B • Updated • 15.8M • • 1.3k -
Qwen/Qwen3-4B
Text Generation • 4B • Updated • 4.79M • • 682 -
Qwen/Qwen3-0.6B
Text Generation • 0.8B • Updated • 28.8M • • 1.52k -
google/gemma-3-4b-it
Image-Text-to-Text • 4B • Updated • 1.27M • • 1.46k
-
Qwen2.5 Technical Report
Paper • 2412.15115 • Published • 381 -
Qwen2.5-Coder Technical Report
Paper • 2409.12186 • Published • 159 -
Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement
Paper • 2409.12122 • Published • 5 -
Qwen2.5-VL Technical Report
Paper • 2502.13923 • Published • 218
-
Mamba: Linear-Time Sequence Modeling with Selective State Spaces
Paper • 2312.00752 • Published • 153 -
Elucidating the Design Space of Diffusion-Based Generative Models
Paper • 2206.00364 • Published • 18 -
GLU Variants Improve Transformer
Paper • 2002.05202 • Published • 5 -
StarCoder 2 and The Stack v2: The Next Generation
Paper • 2402.19173 • Published • 160
-
Gemma: Open Models Based on Gemini Research and Technology
Paper • 2403.08295 • Published • 52 -
LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models
Paper • 2403.13372 • Published • 187 -
Branch-Train-MiX: Mixing Expert LLMs into a Mixture-of-Experts LLM
Paper • 2403.07816 • Published • 45 -
MEGAVERSE: Benchmarking Large Language Models Across Languages, Modalities, Models and Tasks
Paper • 2311.07463 • Published • 14
-
An Interdisciplinary Comparison of Sequence Modeling Methods for Next-Element Prediction
Paper • 1811.00062 • Published • 2 -
mT5: A massively multilingual pre-trained text-to-text transformer
Paper • 2010.11934 • Published • 5 -
Bootstrap Your Own Skills: Learning to Solve New Tasks with Large Language Model Guidance
Paper • 2310.10021 • Published • 2 -
Gemma: Open Models Based on Gemini Research and Technology
Paper • 2403.08295 • Published • 52
-
Scaling Instruction-Finetuned Language Models
Paper • 2210.11416 • Published • 8 -
Mamba: Linear-Time Sequence Modeling with Selective State Spaces
Paper • 2312.00752 • Published • 153 -
Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context
Paper • 2403.05530 • Published • 65 -
Yi: Open Foundation Models by 01.AI
Paper • 2403.04652 • Published • 66