-
Attention Is All You Need
Paper β’ 1706.03762 β’ Published β’ 134 -
PyTorch: An Imperative Style, High-Performance Deep Learning Library
Paper β’ 1912.01703 β’ Published β’ 2 -
google-bert/bert-base-uncased
Fill-Mask β’ 0.1B β’ Updated β’ 104M β’ β’ 2.72k -
openai-community/gpt2
Text Generation β’ 0.1B β’ Updated β’ 13.7M β’ 3.38k
Collections
Discover the best community collections!
Collections including paper arxiv:2001.08361
-
Neural Machine Translation by Jointly Learning to Align and Translate
Paper β’ 1409.0473 β’ Published β’ 7 -
Attention Is All You Need
Paper β’ 1706.03762 β’ Published β’ 134 -
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Paper β’ 1810.04805 β’ Published β’ 32 -
Hierarchical Reasoning Model
Paper β’ 2506.21734 β’ Published β’ 54
-
Scaling Autoregressive Models for Content-Rich Text-to-Image Generation
Paper β’ 2206.10789 β’ Published β’ 4 -
Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws
Paper β’ 2401.00448 β’ Published β’ 31 -
Training Compute-Optimal Large Language Models
Paper β’ 2203.15556 β’ Published β’ 12 -
Scaling Laws for Neural Language Models
Paper β’ 2001.08361 β’ Published β’ 10
-
Concrete Problems in AI Safety
Paper β’ 1606.06565 β’ Published β’ 1 -
The Off-Switch Game
Paper β’ 1611.08219 β’ Published β’ 1 -
Learning to summarize from human feedback
Paper β’ 2009.01325 β’ Published β’ 4 -
Truthful AI: Developing and governing AI that does not lie
Paper β’ 2110.06674 β’ Published β’ 1
-
Attention Is All You Need
Paper β’ 1706.03762 β’ Published β’ 134 -
Scaling Laws for Neural Language Models
Paper β’ 2001.08361 β’ Published β’ 10 -
RoFormer: Enhanced Transformer with Rotary Position Embedding
Paper β’ 2104.09864 β’ Published β’ 18 -
LoRA Learns Less and Forgets Less
Paper β’ 2405.09673 β’ Published β’ 90
-
Attention Is All You Need
Paper β’ 1706.03762 β’ Published β’ 134 -
Scaling Laws for Neural Language Models
Paper β’ 2001.08361 β’ Published β’ 10 -
Training Compute-Optimal Large Language Models
Paper β’ 2203.15556 β’ Published β’ 12 -
Analogy Generation by Prompting Large Language Models: A Case Study of InstructGPT
Paper β’ 2210.04186 β’ Published
-
Scaling Laws for Neural Language Models
Paper β’ 2001.08361 β’ Published β’ 10 -
Scaling Laws for Autoregressive Generative Modeling
Paper β’ 2010.14701 β’ Published β’ 1 -
Training Compute-Optimal Large Language Models
Paper β’ 2203.15556 β’ Published β’ 12 -
A Survey on Data Selection for Language Models
Paper β’ 2402.16827 β’ Published β’ 4
-
STaR: Bootstrapping Reasoning With Reasoning
Paper β’ 2203.14465 β’ Published β’ 9 -
Scaling Laws for Neural Language Models
Paper β’ 2001.08361 β’ Published β’ 10 -
Byte Latent Transformer: Patches Scale Better Than Tokens
Paper β’ 2412.09871 β’ Published β’ 109 -
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Paper β’ 2501.12948 β’ Published β’ 458
-
Recurrent Neural Network Regularization
Paper β’ 1409.2329 β’ Published β’ 1 -
Pointer Networks
Paper β’ 1506.03134 β’ Published β’ 1 -
Order Matters: Sequence to sequence for sets
Paper β’ 1511.06391 β’ Published β’ 1 -
GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism
Paper β’ 1811.06965 β’ Published β’ 1
-
Attention Is All You Need
Paper β’ 1706.03762 β’ Published β’ 134 -
PyTorch: An Imperative Style, High-Performance Deep Learning Library
Paper β’ 1912.01703 β’ Published β’ 2 -
google-bert/bert-base-uncased
Fill-Mask β’ 0.1B β’ Updated β’ 104M β’ β’ 2.72k -
openai-community/gpt2
Text Generation β’ 0.1B β’ Updated β’ 13.7M β’ 3.38k
-
Attention Is All You Need
Paper β’ 1706.03762 β’ Published β’ 134 -
Scaling Laws for Neural Language Models
Paper β’ 2001.08361 β’ Published β’ 10 -
Training Compute-Optimal Large Language Models
Paper β’ 2203.15556 β’ Published β’ 12 -
Analogy Generation by Prompting Large Language Models: A Case Study of InstructGPT
Paper β’ 2210.04186 β’ Published
-
Neural Machine Translation by Jointly Learning to Align and Translate
Paper β’ 1409.0473 β’ Published β’ 7 -
Attention Is All You Need
Paper β’ 1706.03762 β’ Published β’ 134 -
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Paper β’ 1810.04805 β’ Published β’ 32 -
Hierarchical Reasoning Model
Paper β’ 2506.21734 β’ Published β’ 54
-
Scaling Autoregressive Models for Content-Rich Text-to-Image Generation
Paper β’ 2206.10789 β’ Published β’ 4 -
Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws
Paper β’ 2401.00448 β’ Published β’ 31 -
Training Compute-Optimal Large Language Models
Paper β’ 2203.15556 β’ Published β’ 12 -
Scaling Laws for Neural Language Models
Paper β’ 2001.08361 β’ Published β’ 10
-
Scaling Laws for Neural Language Models
Paper β’ 2001.08361 β’ Published β’ 10 -
Scaling Laws for Autoregressive Generative Modeling
Paper β’ 2010.14701 β’ Published β’ 1 -
Training Compute-Optimal Large Language Models
Paper β’ 2203.15556 β’ Published β’ 12 -
A Survey on Data Selection for Language Models
Paper β’ 2402.16827 β’ Published β’ 4
-
Concrete Problems in AI Safety
Paper β’ 1606.06565 β’ Published β’ 1 -
The Off-Switch Game
Paper β’ 1611.08219 β’ Published β’ 1 -
Learning to summarize from human feedback
Paper β’ 2009.01325 β’ Published β’ 4 -
Truthful AI: Developing and governing AI that does not lie
Paper β’ 2110.06674 β’ Published β’ 1
-
STaR: Bootstrapping Reasoning With Reasoning
Paper β’ 2203.14465 β’ Published β’ 9 -
Scaling Laws for Neural Language Models
Paper β’ 2001.08361 β’ Published β’ 10 -
Byte Latent Transformer: Patches Scale Better Than Tokens
Paper β’ 2412.09871 β’ Published β’ 109 -
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Paper β’ 2501.12948 β’ Published β’ 458
-
Attention Is All You Need
Paper β’ 1706.03762 β’ Published β’ 134 -
Scaling Laws for Neural Language Models
Paper β’ 2001.08361 β’ Published β’ 10 -
RoFormer: Enhanced Transformer with Rotary Position Embedding
Paper β’ 2104.09864 β’ Published β’ 18 -
LoRA Learns Less and Forgets Less
Paper β’ 2405.09673 β’ Published β’ 90
-
Recurrent Neural Network Regularization
Paper β’ 1409.2329 β’ Published β’ 1 -
Pointer Networks
Paper β’ 1506.03134 β’ Published β’ 1 -
Order Matters: Sequence to sequence for sets
Paper β’ 1511.06391 β’ Published β’ 1 -
GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism
Paper β’ 1811.06965 β’ Published β’ 1