-
Kimi K3: Open Frontier Intelligence
Paper • 2607.24653 • Published • 486 -
Efficient Memory Management for Large Language Model Serving with PagedAttention
Paper • 2309.06180 • Published • 65 -
Language Models are Few-Shot Learners
Paper • 2005.14165 • Published • 20 -
Attention Is All You Need
Paper • 1706.03762 • Published • 136
Collections
Discover the best community collections!
Collections including paper arxiv:2005.14165
-
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
Paper • 2602.10693 • Published • 222 -
Reinforced Attention Learning
Paper • 2602.04884 • Published • 30 -
Learning to Reason in 13 Parameters
Paper • 2602.04118 • Published • 6 -
LoRA-XS: Low-Rank Adaptation with Extremely Small Number of Parameters
Paper • 2405.17604 • Published • 3
-
deepseek-ai/DeepSeek-R1
Text Generation • 685B • Updated • 8.69M • • 13.6k -
Qwen/Qwen2.5-Coder-32B-Instruct
Text Generation • 33B • Updated • 1.13M • • 2.1k -
google/gemma-2-27b-it
Text Generation • 27B • Updated • 114k • • 568 -
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
Paper • 2201.11903 • Published • 15
-
Language Models are Few-Shot Learners
Paper • 2005.14165 • Published • 20 -
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Paper • 1810.04805 • Published • 32 -
Attention Is All You Need
Paper • 1706.03762 • Published • 136 -
Lookahead Anchoring: Preserving Character Identity in Audio-Driven Human Animation
Paper • 2510.23581 • Published • 42
-
Attention Is All You Need
Paper • 1706.03762 • Published • 136 -
PyTorch: An Imperative Style, High-Performance Deep Learning Library
Paper • 1912.01703 • Published • 2 -
google-bert/bert-base-uncased
Fill-Mask • 0.1B • Updated • 116M • • 2.73k -
openai-community/gpt2
Text Generation • 0.1B • Updated • 12.8M • 3.39k
-
LoRA: Low-Rank Adaptation of Large Language Models
Paper • 2106.09685 • Published • 64 -
FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
Paper • 2205.14135 • Published • 15 -
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
Paper • 2201.11903 • Published • 15 -
Training language models to follow instructions with human feedback
Paper • 2203.02155 • Published • 25
-
Language Models are Few-Shot Learners
Paper • 2005.14165 • Published • 20 -
Evaluating Large Language Models Trained on Code
Paper • 2107.03374 • Published • 11 -
Training language models to follow instructions with human feedback
Paper • 2203.02155 • Published • 25 -
GPT-4 Technical Report
Paper • 2303.08774 • Published • 7
-
Attention Is All You Need
Paper • 1706.03762 • Published • 136 -
Language Models are Few-Shot Learners
Paper • 2005.14165 • Published • 20 -
LLaMA: Open and Efficient Foundation Language Models
Paper • 2302.13971 • Published • 25 -
Llama 2: Open Foundation and Fine-Tuned Chat Models
Paper • 2307.09288 • Published • 252
-
Neural Machine Translation by Jointly Learning to Align and Translate
Paper • 1409.0473 • Published • 7 -
Attention Is All You Need
Paper • 1706.03762 • Published • 136 -
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Paper • 1810.04805 • Published • 32 -
Hierarchical Reasoning Model
Paper • 2506.21734 • Published • 54
-
Kimi K3: Open Frontier Intelligence
Paper • 2607.24653 • Published • 486 -
Efficient Memory Management for Large Language Model Serving with PagedAttention
Paper • 2309.06180 • Published • 65 -
Language Models are Few-Shot Learners
Paper • 2005.14165 • Published • 20 -
Attention Is All You Need
Paper • 1706.03762 • Published • 136
-
Attention Is All You Need
Paper • 1706.03762 • Published • 136 -
PyTorch: An Imperative Style, High-Performance Deep Learning Library
Paper • 1912.01703 • Published • 2 -
google-bert/bert-base-uncased
Fill-Mask • 0.1B • Updated • 116M • • 2.73k -
openai-community/gpt2
Text Generation • 0.1B • Updated • 12.8M • 3.39k
-
LoRA: Low-Rank Adaptation of Large Language Models
Paper • 2106.09685 • Published • 64 -
FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
Paper • 2205.14135 • Published • 15 -
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
Paper • 2201.11903 • Published • 15 -
Training language models to follow instructions with human feedback
Paper • 2203.02155 • Published • 25
-
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
Paper • 2602.10693 • Published • 222 -
Reinforced Attention Learning
Paper • 2602.04884 • Published • 30 -
Learning to Reason in 13 Parameters
Paper • 2602.04118 • Published • 6 -
LoRA-XS: Low-Rank Adaptation with Extremely Small Number of Parameters
Paper • 2405.17604 • Published • 3
-
Language Models are Few-Shot Learners
Paper • 2005.14165 • Published • 20 -
Evaluating Large Language Models Trained on Code
Paper • 2107.03374 • Published • 11 -
Training language models to follow instructions with human feedback
Paper • 2203.02155 • Published • 25 -
GPT-4 Technical Report
Paper • 2303.08774 • Published • 7
-
deepseek-ai/DeepSeek-R1
Text Generation • 685B • Updated • 8.69M • • 13.6k -
Qwen/Qwen2.5-Coder-32B-Instruct
Text Generation • 33B • Updated • 1.13M • • 2.1k -
google/gemma-2-27b-it
Text Generation • 27B • Updated • 114k • • 568 -
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
Paper • 2201.11903 • Published • 15
-
Attention Is All You Need
Paper • 1706.03762 • Published • 136 -
Language Models are Few-Shot Learners
Paper • 2005.14165 • Published • 20 -
LLaMA: Open and Efficient Foundation Language Models
Paper • 2302.13971 • Published • 25 -
Llama 2: Open Foundation and Fine-Tuned Chat Models
Paper • 2307.09288 • Published • 252
-
Language Models are Few-Shot Learners
Paper • 2005.14165 • Published • 20 -
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Paper • 1810.04805 • Published • 32 -
Attention Is All You Need
Paper • 1706.03762 • Published • 136 -
Lookahead Anchoring: Preserving Character Identity in Audio-Driven Human Animation
Paper • 2510.23581 • Published • 42
-
Neural Machine Translation by Jointly Learning to Align and Translate
Paper • 1409.0473 • Published • 7 -
Attention Is All You Need
Paper • 1706.03762 • Published • 136 -
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Paper • 1810.04805 • Published • 32 -
Hierarchical Reasoning Model
Paper • 2506.21734 • Published • 54