Volver al ranking

Similares a μTransfer: Tuning GPT-3 hyperparameters on one GPU | Explained by the inventor

20 vecinos (text_768) · 1.6K views · Edward Hu ·

μTransfer: Tuning GPT-3 hyperparameters on one GPU | Explained by the inventor

Edward Hu

@edwardjhu

1.6K
3Let's Build Pipeline Parallelism from Scratch – Tutorial

freeCodeCamp.org

@freecodecamp

Estados Unidos88
13Lec 20. Scaling Laws

MIT OpenCourseWare

@mitocw

Estados Unidos86
14Lec 18. Transfer Learning: Models

MIT OpenCourseWare

@mitocw

Estados Unidos86
18China Just Dropped 1 Trillion Parameter AI Model That Shocks OpenAI

AI Revolution

@airevolutionx

113.2KEstados Unidos86
12Google TPU 8t and 8i is here..

Caleb Writes Code

@calebwritescode

61.8KEstados Unidos86
15making computers multiply FASTER! (matrix hacking)

LaurieWired

@lauriewired

45.5KEstados Unidos86
9I built a GPT model in 10 hours

Looking Glass Universe

@lookingglassuniverse

18.1K86
1710: Generative AI – Adapting LLMs with Parameter-Efficient Fine-Tuning

MIT OpenCourseWare

@mitocw

9.3KEstados Unidos86
10Lec 07. Scaling Rules for Optimization

MIT OpenCourseWare

@mitocw

5.9KEstados Unidos86
1Hyperparameter Tuning Tips that 99% of Data Scientists Overlook

Rob Mulla

@robmulla

5.7KEstados Unidos88
2Stanford CS25: Transformers United V6 I The Ultra-Scale Talk: Scaling Training to Thousands of GPUs

Stanford Online

@stanfordonline

4.6KEstados Unidos88
7Keras 3 Distributed Training: Scaling Models with JAX using DataParallel, and ModelParallel

Google for Developers

@googledevelopers

3.1KEstados Unidos86
8LoRA - Explained!

CodeEmporium

@codeemporium

1.3KEstados Unidos86
19How We Cut LLM Latency 70% With TensorRT in Production

MLOps.community

@mlops

697Reino Unido86
20NVIDIA DGX Spark™ Review: Better Than Renting an H100? (2026)

Savage Reviews

@savagereviewsofficial

563Estados Unidos86
6LLM (Parameter Efficient) Fine Tuning - Explained!

CodeEmporium

@codeemporium

558Estados Unidos86
11I built GPT-2 for $31.99

Looking Glass Universe

@lookingglassuniverse

43986
4Fixing GPU Starvation in Large-Scale Distributed Training

MLOps.community

@mlops

321Reino Unido87
5NVIDIA TensorRT-LLM GitHub: Accelerate LLM Inference on NVIDIA GPUs

Alex Hitt

@alexander-hitt

123Estados Unidos86
16"ChatGPT Showdown: Unraveling the Key Differences Between GPT-3 and GPT-4 for AI Enthusiasts"

Avtarit Arora

@avtarit

0Estados Unidos86