| ★ | μTransfer: Tuning GPT-3 hyperparameters on one GPU | Explained by the inventor | | 1.6K | — | |
| 3 | Let's Build Pipeline Parallelism from Scratch – Tutorial | freeCodeCamp.org @freecodecamp | — | Estados Unidos | 88 |
| 13 | Lec 20. Scaling Laws | MIT OpenCourseWare @mitocw | — | Estados Unidos | 86 |
| 14 | Lec 18. Transfer Learning: Models | MIT OpenCourseWare @mitocw | — | Estados Unidos | 86 |
| 18 | China Just Dropped 1 Trillion Parameter AI Model That Shocks OpenAI | AI Revolution @airevolutionx | 113.2K | Estados Unidos | 86 |
| 12 | Google TPU 8t and 8i is here.. | Caleb Writes Code @calebwritescode | 61.8K | Estados Unidos | 86 |
| 15 | making computers multiply FASTER! (matrix hacking) | | 45.5K | Estados Unidos | 86 |
| 9 | I built a GPT model in 10 hours | Looking Glass Universe @lookingglassuniverse | 18.1K | — | 86 |
| 17 | 10: Generative AI – Adapting LLMs with Parameter-Efficient Fine-Tuning | MIT OpenCourseWare @mitocw | 9.3K | Estados Unidos | 86 |
| 10 | Lec 07. Scaling Rules for Optimization | MIT OpenCourseWare @mitocw | 5.9K | Estados Unidos | 86 |
| 1 | Hyperparameter Tuning Tips that 99% of Data Scientists Overlook | | 5.7K | Estados Unidos | 88 |
| 2 | Stanford CS25: Transformers United V6 I The Ultra-Scale Talk: Scaling Training to Thousands of GPUs | Stanford Online @stanfordonline | 4.6K | Estados Unidos | 88 |
| 7 | Keras 3 Distributed Training: Scaling Models with JAX using DataParallel, and ModelParallel | Google for Developers @googledevelopers | 3.1K | Estados Unidos | 86 |
| 8 | LoRA - Explained! | CodeEmporium @codeemporium | 1.3K | Estados Unidos | 86 |
| 19 | How We Cut LLM Latency 70% With TensorRT in Production | | 697 | Reino Unido | 86 |
| 20 | NVIDIA DGX Spark™ Review: Better Than Renting an H100? (2026) | Savage Reviews @savagereviewsofficial | 563 | Estados Unidos | 86 |
| 6 | LLM (Parameter Efficient) Fine Tuning - Explained! | CodeEmporium @codeemporium | 558 | Estados Unidos | 86 |
| 11 | I built GPT-2 for $31.99 | Looking Glass Universe @lookingglassuniverse | 439 | — | 86 |
| 4 | Fixing GPU Starvation in Large-Scale Distributed Training | | 321 | Reino Unido | 87 |
| 5 | NVIDIA TensorRT-LLM GitHub: Accelerate LLM Inference on NVIDIA GPUs | | 123 | Estados Unidos | 86 |
| 16 | "ChatGPT Showdown: Unraveling the Key Differences Between GPT-3 and GPT-4 for AI Enthusiasts" | | 0 | Estados Unidos | 86 |