Huggingface Accelerate — 最简分布式训练 API
最简分布式训练 API
Axolotl — Axolotl:基于 YAML 的 LLM 微调(LoRA、DPO、GRPO)
Axolotl:基于 YAML 的 LLM 微调(LoRA、DPO、GRPO)
Chroma — 面向 AI 应用的开源 embedding 数据库
面向 AI 应用的开源 embedding 数据库
Clip — OpenAI 连接视觉与语言的模型
OpenAI 连接视觉与语言的模型
Dspy — DSPy:声明式 LM 程序、自动优化提示、RAG
DSPy:声明式 LM 程序、自动优化提示、RAG
Evaluating Llms Harness — lm-eval-harness:对 LLM 跑基准(MMLU、GSM8K 等)
lm-eval-harness:对 LLM 跑基准(MMLU、GSM8K 等)
Faiss — Facebook 用于高效相似性搜索和密集向量聚类的库
Facebook 用于高效相似性搜索和密集向量聚类的库
优化注意力 Flash
通过 Flash Attention 优化 Transformer 注意力机制,实现 2-4 倍加速和 10-20 倍内存减少
指导
使用正则表达式和语法控制 LLM 输出,保证生成有效的 JSON/XML/代码,强制结构化格式,并使用 Guidance(微软研究院的约束生成框架)构建多步骤工作流...
Huggingface Hub — HuggingFace hf CLI:搜索/下载/上传模型与数据集
HuggingFace hf CLI:搜索/下载/上传模型与数据集
Huggingface Tokenizers — 为研究和生产优化的快速 tokenizer
为研究和生产优化的快速 tokenizer
讲师
使用 Pydantic 验证从 LLM 响应中提取结构化数据,自动重试失败的提取,以类型安全方式解析复杂 JSON,并使用 Instructor 流式传输部分结果——经过实战检验的结构化输出库
Lambda Labs Gpu Cloud — 用于 ML 训练和推理的预留及按需 GPU 云实例
用于 ML 训练和推理的预留及按需 GPU 云实例
Llama Cpp — llama.cpp 本地 GGUF 推理 + HF Hub 模型发现
llama.cpp 本地 GGUF 推理 + HF Hub 模型发现
Llava — 大型语言与视觉助手
大型语言与视觉助手
Modal Serverless Gpu — 用于运行 ML 工作负载的无服务器 GPU 云平台
用于运行 ML 工作负载的无服务器 GPU 云平台
Nemo Curator — 用于 LLM 训练的 GPU 加速数据整理工具
用于 LLM 训练的 GPU 加速数据整理工具
Obliteratus — OBLITERATUS:消除 LLM 拒答(diff-in-means)
OBLITERATUS:消除 LLM 拒答(diff-in-means)
Outlines — Outlines:结构化 JSON/regex/Pydantic LLM 生成
Outlines:结构化 JSON/regex/Pydantic LLM 生成
Peft Fine Tuning — 使用 LoRA、QLoRA 及 25+ 种方法对 LLM 进行参数高效微调
使用 LoRA、QLoRA 及 25+ 种方法对 LLM 进行参数高效微调
Pinecone — 面向生产级 AI 应用的托管向量数据库
面向生产级 AI 应用的托管向量数据库
PyTorch FSDP
PyTorch FSDP 全分片数据并行训练专家指导 - 参数分片、混合精度、CPU 卸载、FSDP2
PyTorch Lightning
基于 PyTorch 的高层框架,提供 Trainer 类、自动分布式训练(DDP/FSDP/DeepSpeed)、回调系统及极简样板代码
Qdrant Vector Search — 用于 RAG 和语义搜索的高性能向量相似度搜索引擎
用于 RAG 和语义搜索的高性能向量相似度搜索引擎
稀疏自编码器训练
提供使用 SAELens 训练和分析稀疏自编码器(SAE)的指导,将神经网络激活分解为可解释特征
Segment Anything Model — SAM:通过点、框、掩码实现零样本图像分割
SAM:通过点、框、掩码实现零样本图像分割
Serving Llms Vllm — vLLM:高吞吐 LLM 服务、OpenAI API、量化
vLLM:高吞吐 LLM 服务、OpenAI API、量化
Simpo 训练 — 用于 LLM 对齐的简单偏好优化
用于 LLM 对齐的简单偏好优化
Slime Rl Training — 使用 slime(Megatron+SGLang 框架)进行 LLM RL 后训练的指导
使用 slime(Megatron+SGLang 框架)进行 LLM RL 后训练的指导
Stable Diffusion 图像生成
通过 HuggingFace Diffusers 使用 Stable Diffusion 模型实现最先进的文本到图像生成
Tensorrt Llm — 使用 NVIDIA TensorRT 优化 LLM 推理以实现最大吞吐量和最低延迟
使用 NVIDIA TensorRT 优化 LLM 推理以实现最大吞吐量和最低延迟
Torchtitan — 分布式 LLM 预训练
使用 torchtitan 提供 PyTorch 原生分布式 LLM 预训练,支持 4D 并行(FSDP2、TP、PP、CP)
使用 TRL 进行微调 — TRL:面向 LLM RLHF 的 SFT、DPO、PPO、GRPO 及奖励建模
TRL:面向 LLM RLHF 的 SFT、DPO、PPO、GRPO 及奖励建模
Unsloth — Unsloth:2-5倍更快的 LoRA/QLoRA 微调,更少显存
Unsloth:2-5倍更快的 LoRA/QLoRA 微调,更少显存
Weights And Biases — W&B:记录 ML 实验、sweep、模型注册表、仪表盘
W&B:记录 ML 实验、sweep、模型注册表、仪表盘
Whisper — OpenAI 的通用语音识别模型
OpenAI 的通用语音识别模型