📝

Huggingface Accelerate — 最简分布式训练 API

最简分布式训练 API

📝

Axolotl — Axolotl:基于 YAML 的 LLM 微调(LoRA、DPO、GRPO)

Axolotl:基于 YAML 的 LLM 微调(LoRA、DPO、GRPO)

📝

Chroma — 面向 AI 应用的开源 embedding 数据库

面向 AI 应用的开源 embedding 数据库

📝

Clip — OpenAI 连接视觉与语言的模型

OpenAI 连接视觉与语言的模型

📝

Dspy — DSPy:声明式 LM 程序、自动优化提示、RAG

DSPy:声明式 LM 程序、自动优化提示、RAG

📝

Evaluating Llms Harness — lm-eval-harness:对 LLM 跑基准(MMLU、GSM8K 等)

lm-eval-harness:对 LLM 跑基准(MMLU、GSM8K 等)

📝

Faiss — Facebook 用于高效相似性搜索和密集向量聚类的库

Facebook 用于高效相似性搜索和密集向量聚类的库

📝

优化注意力 Flash

通过 Flash Attention 优化 Transformer 注意力机制,实现 2-4 倍加速和 10-20 倍内存减少

📝

指导

使用正则表达式和语法控制 LLM 输出,保证生成有效的 JSON/XML/代码,强制结构化格式,并使用 Guidance(微软研究院的约束生成框架)构建多步骤工作流...

📝

Huggingface Hub — HuggingFace hf CLI:搜索/下载/上传模型与数据集

HuggingFace hf CLI:搜索/下载/上传模型与数据集

📝

Huggingface Tokenizers — 为研究和生产优化的快速 tokenizer

为研究和生产优化的快速 tokenizer

📝

讲师

使用 Pydantic 验证从 LLM 响应中提取结构化数据,自动重试失败的提取,以类型安全方式解析复杂 JSON,并使用 Instructor 流式传输部分结果——经过实战检验的结构化输出库

📝

Lambda Labs Gpu Cloud — 用于 ML 训练和推理的预留及按需 GPU 云实例

用于 ML 训练和推理的预留及按需 GPU 云实例

📝

Llama Cpp — llama.cpp 本地 GGUF 推理 + HF Hub 模型发现

llama.cpp 本地 GGUF 推理 + HF Hub 模型发现

📝

Llava — 大型语言与视觉助手

大型语言与视觉助手

📝

Modal Serverless Gpu — 用于运行 ML 工作负载的无服务器 GPU 云平台

用于运行 ML 工作负载的无服务器 GPU 云平台

📝

Nemo Curator — 用于 LLM 训练的 GPU 加速数据整理工具

用于 LLM 训练的 GPU 加速数据整理工具

📝

Obliteratus — OBLITERATUS:消除 LLM 拒答(diff-in-means)

OBLITERATUS:消除 LLM 拒答(diff-in-means)

📝

Outlines — Outlines:结构化 JSON/regex/Pydantic LLM 生成

Outlines:结构化 JSON/regex/Pydantic LLM 生成

📝

Peft Fine Tuning — 使用 LoRA、QLoRA 及 25+ 种方法对 LLM 进行参数高效微调

使用 LoRA、QLoRA 及 25+ 种方法对 LLM 进行参数高效微调

📝

Pinecone — 面向生产级 AI 应用的托管向量数据库

面向生产级 AI 应用的托管向量数据库

📝

PyTorch FSDP

PyTorch FSDP 全分片数据并行训练专家指导 - 参数分片、混合精度、CPU 卸载、FSDP2

📝

PyTorch Lightning

基于 PyTorch 的高层框架,提供 Trainer 类、自动分布式训练(DDP/FSDP/DeepSpeed)、回调系统及极简样板代码

📝

Qdrant Vector Search — 用于 RAG 和语义搜索的高性能向量相似度搜索引擎

用于 RAG 和语义搜索的高性能向量相似度搜索引擎

📝

稀疏自编码器训练

提供使用 SAELens 训练和分析稀疏自编码器(SAE)的指导,将神经网络激活分解为可解释特征

📝

Segment Anything Model — SAM:通过点、框、掩码实现零样本图像分割

SAM:通过点、框、掩码实现零样本图像分割

📝

Serving Llms Vllm — vLLM:高吞吐 LLM 服务、OpenAI API、量化

vLLM:高吞吐 LLM 服务、OpenAI API、量化

📝

Simpo 训练 — 用于 LLM 对齐的简单偏好优化

用于 LLM 对齐的简单偏好优化

📝

Slime Rl Training — 使用 slime(Megatron+SGLang 框架)进行 LLM RL 后训练的指导

使用 slime(Megatron+SGLang 框架)进行 LLM RL 后训练的指导

📝

Stable Diffusion 图像生成

通过 HuggingFace Diffusers 使用 Stable Diffusion 模型实现最先进的文本到图像生成

📝

Tensorrt Llm — 使用 NVIDIA TensorRT 优化 LLM 推理以实现最大吞吐量和最低延迟

使用 NVIDIA TensorRT 优化 LLM 推理以实现最大吞吐量和最低延迟

📝

Torchtitan — 分布式 LLM 预训练

使用 torchtitan 提供 PyTorch 原生分布式 LLM 预训练,支持 4D 并行(FSDP2、TP、PP、CP)

📝

使用 TRL 进行微调 — TRL:面向 LLM RLHF 的 SFT、DPO、PPO、GRPO 及奖励建模

TRL:面向 LLM RLHF 的 SFT、DPO、PPO、GRPO 及奖励建模

📝

Unsloth — Unsloth:2-5倍更快的 LoRA/QLoRA 微调,更少显存

Unsloth:2-5倍更快的 LoRA/QLoRA 微调,更少显存

📝

Weights And Biases — W&B:记录 ML 实验、sweep、模型注册表、仪表盘

W&B:记录 ML 实验、sweep、模型注册表、仪表盘

📝

Whisper — OpenAI 的通用语音识别模型

OpenAI 的通用语音识别模型