hugging-face-model-trainer
hugging-face-model-trainer
Mô tả
Skill này hướng dẫn Claude thiết lập pipeline huấn luyện/fine-tune mô hình ngôn ngữ bằng thư viện TRL của Hugging Face: supervised fine-tuning (SFT), DPO (Direct Preference Optimization), GRPO, cùng bước chuyển đổi checkpoint sang định dạng GGUF để chạy trên các runtime nhẹ như llama.cpp.
Khi nào nên dùng
- Cần fine-tune một mô hình mã nguồn mở trên dữ liệu riêng bằng SFT hoặc DPO.
- Cần chuyển một checkpoint đã huấn luyện sang GGUF để triển khai cục bộ.
Khi nào không nên dùng
- Chỉ cần gọi API mô hình có sẵn (không tự huấn luyện) - không cần skill này.
- Không có GPU/hạ tầng đủ mạnh để huấn luyện - cân nhắc dùng dịch vụ fine-tuning quản lý sẵn thay vì tự chạy pipeline.
Ví dụ
“Viết script SFT fine-tune mô hình Llama 3 8B trên bộ dữ liệu hội thoại tiếng Việt của tôi bằng TRL.”
“Chuyển checkpoint đã DPO xong sang GGUF q4_k_m để chạy trên máy cá nhân.”
Mô tả tổng hợp từ danh mục cộng đồng, chưa kiểm chứng trực tiếp - API của TRL/Hugging Face thay đổi khá nhanh, hãy đối chiếu tài liệu chính thức trước khi chạy pipeline huấn luyện tốn tài nguyên.
Nguồn
Tổng hợp từ danh mục VoltAgent/awesome-agent-skills, skill gốc do Hugging Face công bố tại officialskills.sh/huggingface/skills/hugging-face-model-trainer.
lượt xem