01 Ce qui s’est passé
La bibliothèque Transformers prend désormais en charge les modèles au format GGUF, permettant aux utilisateurs d'exploiter des checkpoints quantifiés via l'API standard.
02 Les points essentiels
- Le chargement des modèles s'effectue en utilisant le paramètre de fichier dans la fonction from_pretrained.
- L'utilisation des noyaux ggml permet d'atteindre des performances d'inférence proches de celles de llama.cpp, selon le fournisseur.
- Le support initial est limité aux puces Apple Silicon avec l'architecture Qwen3.5.
03 Pourquoi c’est important
Cette mise à jour simplifie le déploiement local de modèles optimisés tout en conservant les outils habituels basés sur PyTorch.
04 Pour qui c’est utile
Ingénieurs en apprentissage automatique et développeurs de logiciels.
Source originaleHugging Face