Dernier blog
Comment la pertinence marginale maximale réduit-elle les éléments de preuve redondants dans le RAG ?
MMR réorganise les candidats en récompensant la pertinence tout en pénalisant la similarité avec les passages déjà sélectionnés, laissant ainsi davantage de place aux éléments de preuve indépendants.
Comment le parallélisme des pipelines répartit-il les couches d’un modèle entre les accélérateurs d’IA domestiques ?
Le parallélisme par pipeline répartit différents groupes de couches sur différents accélérateurs et fait circuler les activations entre eux dans l’ordre, réduisant ainsi la mémoire du modèle utilisée par chaque appareil.
Comment le parallélisme tensoriel répartit-il l’inférence locale d’une IA sur plusieurs GPU ?
Le parallélisme tensoriel répartit les tenseurs des couches entre les GPU, de sorte que chaque appareil calcule un fragment et que des communications collectives reconstituent le résultat logique.
Comment le déport de calcul vers le processeur permet-il de faire fonctionner des modèles trop volumineux sur un serveur domestique ?
Le déport du calcul vers le CPU permet d’exécuter des modèles volumineux en stockant une partie de leurs poids dans la RAM du système et en transférant les tenseurs nécessaires vers l’accélérateur pendant l’exécution.
Comment le routage du modèle Mixture-of-Experts modifie-t-il le calcul local ?
Le routage MoE active les experts sélectionnés pour chaque jeton, réduisant ainsi le calcul des couches d’experts par rapport au nombre total de paramètres, tandis que l’ensemble complet des experts reste stocké.
Comment Flash Attention réduit-il le trafic mémoire lors de l’inférence locale ?
Flash Attention conserve les calculs d’attention par tuiles sur la puce et évite de matérialiser la matrice complète des scores, réduisant ainsi le trafic HBM sans approximer l’attention.
Comment l’attention paginée gère-t-elle le cache KV lors de requêtes d’IA locales simultanées ?
PagedAttention associe l’historique KV logique de chaque requête à des blocs de mémoire de taille fixe, en allouant et en recyclant la capacité au gré de l’évolution des séquences simultanées.
Comment la mise en cache des préfixes réduit-elle le travail lié aux invites répétées sur un serveur d’IA domestique ?
La mise en cache des préfixes réutilise l’état d’attention associé à un préfixe de requête partagé. Les requêtes suivantes ne calculent donc que le suffixe non mis en cache avant que le décodage normal ne se...
