Perplexity Hybrid Compute sur Mac est plus intéressant en tant qu'architecture de confidentialité qu'en tant que nouvelle façon d'exécuter un LLM localement. Une même tâche dans Perplexity Computer peut désormais combiner des modèles de pointe dans le cloud avec un modèle local sur un Mac équipé d'une puce Apple. Les modèles cloud prennent en charge des tâches telles que la recherche, la planification et le raisonnement complexe, tandis que le composant local peut traiter des fichiers privés, des informations sensibles et des actions exécutées sur l'appareil. Entre les deux se trouve une passerelle locale de confidentialité qui contrôle les informations autorisées à franchir la limite de l'appareil.
Cela change la signification de l'« IA hybride ». Il ne s'agit plus simplement pour l'utilisateur de choisir manuellement entre Ollama et une API cloud. Perplexity cherche à intégrer le routage à l'agent lui-même : déterminer quelle partie d'une tâche doit rester locale, identifier les informations sensibles avant qu'elles ne quittent le Mac et utiliser sélectivement l'intelligence cloud lorsqu'elle apporte une réelle valeur. Hybrid Compute constitue ainsi une étude de cas utile pour une question plus vaste liée à l'IA locale : lorsqu'un flux de travail s'étend sur des modèles locaux et cloud, quelles données, actions et informations d'état doivent rester sous le contrôle de l'utilisateur ?
Qu'est-ce que Perplexity Hybrid Compute sur Mac ?
Perplexity Hybrid Compute est un mode de Perplexity Computer qui permet à une même tâche d'utiliser à la fois l'IA cloud et un modèle exécuté sur l'appareil, sans obliger l'utilisateur à diviser manuellement le flux de travail en plusieurs invites. Perplexity a annoncé cette fonctionnalité le 1er septembre 2026, dans le prolongement de ses efforts plus larges en faveur d'agents axés sur le local.
Son architecture antérieure Perplexity Portable Computer, axée sur le local, déplaçait l'orchestrateur, le planificateur, le routage des outils, la file d'attente des tâches, l'index de recherche et l'exécution des modèles vers le matériel local. Hybrid Compute aborde le problème différemment : cette solution maintient délibérément l'intelligence cloud dans la boucle tout en plaçant une limite de politique autour des tâches privées.
Dans l'annonce de Perplexity concernant Hybrid Compute, la répartition des tâches est décrite clairement.
| Partie du flux de travail | Zone d'exécution principale |
|---|---|
| Raisonnement de pointe | Cloud |
| Recherche Web | Cloud |
| Planification de haut niveau | Cloud |
| Analyse de fichiers privés | Mac local |
| Informations sensibles | Mac local |
| Actions sur l’appareil | Mac local |
| Classification de la confidentialité et mesures de protection du routage | Mac local |
L'unité importante n'est donc pas le modèle. C'est la tâche. Différentes parties d'une même tâche peuvent se trouver dans différentes zones de confiance.
Qu'est-ce qui s'exécute localement et qu'est-ce qui s'exécute dans le cloud ?
Le calcul hybride prend davantage de sens lorsque l’on cesse de raisonner en termes de « modèle local contre modèle cloud » et que l’on se demande plutôt ce que chaque côté sait réellement faire de mieux.
L’IA cloud reste intéressante pour les connaissances Web actuelles, les recherches générales et le raisonnement de pointe. Un Mac est mieux placé pour travailler directement avec les fichiers et les applications qui ne devraient pas être copiés dans le contexte d’un modèle distant. Perplexity Computer coordonne les deux côtés afin que l’utilisateur n’ait pas à résumer manuellement un document confidentiel, à supprimer les sections sensibles, à coller le texte expurgé dans un autre chatbot, puis à retransférer la réponse dans un flux de travail local.
Prenons une tâche juridique :
CÔTÉ PUBLIC / CLOUD
Jurisprudence actuelle
Recherche sur le Web
Raisonnement de pointe
Planification de haut niveau
|
v
PASSERELLE DE CONFIDENTIALITÉ
^
|
CÔTÉ PRIVÉ / LOCAL
Fichiers protégés
Identités des clients
Extraction locale
Rédaction de documents
Actions sur l’appareil
Un modèle cloud peut effectuer des recherches sur la jurisprudence publique. Le modèle local peut examiner des documents protégés par le secret professionnel et transformer les faits pertinents en question de recherche expurgée. Le cloud n’a pas besoin de l’intégralité du dossier client pour fournir un raisonnement utile.
Perplexity décrit des exemples similaires pour la finance et la publicité : les documents publics et les études de marché peuvent être traités à distance, tandis que les documents confidentiels relatifs à des transactions, les éléments créatifs internes sous embargo ou les documents internes restent sur le Mac.
Cela conduit à une meilleure définition de l’IA hybride :
L’IA hybride ne consiste pas simplement à exécuter la moitié d’une charge de travail en local et l’autre moitié dans le cloud. Il s’agit d’attribuer des responsabilités différentes à différentes zones de confiance.
Comment fonctionne la passerelle de confidentialité de Perplexity ?
La passerelle de confidentialité est l’élément le plus important du calcul hybride, car acheminer les modèles est facile comparé au fait de décider quelles informations ces modèles sont autorisés à voir.
Perplexity indique que la passerelle de confidentialité s’exécute sur le Mac et évalue les informations sensibles avant que le contenu protégé ne soit envoyé vers un service cloud. Selon la situation, le système peut conserver les informations en local, masquer les données sensibles, refuser une action ou demander le consentement de l’utilisateur.
| Action de la passerelle de confidentialité | Ce que cela signifie |
|---|---|
| Conserver localement | Les informations protégées restent sur le Mac, et le traitement local prend en charge cette partie de la tâche. |
| Masquer | Les informations sensibles sont supprimées ou réécrites avant que le contexte approuvé n’atteigne un service cloud. |
| Refuser | Le transfert ou l’action demandé est bloqué lorsque les informations protégées ne doivent pas quitter l’appareil. |
| Demander le consentement | L’utilisateur décide si les informations peuvent franchir la limite locale. |
Perplexity identifie précisément les noms, les adresses, les informations de compte et les secrets comme exemples de données que le classificateur sur l’appareil peut reconnaître. Les identifiants, les informations de carte bancaire et les pièces d’identité officielles bénéficient d’une protection renforcée.
Cela crée une distinction importante par rapport à un flux de travail cloud classique. Un fichier local ne devient pas automatiquement du contexte cloud simplement parce qu’un agent d’IA a besoin d’aide pour effectuer la tâche. L’application peut d’abord déterminer si l’ensemble des données est nécessaire, si une partie peut être supprimée ou si un modèle local peut accomplir cette étape sans rien partager.
Pour les abonnés Enterprise, Perplexity indique également que les administrateurs peuvent définir des politiques à l’échelle de l’organisation concernant les informations qui doivent rester en local, celles qui peuvent être masquées et les transferts de données nécessitant une approbation explicite. Les administrateurs peuvent auditer les moments où des informations quittent un appareil.
L’architecture est utile, mais il ne faut pas l’interpréter comme signifiant que « vos données ne peuvent jamais quitter le Mac ». Hybrid Compute utilise toujours des services cloud. L’affirmation plus précise est que les données protégées peuvent rester en local et que les transferts sélectionnés sont soumis à une couche de politique sur l’appareil, au lieu de devenir automatiquement du contexte cloud.
Comment le Mac sait-il quelles données sont sensibles ?
Une politique de confidentialité ne fonctionne que si la machine peut identifier les données sensibles de manière fiable. Perplexity a donc introduit une deuxième technologie parallèlement à Hybrid Compute : PII-Tracer, un modèle compact de 0,6 milliard de paramètres conçu pour détecter localement les informations personnelles identifiables.
Selon la recherche PII-TRACE de Perplexity, PII-Tracer fournit l’un des signaux utilisés par la Privacy Gate. L’application peut ensuite utiliser ces détections pour conserver le contenu en local, masquer les segments sensibles ou demander une autorisation explicite avant de transmettre une tâche à un modèle cloud.
La difficulté ne consiste pas à identifier un numéro de carte bancaire évident dans une seule phrase. Les agents d’IA entretiennent de longues conversations, et un même identifiant peut apparaître à plusieurs reprises dans des messages utilisateur, des réponses de l’assistant, des tableaux, du code ou des enregistrements structurés. Ne manquer qu’une seule occurrence ultérieure peut malgré tout exposer les informations que le système était censé protéger.
Perplexity a créé PII-TRACE pour tester ce problème sur de longues conversations. Son benchmark contient 13 148 conversations synthétiques entre utilisateurs et assistants, couvrant 13 langues et 10 systèmes d’écriture, avec plus de 37 000 mentions d’identifiants annotées réparties sur neuf types de données personnelles.
Ce point architectural plus large est particulièrement pertinent pour l’IA locale : la confidentialité elle-même devient une charge de travail d’IA locale.
Une pile d’IA privée mature peut donc contenir plusieurs modèles :
LLM local principal
+
Classificateur de données personnelles / sécurité
+
Modèle d’embeddings
+
Modèle de reranking
+
Modèle OCR / vision
+
Moteur d’exécution de l’agent
Le plus grand modèle peut gérer le raisonnement, mais de petits modèles locaux peuvent appliquer les règles, récupérer des informations, classer les demandes ou prétraiter des données privées avant qu’un modèle distant n’intervienne.
Pourquoi Perplexity a-t-il créé son propre moteur d’inférence locale pour Mac ?
Le routage hybride ne semble fluide que si la partie locale de la tâche est suffisamment rapide pour participer en continu. Si un agent alterne entre raisonnement dans le cloud, traitement de fichiers privés, appel à un autre modèle local, exécution d’une action via un outil et nouvelle étape de raisonnement, la lenteur de l’inférence locale retarde l’ensemble du flux de travail.
Perplexity a donc créé Lily, un moteur d’inférence léger optimisé spécifiquement pour le silicium Apple et Qwen3.6-35B-A3B. L’entreprise affirme prévoir de publier le code source du moteur.
Dans les recherches de Perplexity sur l’inférence sur silicium Apple, Lily est décrit comme un moteur d’exécution Rust spécialisé, doté d’une API compatible avec OpenAI et de noyaux Metal personnalisés. PyTorch et MLX ne font pas partie du chemin d’exécution de Lily.
La raison de cette spécialisation autour d’un seul modèle est architecturale. Qwen3.6-35B-A3B est un modèle parcimonieux de 35 milliards de paramètres qui en active environ 3 milliards par jeton. Il combine un routage par mélange d’experts, des couches Gated DeltaNet et des couches à attention complète. Ces composants génèrent des schémas de calcul et d’accès à la mémoire différents, ce qui donne au moteur d’exécution des possibilités d’optimisation spécifiques au silicium Apple.
Le checkpoint utilisé par Lily est quantifié sur 4 bits et pèse environ 19,4 Go, ce qui explique en partie pourquoi Perplexity peut définir une référence de 24 Go de mémoire unifiée pour Hybrid Compute tout en prenant en charge un modèle local substantiel.
| Test Perplexity sur M5 Max | Lily | MLX-LM |
|---|---|---|
| Débit moyen de préremplissage | 4 156 tok/s | 3 388 tok/s |
| Débit moyen de décodage | 170,0 tok/s | 126,4 tok/s |
| Préremplissage relatif | 1,23× | Référence |
| Décodage relatif | 1,35× | Référence |
Il s’agit des mesures de Perplexity sur une configuration M5 Max avec un GPU de 40 cœurs et 128 Go de mémoire unifiée, et non d’une prédiction universelle des performances pour tous les Mac pris en charge.
L’enseignement le plus durable est que les performances de l’inférence locale dépendent de plus en plus de l’adéquation entre l’architecture du modèle, le moteur d’exécution, l’organisation de la mémoire et le matériel. Le silicium Apple n’est pas simplement un GPU de centre de données en plus petit. Sa conception à mémoire unifiée, ses chemins d’exécution Metal et sa bande passante mémoire créent un problème d’optimisation différent.
Quels Mac peuvent exécuter Perplexity Hybrid Compute ?
Perplexity indique actuellement une configuration de base relativement simple : tout Mac équipé d’Apple silicon exécutant macOS 15 ou une version ultérieure et disposant d’au moins 24 Go de mémoire unifiée.
Hybrid Compute est disponible pour les abonnés Perplexity Pro, Max et Enterprise. Au lancement, les utilisateurs peuvent choisir parmi trois modèles locaux : Gemma 4 E4B, Qwen3.6-35B-A3B et un modèle Perplexity.
| Configuration du Mac | Statut de Hybrid Compute | Interprétation pratique |
|---|---|---|
| Mac Intel | Non pris en charge | Hybrid Compute nécessite Apple silicon |
| Apple silicon + 16 Go | En dessous de l’exigence officielle | Ne satisfait pas au minimum de 24 Go requis par Perplexity |
| Apple silicon + 24 Go | Configuration de base prise en charge | Point d’entrée officiel pour l’inférence hybride locale |
| Apple silicon + 32–64 Go | Pris en charge | Davantage de marge mémoire pour les modèles locaux, le contexte et les autres applications |
| MacBook Pro / Mac Studio à grande capacité mémoire | Pris en charge | Davantage de flexibilité pour les charges de travail locales plus importantes |
La valeur de 24 Go correspond au minimum publié par Perplexity. Les descriptions des systèmes dotés de davantage de mémoire ci-dessus sont des interprétations destinées à la planification matérielle, et non des niveaux officiellement recommandés distincts.
Perplexity présente également un Mac mini dédié comme option toujours active. Le Mac peut exécuter le modèle local en continu, tandis que l’utilisateur contrôle Computer à distance depuis un iPhone.
Ce petit détail est stratégiquement important, car il change le rôle du Mac.
Que se passe-t-il lorsqu’un Mac devient un nœud d’IA toujours actif ?
Un Mac utilisé de manière interactive est un ordinateur personnel. Un Mac mini laissé en ligne pour exécuter des agents, effectuer de l’inférence locale, traiter des fichiers privés et gérer des tâches à distance commence à se comporter davantage comme un nœud d’IA.
Cette évolution entraîne des exigences de type serveur qui ont peu à voir avec les scores de référence :
- un accès persistant aux fichiers de projet,
- des chemins réseau stables,
- la gestion des autorisations,
- des sorties et espaces de travail des agents,
- des index de recherche et des représentations vectorielles,
- des archives versionnées,
- des instantanés et des sauvegardes,
- une capacité de stockage qui peut évoluer indépendamment du Mac.
Le SSD interne du Mac est excellent pour les données actives, les points de contrôle des modèles, les caches et l’espace de travail en cours. Mais lorsqu’un agent commence à travailler avec des années de documents, de photos, de dossiers de projets, de code, d’archives de recherche ou de fichiers d’équipe, il n’est guère nécessaire que chaque ressource durable réside sur le même SSD que l’environnement d’inférence.
C’est là que l’IA locale commence à ressembler moins à une application exécutée sur un ordinateur portable qu’à une infrastructure.
Où un NAS s’intègre-t-il dans un flux de travail d’IA hybride sur Mac ?
Un NAS n’a pas besoin d’exécuter Perplexity Hybrid Compute pour jouer un rôle utile dans l’architecture. Perplexity place actuellement son inférence locale et sa Privacy Gate sur le Mac. Un NAS peut se trouver derrière cette couche de calcul et fournir une zone de données privée et persistante.
Nous présentons déjà l’architecture de base dans notre guide consacré à la séparation du calcul du Mac et du stockage NAS à long terme. Le calcul hybride ajoute une troisième zone : l’intelligence cloud externe.
| Zone | Rôle principal | Type de données ou de travail |
|---|---|---|
| Cloud | Intelligence de pointe | Recherche Web, raisonnement complexe, informations publiques, services cloud |
| Mac | Calcul local et limite de gouvernance | Modèle local, passerelle de confidentialité, traitement des fichiers privés, actions sur les appareils, espace de travail actif |
| NAS / serveur local | Données privées durables | Documents, médias, sources RAG, archives, sorties des agents, dossiers partagés, sauvegardes |
Une architecture conceptuelle pour un domicile ou un petit bureau peut donc se présenter ainsi :
CLOUD
Raisonnement de pointe
Recherche Web
Services externes
|
|
Approuvé / filtré
contexte
|
v
MAC
Modèle local
Passerelle de confidentialité
Actions de l’agent
Espace de travail actif
|
|
LAN de confiance
|
v
NAS / SERVEUR
Documents privés
Sources RAG
Archive du projet
Sorties de l’agent
Sauvegardes
L’idée importante est que ces couches répondent à des problèmes différents. Un NAS n’est pas une VRAM lente, et le Mac n’est pas automatiquement le meilleur endroit pour le stockage à long terme. Le Mac gère le calcul actif et les décisions liées à la confidentialité. Le système de stockage fournit une capacité durable, l’organisation, les autorisations, les instantanés et les sauvegardes.
Ce même schéma est utile pour créer un assistant IA privé autour de fichiers locaux et de la récupération d’informations. Le modèle n’a pas besoin de charger en permanence toutes les archives dans son contexte. Il lui suffit d’accéder, avec les autorisations adéquates, aux bons fichiers lorsque le flux de travail l’exige.
Cette séparation facilite également l’évolution de la pile d’IA. Un Mac mini peut être remplacé par un Mac Studio plus rapide. Le modèle local peut changer. Perplexity peut ajouter de nouveaux environnements d’exécution. Les modèles cloud peuvent s’améliorer. L’archive documentaire privée et l’historique des projets n’ont pas besoin d’être déplacés à chaque changement de la couche de calcul.
Le calcul hybride de Perplexity se résume-t-il à Ollama associé à un modèle cloud ?
Non. La différence importante réside dans l’orchestration tenant compte des politiques.
Un utilisateur peut déjà créer manuellement une configuration hybride avec Ollama, un modèle local et une API de Claude, Gemini, OpenAI ou d’un autre fournisseur. Mais dans une configuration simple, l’utilisateur ou le développeur de l’application décide généralement explicitement quel prompt est envoyé à quel modèle.
La différence se présente ainsi :
HYBRIDE MANUEL
Utilisateur
|
+-- Ollama / LLM local
|
+-- Modèle cloud
L’utilisateur ou l’application décide du routage
PERPLEXITY HYBRID COMPUTE
Tâche de l’utilisateur
|
v
Orchestration informatique
|
v
Classification de la confidentialité
|
v
Décision de routage / de politique
/ \
/ \
Local Cloud
Cette couche de routage peut évaluer la confidentialité avant de décider si l’intelligence cloud doit intervenir. Le modèle local n’est donc pas seulement un autre point d’accès à l’inférence ; il fait partie d’un workflow coordonné.
C’est aussi pourquoi l’IA hybride peut être plus qu’un simple compromis en matière de confidentialité. Le routage sélectif peut devenir une stratégie de réduction des coûts. L’extraction courante, l’analyse de documents, la classification ou le filtrage des données privées peuvent rester locaux, tandis que l’intelligence cloud premium est réservée aux étapes qui en bénéficient le plus. Notre analyse plus large des coûts de l’IA locale et cloud examine ce compromis plus en détail.
Le calcul hybride est-il plus privé que l’IA entièrement locale ?
Pas automatiquement. Un workflow entièrement local possède la limite de confiance la plus simple, car le modèle, les outils, les données et l’inférence peuvent rester dans l’environnement local. Le calcul hybride conserve délibérément des services cloud et introduit donc des décisions supplémentaires en matière de routage et de politique.
| Approche | Niveau de confidentialité | Principal compromis |
|---|---|---|
| IA entièrement locale | Les données n’ont pas besoin de quitter l’environnement local | Limitée par les capacités du modèle local, le matériel et les informations disponibles hors ligne |
| IA cloud | Expérience gérée simple, mais le traitement à distance est fondamental | Davantage de contexte peut devoir franchir la limite de l’appareil |
| Calcul hybride | Certaines tâches sensibles peuvent rester locales | La confidentialité dépend de la détection, de la politique de routage, des autorisations et des choix de l’utilisateur |
PII-Tracer montre à lui seul pourquoi il s’agit d’un problème d’ingénierie difficile. Perplexity a créé un benchmark dédié, car les longues conversations rendent la détection cohérente plus difficile. Si un identifiant apparaît cinq fois et que le classificateur en détecte quatre, l’occurrence manquée peut tout de même exposer précisément les informations que la couche de confidentialité était censée protéger.
Une Privacy Gate réduit donc l’exposition inutile, mais n’élimine pas la nécessité de faire confiance. Les utilisateurs dépendent toujours de l’application locale, de son classificateur, des autorisations du système d’exploitation, des règles de routage et de tout service externe qu’ils approuvent.
C’est une manière plus saine d’évaluer l’IA privée que de supposer que le mot « local » répond à toutes les questions de confidentialité. Les questions pertinentes sont les suivantes :
- Où les données d’origine sont-elles stockées ?
- Quel modèle le reçoit ?
- Qui décide s’il peut quitter l’environnement local ?
- Le contexte sensible peut-il être supprimé avant l’escalade ?
- De quelles autorisations l’agent dispose-t-il localement ?
- Quels journaux et sauvegardes persistent une fois la tâche terminée ?
Perplexity Hybrid Compute montre-t-il la direction que prend l’IA personnelle ?
Hybrid Compute est encore trop récent pour démontrer que tous les systèmes d’IA personnels suivront la même conception, mais il permet de mieux discerner un changement architectural plus large.
Les modèles locaux deviennent des exécutants plutôt que des remplaçants miniatures de chaque modèle de pointe. Un modèle local peut examiner des fichiers privés, extraire des faits, appliquer des politiques, exécuter des actions sur l’appareil et préparer un contexte anonymisé. Il n’a pas forcément besoin de surpasser le meilleur modèle cloud à chaque test de raisonnement pour être utile.
Les modèles cloud peuvent devenir des spécialistes de la recherche, du raisonnement complexe et des capacités qui tirent parti d’une infrastructure gérée de grande ampleur. Les petits modèles locaux peuvent servir de composants de confidentialité et de routage. Un Mac ou un PC équipé d’une IA peut devenir le nœud d’exécution actif. Un NAS ou un serveur domestique peut rester la couche de données durable qui se trouve derrière.
Cela signifie que le routage pourrait devenir aussi important que le choix du modèle.
La question passe de :
« Puis-je exécuter le plus grand modèle en local ? »
à :
« Mon système peut-il conserver les bonnes données en local tout en utilisant le meilleur modèle disponible pour chaque partie de la tâche ? »
Le Portable Computer de Perplexity a montré que l’environnement d’exécution de l’agent pouvait lui aussi évoluer vers du matériel local. Hybrid Compute sur Mac franchit l’étape suivante en intégrant la frontière entre exécution locale et cloud au flux de travail. Ensemble, ces deux sorties annoncent une architecture d’IA dans laquelle les utilisateurs n’ont pas à choisir catégoriquement entre contrôle local et capacités cloud.
Pour une infrastructure donnant la priorité au local, c’est la tendance la plus importante. L’avenir dépendra peut-être moins d’une seule machine capable de tout faire que de rôles clairement séparés : le cloud pour l’intelligence externe, le calcul local pour l’exécution de confiance et le stockage local persistant pour les données qui doivent rester les vôtres.
FAQ : Perplexity Hybrid Compute sur Mac
Qu’est-ce que Perplexity Hybrid Compute sur Mac ?
Perplexity Hybrid Compute est un mode de Perplexity Computer qui répartit une tâche entre un modèle local exécuté sur un Mac équipé d’une puce Apple et des services d’IA de pointe dans le cloud. La partie locale gère les fichiers privés, les informations sensibles et les actions sur l’appareil, tandis que les modèles cloud peuvent assurer la recherche, la planification et le raisonnement avancé.
Perplexity Hybrid Compute conserve-t-il les fichiers entièrement en local ?
Les fichiers protégés et les informations sensibles peuvent rester sur le Mac, mais Hybrid Compute n’est pas un système entièrement hors ligne. Lorsqu’une tâche nécessite des capacités cloud, la Privacy Gate peut conserver les données sensibles en local, les masquer, refuser leur transfert ou demander le consentement de l’utilisateur avant l’envoi des informations approuvées.
Qu’est-ce que le Privacy Gate de Perplexity ?
Le Privacy Gate est une couche exécutée sur l’appareil qui évalue les informations sensibles avant qu’elles ne quittent le Mac pour être transmises aux services cloud. Perplexity indique qu’il peut classer les informations protégées et appliquer des actions telles que conserver les informations en local, les masquer, refuser une action ou demander un consentement.
Quels Mac prennent en charge Perplexity Hybrid Compute ?
Perplexity exige actuellement un Mac Apple Silicon exécutant macOS 15 ou une version ultérieure, avec au moins 24 Go de mémoire unifiée. Les Mac Intel et les systèmes Apple Silicon dotés de moins de 24 Go ne satisfont pas à l’exigence publiée.
De quelle quantité de mémoire unifiée Perplexity Hybrid Compute a-t-il besoin ?
Le minimum officiel est de 24 Go de mémoire unifiée. Une mémoire plus importante offre davantage de marge pour les modèles locaux, le contexte, les autres applications et les charges de travail plus lourdes, mais Perplexity ne publie actuellement pas de paliers recommandés distincts de 32 Go, 64 Go ou 128 Go.
Quels modèles locaux Perplexity Hybrid Compute utilise-t-il ?
Au lancement, Perplexity propose Gemma 4 E4B, Qwen3.6-35B-A3B et un modèle Perplexity parmi les options de modèles locaux. La liste des modèles disponibles pourrait s’élargir à mesure que le produit évolue.
Perplexity Hybrid Compute fonctionne-t-il hors ligne ?
Une partie du traitement local peut être exécutée sur le Mac, mais le flux de travail complet de Hybrid Compute est conçu pour combiner l’exécution locale avec des capacités cloud telles que le raisonnement avancé et la recherche web. Les tâches qui dépendent de ces capacités distantes nécessitent une connexion.
Perplexity Hybrid Compute est-il la même chose qu’Ollama ?
Non. Ollama est principalement un environnement d’exécution de modèles locaux et une API. Hybrid Compute est un système d’orchestration au niveau agent qui coordonne les modèles locaux et cloud, tout en ajoutant une classification de la confidentialité et une politique de routage autour d’une même tâche.
Qu’est-ce que PII-Tracer ?
PII-Tracer est le modèle compact de Perplexity, doté de 0,6 milliard de paramètres, pour détecter localement les informations personnelles identifiables. Ses détections peuvent aider le Privacy Gate à déterminer si le contenu sensible doit rester sur l’appareil, être masqué ou nécessiter une approbation avant d’être transmis au cloud.
Qu’est-ce que Lily ?
Lily est le moteur d’inférence locale spécialisé de Perplexity pour Apple Silicon et Qwen3.6-35B-A3B. Il utilise un environnement d’exécution Rust et des noyaux Metal personnalisés, et expose une API compatible avec OpenAI. Perplexity indique prévoir de publier le moteur en open source.
Un Mac exécutant Hybrid Compute bénéficie-t-il toujours d’un NAS ?
Potentiellement, oui, mais pour un rôle distinct. Hybrid Compute exécute l’inférence locale et le Privacy Gate sur le Mac. Un NAS peut fournir un stockage persistant pour les documents privés, les sources RAG, les archives de projets, les sorties générées, les dossiers partagés, les instantanés et les sauvegardes, sans devoir devenir le principal appareil d’inférence.
Centre Tech & IA
Plus à lire

Top 10 des interfaces web d’IA locales pour les laboratoires personnels en 2026
Comparez 10 interfaces web d’IA locales auto-hébergées pour les laboratoires à domicile, en couvrant la prise en charge d’Ollama, le RAG, les agents, l’accès...

Combien coûte GPT-6 Astra au fil du temps ? Quand l’IA cloud est-elle plus pertinente que l’IA locale ?
Un guide pratique sur le coût de GPT-6 Astra couvrant l’utilisation des jetons, les charges de travail d’IA à long terme, les compromis entre...

GPT-6 Astra vs IA locale : quelles parties d’un agent devraient rester sur votre serveur domestique ?
GPT-6 Astra peut rester dans le cloud tandis que votre serveur domestique conserve localement les fichiers, la mémoire, le RAG, les outils, les autorisations...

