Intelligence artificielle26 juillet 2026· via MarkTechPost

L’IA apprend en observant les écrans sans étiquettes—Photon-1 montre la voie

L’IA apprend en observant les écrans sans étiquettes—Photon-1 montre la voie

Un agent IA capable d’exécuter un bureau, de jouer aux dames ou de modéliser la physique du billard sans jamais voir d’étiquette d’action a discrètement surpassé un modèle grand public tout en coûtant bien moins cher. Photon-1, développé par Induction Labs, est un transformateur épars de type mélange d’experts (106 milliards de paramètres, 5 milliards actifs) formé à partir de 18 ans d’enregistrements d’écrans bruts—sans clics, frappes de touches ni récompenses fournies pendant l’apprentissage préalable. Sur un benchmark interne d’utilisation informatique, il a dépassé Google Gemini 3.1 Flash-Lite tout en utilisant environ 27 fois moins de calculs pour l’apprentissage préalable et en fonctionnant à un coût trois fois moindre.

Apprendre à partir des pixels, pas des invites

Photon-1 appartient à une nouvelle catégorie appelée modèles d’imagination. Au lieu de mapper des images à des actions, il prédit de manière autorégressive les états latents futurs. Son astuce réside dans un encodeur latent différentiel qui condense chaque image en 960 jetons discrets—environ 2,2 Ko—à l’aide d’une quantification scalaire finie. En encodant les différences entre images, le modèle capture le texte, la mise en page et les changements d’état avec plus de 100 fois plus de compression que les encodeurs traditionnels OCR ou multimodaux. L’objectif clé de cet apprentissage préalable enseigne une « politique implicite » : le modèle déduit ce que fait une personne sans jamais voir d’action étiquetée.

Éparsité et échelle en pratique

L’architecture combine 106 milliards de paramètres, dont seulement 5 milliards sont actifs à chaque étape, formée sur 552 milliards de jetons issus de 575 millions de photogrammes échantillonnés à 1 image par seconde. Induction Labs a réalisé une seule époque d’apprentissage sur 30 000 heures-GPU H200, maintenant une utilisation des flops du modèle à 40 % et enregistrant environ 4,4 × 10²² FLOPs. Après l’apprentissage préalable, l’équipe a affiné Photon-1 sur moins de 35 000 trajectoires d’utilisation informatique pour ajouter des formats d’actions et d’instructions. En inférence, le modèle prédit d’abord l’état latent de l’image suivante, puis émet l’action permettant d’y parvenir ; l’apprentissage par renforcement en ligne vérifie les résultats sur de vraies machines virtuelles Linux exécutant cinq environnements de bureau.


Source : MarkTechPost. Synthèse éditoriale assistée par IA — TechnoExpress.

Lire la source originale sur MarkTechPost →

← Retour à l'accueil