MiniMax H3 ouvre ses poids pour la vidéo-audio unifiée
Les poids ouverts exposent deux checkpoints : FL2VA pour le texte vers l’audio-vidéo et Ref2VA pour les références multimodales.
Modèles, agents, applications : l’intelligence artificielle mise au travail sur des problèmes réels.
Les poids ouverts exposent deux checkpoints : FL2VA pour le texte vers l’audio-vidéo et Ref2VA pour les références multimodales.
Les lecteurs peuvent désormais désigner un site comme source préférée directement auprès de l’éditeur.
Pocket transforme des prompts textuels en petits jeux interactifs qui réagissent au toucher et aux mouvements du téléphone.
Le réseau CrowdHydrology de l’Université de Buffalo couvre 26 États et a recueilli plus de 20 000 relevés.
Une équipe de RAI Institute et de Boston Dynamics entraîne des robots avec des données de mouvement, des vidéos ou des animations.
Slack Code crée un canal dédié à une tâche lorsqu’une équipe mentionne un agent IA de codage.
Les étudiants du supérieur hors États-Unis, y compris au Japon, sont concernés. Les inscriptions sont ouvertes jusqu’au 31 décembre 2026.
La version v0.1.0-rc.8 ajoute les requêtes d'images natives et les tâches mêlant texte et images.
Les lunettes sont proposées à partir de 2 699 yuans et ciblent les personnes qui les portent plus de 16 heures par jour.
La bêta utilise le modèle Muse Spark de Meta pour répondre aux questions à partir d’un écran partagé.
Hierarchical CoAtNet 1 a reconnu des poses de yoga avec une précision supérieure à 93 % lors des tests.
L’équipe de Southampton a découvert que l’excès de centrosomes et leur agrandissement sont deux anomalies distinctes, qui peuvent toucher différentes régions d’une même tumeur.
Il améliore la précision de 7,9 % par rapport à son modèle de base propriétaire et de 9,8 % par rapport aux modèles open source évalués.
IPO-Mine découpe les dossiers en sections et en extrait les graphiques pour leur analyse automatisée.
Alipay publie le protocole d’interconnexion multi-agents AHA, qui permet aux agents de différents terminaux de se découvrir et de se transmettre des tâches.
Le modèle combine 2,8 milliards de paramètres et une fenêtre de contexte d’un million de tokens.
La bêta sur inscription retrouve les pages consultées, les prévisualise et regroupe les onglets en double.
L'infrastructure personnalisée a fait passer Claude Opus 5 de 30 % à 100 % sur un benchmark de raisonnement interactif.