fermer

Intelligence Artificielle

L’intelligence artificielle (IA) transforme de nombreux secteurs, de la santé à la finance, en passant par l’éducation et la sécurité. Explorez comment l’IA est utilisée pour automatiser des tâches, augmenter l’efficacité et créer de nouvelles opportunités de marché.

Nos discussions incluent également les défis éthiques et les implications sociétales de l’adoption de l’IA, fournissant une perspective équilibrée sur ce développement technologique clé.

Intelligence Artificielle

Gemma de Google : l’IA open source révolutionne le développement

gemma header.width 1600.format w

Google DeepMind a récemment annoncé le lancement de Gemma, ses nouveaux modèles open source 2B et 7B, construits à partir des mêmes recherches et technologies que les modèles Gemini précédemment présentés par l’entreprise. Il s’agit d’une étape significative dans l’évolution de l’accès aux technologies d’IA avancées pour les développeurs. En effet, cette initiative marque une étape importante dans le domaine de l’intelligence artificielle, car elle reflète l’engagement de Google dans le partage de technologies avancées avec la communauté des développeurs et chercheurs.

Gemma se positionne comme une alternative plus légère et ouverte, idéalement adaptée à des tâches plus simples telles que la création de chatbots ou la réalisation de résumés. Malgré leur taille réduite, les modèles Gemma se distinguent par leur capacité à surpasser des modèles bien plus importants sur des benchmarks clés, selon Google.

Les modèles Gemma seront disponibles en versions pré-entraînées et ajustées par instruction, accompagnés d’une licence commerciale permissive. Cette démarche est complétée par la mise à disposition d’un nouvel ensemble d’outils pour une IA générative responsable. Google propose également des chaînes d’outils pour l’inférence et le fine-tuning supervisé (SFT) compatibles avec les principaux frameworks tels que JAX, PyTorch, et TensorFlow via Keras 3.0. Des notebooks prêts à l’emploi sur Colab et Kaggle sont fournis, et Gemma est intégré avec des plateformes telles que Hugging Face, MaxText, et NVIDIA NeMo, permettant une exécution sur des ordinateurs portables, des stations de travail, ou sur le cloud de Google.

En parallèle, Nvidia a annoncé avoir collaboré avec Google pour lancer des optimisations sur toutes les plateformes AI de NVIDIA, afin d’accélérer les performances de Gemma. Cette collaboration souligne l’importance de l’interopérabilité et de l’optimisation dans l’écosystème de l’IA.

Jeanine Banks, vice-présidente et directrice générale de Developer X chez Google, a souligné que les modèles Gemma s’inscrivent dans la continuité des efforts de Google pour rendre accessible la technologie d’IA, en offrant à la fois des API et des modèles ouverts. Cette approche vise à fournir un large éventail de capacités à la communauté, facilitant ainsi le prototypage précoce et la personnalisation ultérieure des modèles.

Benchmark chart new.width 1000.f jpg

Réduire les risques associés aux modèles d’IA

Google DeepMind s’engage également à publier un ensemble complet de benchmarks pour évaluer Gemma par rapport à d’autres modèles, dans un effort de transparence et de contribution à l’amélioration continue de la sécurité et de la fiabilité des modèles d’IA. Ces évaluations comprennent des tests adversaires automatiques, des red teaming manuels, et des évaluations des capacités des modèles pour des activités potentiellement dangereuses.

L’accent mis sur la sécurité et la conception responsable de Gemma témoigne de l’importance accordée par Google DeepMind aux principes d’IA responsables. L’entreprise cherche à réduire les risques associés aux modèles d’IA en utilisant des techniques automatisées pour filtrer les informations personnelles sensibles et en appliquant un apprentissage par renforcement à partir de retours humains pour aligner les modèles sur des comportements responsables.

Ce développement illustre l’engagement croissant envers une IA ouverte et responsable, en mettant l’accent sur la nécessité d’intégrer diverses perspectives pour améliorer les systèmes de sécurité et encourager une innovation éthique dans le domaine de l’IA.

En nommant ce modèle « Gemma », qui signifie pierre précieuse, Google souligne la valeur et l’importance de ces nouvelles ressources d’IA dans le paysage technologique actuel, offrant aux développeurs des outils puissants et accessibles pour innover et créer de manière responsable.

Lire plus
Intelligence Artificielle

Acrobat réinvente le PDF avec l’IA : une révolution documentaire

Adobe Acrobat AI Assistant hed

Adobe innove une fois de plus en intégrant une expérience d’IA générative à son logiciel de gestion de documents PDF, Acrobat, promettant de « transformer complètement l’expérience du document numérique ».

Baptisé « AI Assistant in Acrobat », Shantanu Narayen, PDG d’Adobe, a souligné la capacité de l’outil à résumer, interagir, répondre aux questions et connecter de manière transparente les informations à travers les documents PDF pour démocratiser l’accès à la grande diversité de documents PDF utilisés. Cet AI Assistant améliore l’accessibilité et l’efficacité de la gestion des documents pour répondre aux besoins changeants des utilisateurs dans un monde numérique.

Adobe a dévoilé mardi sa dernière innovation, en introduisant un assistant à intelligence artificielle (IA) au sein de ses applications Reader et Acrobat, conçu pour rationaliser le traitement des documents.

Actuellement en phase bêta, AI Assistant est déjà accessible sur Acrobat, avec des plans imminents pour son intégration dans Reader. Après la phase bêta, Adobe prévoit de lancer un plan d’abonnement pour cet outil.

Gestion de documents plus efficace et moins contraignante

AI Assistant vise à aider les utilisateurs à comprendre les longs documents PDF en générant des résumés concis de leur contenu, comme l’a rapporté CNBC. Il propose également une interface conversationnelle pour répondre aux questions concernant les informations du document et suggérer de potentielles questions que les utilisateurs pourraient poser. De plus, l’assistant peut produire des citations pour vérifier la source de ses réponses et générer du texte pour différents formats, tels que les e-mails, les présentations et les rapports.

Contrairement à d’autres modèles d’IA comme ChatGPT, qui nécessitent que les utilisateurs téléchargent des PDF pour analyse, AI Assistant est une fonctionnalité intégrée dans les applications Reader et Acrobat.

9185120 GenAI Summary Blog 1000x jpg

L’expérience AI Assistant est accessible aux clients Acrobat sur les plans d’abonnement Standard, Pro et Teams, à la fois sur bureau et en ligne, « sans coût supplémentaire » pendant la période bêta.

Une poussée de l’IA

Ce développement fait suite à l’intégration par Adobe AI pour la création de contenu. Nous avons récemment vu Adobe s’associer à TikTok s’étaient associés pour améliorer la production multimédia pour les entreprises et les artistes en intégrant directement l’assistant créatif alimenté par l’IA de TikTok dans Adobe Express. Cette fonctionnalité, disponible pour les utilisateurs gratuits et premium, vise à simplifier l’expérience de création de contenu.

L’add-on Creative Assistant dans Adobe Express facilite la production de contenu de manière transparente sur les plateformes, offrant aux clients d’Adobe Express l’accès à des thèmes, des clips vidéo Adobe Stock, de l’audio, des autocollants et un créateur de vidéo TikTok.

Stacy Martinet, VP de la stratégie marketing et de la communication chez Adobe, souligne les avantages pratiques de cette collaboration, citant la réduction du temps, des efforts et des ressources nécessaires sur les plateformes pendant la production de contenu.

 

Lire plus
Intelligence Artificielle

Tout ce que vous devez savoir sur Sora : « tout le monde sera cinéaste »

OpenAI Sora

L’arrivée de Sora, le modèle de génération de vidéos à partir de prompts textuels développés par OpenAI, représente une véritable révolution dans le paysage de l’intelligence artificielle.

Cette technologie prometteuse permet de transformer de simples descriptions textuelles en vidéos d’une minute, offrant ainsi une nouvelle dimension à la création de contenu numérique.

OpenAI, déjà connu pour ses avancées significatives avec des produits comme ChatGPT et Dall-E, repousse les limites de l’IA avec Sora, en produisant des vidéos d’une qualité quasi photoréaliste. Si Sora peut « créer des scènes réalistes et imaginatives à partir d’instructions textuelles », selon OpenAI, elle fait déjà parler d’elle sur Internet.

Accès et sécurité de Sora

Contrairement aux précédents précédents qui étaient largement accessibles, Sora est actuellement en phase de test et n’est accessible qu’à un nombre restreint d’utilisateurs, notamment les testeurs internes d’OpenAI et un groupe sélectionné d’artistes visuels et de cinéastes.

Cette approche sélective vise à identifier et à corriger les potentielles failles du système qui pourraient présenter des risques d’abus ou de détournement. OpenAI met en garde contre les annonces frauduleuses promettant un accès non autorisé à Sora, soulignant l’importance de se référer uniquement aux canaux officiels pour les informations d’accès.

Technologie et innovation

Sora s’appuie sur une méthodologie innovante en matière de traitement vidéo. Analogue aux Large Language Model pour le texte, Sora utilise des « patches » de données vidéo, transformées en un espace latent de dimension inférieure, pour générer des vidéos cohérentes et de haute qualité.

ezgif 1 a559a3c1e8

ezgif 1 02294151d2

ezgif 1 c767cd7883

Ce processus s’inscrit dans la continuité des modèles de diffusion, une avancée par rapport aux modèles GAN utilisés antérieurement dans la génération de vidéos basées sur le texte. Sora se distingue par sa capacité à comprendre les nuances du langage liées à la réalité physique, permettant une reproduction fidèle et détaillée des scènes décrites.

Défis et perspectives

Malgré ses capacités impressionnantes, Sora n’est pas exempt de défis, notamment en ce qui concerne la représentation précise de la physique et le changement d’état des objets dans les vidéos.

OpenAI a admis ouvertement que Sora n’est pas sans limites et qu’il y a beaucoup de place pour l’amélioration. Il existe actuellement deux limitations majeures :

  1. Sora peut passer à côté de détails basés sur la relation de cause à effet. L’exemple donné par OpenAI est que Sora pourrait être capable de générer une vidéo de quelqu’un en train de croquer dans un biscuit, mais ce biscuit pourrait ne pas être croqué par la suite.
  2. Sora pourrait ne pas tenir compte de certains détails spatiaux plus fins, comme la gauche et la droite, ou des directions spécifiques de la caméra.

OpenAI est consciente de ces limitations et travaille à l’amélioration continue du modèle. Pour prévenir les risques associés aux deepfakes, une signature spécifique est intégrée dans les métadonnées des vidéos générées, accompagnée du développement d’un détecteur dédié.

Questions ouvertes

Des interrogations demeurent quant aux données utilisées pour entraîner Sora, ainsi qu’aux implications sur le marché du travail et aux coûts liés à la génération de contenu vidéo. La collaboration d’OpenAI avec Shutterstock pour l’accès à sa bibliothèque média soulève des questions sur les supports de formation et les droits d’utilisation.

De plus, l’impact de l’IA sur les emplois créatifs et les potentiels coûts pour l’accès à cette technologie avancée font l’objet d’un examen attentif.

Réactions sur Internet

Les réactions en ligne ont été très variées, certains utilisateurs X étant très enthousiastes, tandis que d’autres sont beaucoup plus méfiants. Marques Brownlee, blogueur et critique technique, a déclaré dans un tweet accompagné de quelques vidéos de Sora : « Si cela ne vous inquiète pas au moins un peu, rien ne le fera ».

Gabor Cselle, qui a été directeur chez Google pendant plus de 6 ans, a préparé une comparaison entre Sora et plusieurs autres outils populaires de génération de vidéos, Sora semblant extrêmement prometteur.

De nombreuses personnes ont souligné le potentiel de cet outil pour les cinéastes amateurs.

Conclusion

240215 openai sora wooly mammoth jpg

Sora d’OpenAI illustre les progrès remarquables et les défis persistants dans le domaine de la génération de contenu vidéo par IA. Alors que cette technologie ouvre de nouvelles avenues pour la création de contenu numérique, elle soulève également des questions importantes sur l’éthique, la sécurité et l’accessibilité.

Dans ce contexte, OpenAI poursuit ses efforts pour développer une plateforme à la fois innovante et responsable, prête à transformer le paysage de la création numérique tout en veillant à prévenir les abus potentiels.

Lire plus
Intelligence Artificielle

Valorisation record pour OpenAI : 80 milliards de dollars et au-delà

OpenAI officialise nouvelle vers

Selon des informations révélées par le New York Times le 16 février, OpenAI, l’entreprise à l’avant-garde de l’intelligence artificielle, a vu sa valorisation grimper à plus de 80 milliards de dollars.

Cette valorisation résulte d’une transaction particulière, orchestrée par Thrive Capital, impliquant la vente d’actions existantes via une offre publique d’achat. Contrairement aux tours de financement traditionnels, cette opération permet aux employés de monétiser leurs parts, soulignant une approche innovante dans le financement des entreprises technologiques.

Cette nouvelle évaluation marque une croissance significative par rapport à la précédente offre publique d’achat, initiée par des firmes de renom telles que Thrive Capital, Sequoia Capital, Andreessen Horowitz et K2 Global, qui avait valorisé OpenAI à 29 milliards de dollars.

Parallèlement, Sam Altman, PDG d’OpenAI, cherche activement des fonds pour lancer une entreprise de semi-conducteurs visant à augmenter la capacité mondiale de fabrication de puces.

Ce projet ambitieux, visant à renforcer les capacités et à réduire les coûts de l’intelligence artificielle, pourrait nécessiter un investissement colossal de plusieurs trillions de dollars, avec des pourparlers en cours avec des investisseurs, y compris le gouvernement des Émirats arabes unis.

OpenAI lance un générateur de texte-vidéo alimenté par l’IA

Dans un autre développement, OpenAI a fait face à un revers juridique lorsque sa demande de marque pour le terme « GPT » a été rejetée par l’Office américain des brevets et des marques (USPTO), citant la nature générique et large du terme. Cette décision met en lumière les défis de protéger les innovations dans un domaine aussi dynamique que l’intelligence artificielle, où l’équilibre entre la protection de la propriété intellectuelle et la compréhension publique des termes techniques est crucial.

Enfin, OpenAI a récemment dévoilé Sora, un modèle IA révolutionnaire capable de générer des vidéos d’une minute à partir de simples instructions textuelles. Bien que cette technologie promette de redéfinir la génération de contenu vidéo, son accès reste limité au public, OpenAI préférant une évaluation approfondie pour prévenir les potentiels abus.

Cette prudence reflète les inquiétudes croissantes concernant les risques associés aux outils alimentés par l’IA, notamment en termes de désinformation, de contenu haineux et de biais, ainsi que l’impact possible sur l’emploi dans les industries créatives.

Lire plus
Intelligence Artificielle

Stability AI lance Stable Cascade : une révolution dans la génération d’images IA

Screen 2024 02 15 18.15.51

Le créateur de la célèbre technologie d’IA texte-image Stable Diffusion, Stability AI, a dévoilé un nouveau modèle baptisé Stable Cascade. Ce modèle innovant représente un bond en avant dans la technologie de génération d’images, visant à offrir des solutions plus efficaces et plus flexibles que ses prédécesseurs.

Depuis son lancement initial en 2022, Stability AI n’a cessé d’affiner son modèle Stable Diffusion, ce qui a conduit à des mises à jour importantes avec le SDXL 1.0 en juillet 2023 et le SDXL Turbo en novembre 2023.

Stable Cascade introduit une nouvelle approche de la génération d’images, en utilisant une architecture différente inspirée de l’architecture Würstchen. Cette méthode intègre des techniques avancées pour améliorer à la fois les performances et la précision. Selon le résumé de la recherche de Würstchen, une innovation clé est le développement d’une technique de diffusion latente qui utilise une représentation sémantique de l’image hautement comprimée mais détaillée. Cette approche réduit considérablement les besoins de calcul pour obtenir des résultats de pointe, marquant ainsi une nouvelle étape dans la création d’images pilotée par l’IA.

Contrairement au grand modèle unique utilisé par Stable Diffusion, Stable Cascade utilise une architecture modulaire en trois étapes, comprenant les étapes A, B et C. Cette configuration permet d’améliorer considérablement l’efficacité et la personnalisation de la formation. Le processus commence par l’étape C, qui convertit les prompts textuels en latents compacts de 24 × 24 pixels. Ces latents sont ensuite décodés en images complètes à haute résolution par les étapes A et B. En découplant la génération du texte en image du décodage de l’image, le modèle initial de texte conditionnel peut être formé et affiné avec une plus grande efficacité. Stability AI indique que le réglage fin de l’étape C entraîne à lui seul une réduction des coûts de 16 fois par rapport au réglage fin d’un modèle unique de taille similaire à celui de Stable Diffusion.

Screen 2024 02 15 18.16.04 jpg

L’optimisation directe des préférences (Direct Preference Optimization, DPO) est un autre domaine dans lequel Stable Cascade vise à améliorer la qualité de l’image. La DPO, une alternative à l’apprentissage par renforcement, ajuste les modèles pour les aligner sur les préférences humaines. Le fondateur et PDG de Stability AI, Emad Mostaque, a indiqué que la combinaison de Stable Cascade et de DPO permettrait d’obtenir des images de meilleure qualité. Bien qu’il s’agisse d’un modèle de prévisualisation de recherche, Stable Cascade excelle déjà dans la qualité de l’image et l’alignement rapide, surpassant d’autres modèles artistiques d’IA de premier plan, y compris SDXL, dans les évaluations menées par Stability AI.

Impressionnant

Une avancée notable de Stable Cascade est sa capacité à générer avec précision du texte dans les images, améliorant ainsi l’utilité du modèle pour une large gamme d’applications. Cette fonctionnalité positionne Stable Cascade comme un concurrent important dans l’espace de génération d’art par l’IA, offrant plus de variété et de cohérence dans la création d’images générées par l’IA.

Stable Cascade introduit également des fonctionnalités permettant de générer des variations d’une image donnée tout en conservant le style et la composition, ainsi que d’effectuer des traductions d’image à image. Des techniques avancées telles que l’in-painting et la super-résolution sont prises en charge par les ControlNets. Actuellement disponible pour un usage non commercial dans le cadre d’un aperçu de recherche, le code de Stable Cascade est accessible sur GitHub, invitant les développeurs et les chercheurs à explorer davantage son potentiel.

Lire plus
Intelligence Artificielle

Amazon réinvente le texte vers parole avec BASE TTS

07caca7e cab5 4695 b195 24f573aafa21

Dans le paysage en constante évolution de l’intelligence artificielle, Amazon vient de marquer un tournant avec l’introduction de BASE TTS, le modèle de conversion texte en parole le plus avancé à ce jour. BASE TTS est au cœur d’une innovation permettant des interactions plus naturelles et humaines.

Le modèle BASE TTS d’Amazon a été entraîné sur une base de données colossale de 100 000 heures de discours en domaine public, intégrant principalement de l’anglais, mais aussi du allemand, du néerlandais, et de l’espagnol. Cette diversité linguistique et cette quantité de données inédite confèrent au modèle une « naturalité de pointe » dans la reproduction de la parole humaine.

Avec 980 millions de paramètres, BASE-large est reconnu comme le modèle texte-parole le plus volumineux jamais conçu. Les chercheurs d’Amazon ont également expérimenté avec des modèles de tailles inférieures pour évaluer leurs performances en comparaison.

BASE TTS se distingue par sa capacité à imiter les caractéristiques vocales d’un locuteur à partir de seulement quelques secondes d’audio de référence, une avancée majeure vers des communications plus personnelles et authentiques avec les IA. Les chercheurs se sont concentrés sur divers aspects de la parole, tels que les noms composés, les émotions, les mots étrangers, et les complexités syntaxiques, soulignant la versatilité du modèle.

Un futur prometteur, mais prudent

Alors que les innovations en intelligence artificielle ont dominé l’année 2023, les percées dans le domaine du texte vers la parole en 2024 pourraient continuer à démocratiser des technologies autrefois considérées comme futuristes. Toutefois, l’approche prudente de l’équipe de recherche rappelle l’importance d’une régulation adéquate, notamment en matière de sécurité et de confidentialité.

Cette évolution vers des interactions plus naturelles et humaines avec la technologie ouvre de nouvelles perspectives, non seulement pour les utilisateurs, mais aussi pour le développement futur de l’intelligence artificielle. BASE TTS d’Amazon pourrait bien être le prélude à une ère où la communication entre l’homme et la machine devient indiscernable de la conversation humaine.

Lire plus
Intelligence Artificielle

Apple va révolutionner Spotlight avec l’IA : nouvelle ère de recherche en 2024

2b0aba7a 7250 49d9 826c 4f1260ea835e

Dans le courant de l’année, Apple va se doter d’une toute nouvelle gamme de fonctionnalités de codage et de test de l’IA, et un nouveau rapport affirme que Apple apporte également un coup de pouce LLM à sa célèbre recherche Spotlight. Cette fonction est surtout connue pour sa disponibilité sur tous les ordinateurs et appareils mobiles Apple, avec la possibilité d’effectuer des recherches dans les fichiers locaux de la technologie, des recherches dans Safari, l’ouverture de diverses applications, et bien plus encore.

Il existe déjà différents rapports sur ce qu’Apple a à apporter concernant sa plongée dans l’intelligence artificielle, éventuellement disponible pour accéder à ses utilisateurs.

Bloomberg a rapporté qu’une nouvelle version de Spotlight sera bientôt disponible sur les appareils Apple tels que l’iPhone, l’iPad et les ordinateurs Mac, et qu’elle bénéficiera d’un coup de pouce de la part de l’entreprise. Cela se fera dans le cadre des diverses fonctionnalités de codage et de test de l’IA qu’elle lancera sur le Xcode, offrant une version plus puissante de Spotlight que les utilisateurs d’Apple ont actuellement.

Il s’agit d’une version « à l’étude » par Apple pour l’instant, qui bénéficierait de fonctions d’IA générative et offrirait des fonctionnalités plus complexes.

La recherche Spotlight est accessible rapidement sur l’iPhone, l’iPad ou l’iPod Touch en balayant vers le bas depuis le haut de l’écran. Elle permet de localiser des fichiers locaux et des e-mails, d’accéder à des applications et d’effectuer des recherches dans Safari, entre autres fonctions.

En revanche, il est possible d’accéder au Mac en le trouvant dans la barre de menu, en haut à droite de l’écran, ou en tapant Commande + Espace (barre d’espacement) sur le clavier.

Les projets massifs d’Apple en matière d’IA générative

Pour en revenir aux projets d’Apple en matière d’IA générative, ils commenceront par Xcode, qui aidera les développeurs à créer des applications et des fonctionnalités, et qui sera également capable de travailler avec GitHub Copilot de Microsoft.

Plus tard dans l’année, cette fonction de Xcode permettra aux développeurs tiers d’accéder à ces fonctionnalités, ainsi qu’à d’autres technologies d’IA prévues pour iOS 18.

L’ancienne entreprise la plus valorisée au monde n’a pas peur de l’IA, mais elle n’a pas précipité le développement de sa version de la technologie la plus puissante du moment, ne rejoignant pas la course comme ses rivaux de la Big Tech. Le PDG d’Apple, Tim Cook, a précédemment déclaré que des développements potentiels de l’IA seraient bientôt intégrés à ses produits, mais qu’ils devraient être placés sous ses yeux méticuleux et qu’ils devraient être responsables de leur réalisation.

En outre, Apple va dans l’autre sens, contrairement à Google et Microsoft qui ont fait en sorte que leur IA et leurs diverses expériences dans le cadre de leurs LLM soient dans le cloud. Dans le cas d’Apple, les rapports affirment qu’elle fonctionnerait sur du matériel, ce qui signifie que les utilisateurs pourraient y accéder localement et dépendre de l’appareil s’il prend en charge la technologie, et qu’elle ne ferait pas partie de son nuage.

Les chercheurs d’Apple ont récemment dévoilé un prototype d’intelligence artificielle générative avec des capacités d’animation de texte et des rumeurs de développement de l’intelligence artificielle pour iOS 18.

Lire plus
Intelligence Artificielle

ChatGPT-5 : date de sortie, prix et ce que nous savons déjà

f3e2ae8e 88ec 4d2e bc75 470850b9878a

Lors d’une récente conversation entre les PDG de Microsoft et d’OpenAI, Sam Altman a révélé que ChatGPT-5 devrait bénéficier d’importantes mises à jour de ses capacités en matière de parole, d’images et, à terme, de vidéo.

Dans son podcast « Unconfuse Me », Bill Gates et Sam Altman se sont penchés sur l’avenir de l’intelligence artificielle, notamment sur l’amélioration de sa capacité de raisonnement et de sa fiabilité générale. « La multimodalité sera importante », a déclaré Altman, faisant allusion à un avenir où l’intelligence artificielle (IA) pourra accomplir des tâches de plus en plus complexes et potentiellement remodeler divers secteurs, notamment la programmation, la santé et l’éducation.

La prochaine itération de ChatGPT, connue sous le nom de GPT-5, est attendue avec impatience. Ce grand modèle linguistique avancé est considéré comme une étape cruciale sur la voie de l’intelligence générale artificielle (AGI), qui permet aux machines d’imiter les processus de pensée humains.

Voici ce que l’on peut attendre de la prochaine version de GPT.

Y aura-t-il un ChatGPT-5 et que peut-il faire ?

Comme l’a suggéré Altman, ChatGPT-5 est déjà en cours de développement en tant que version actualisée de son prédécesseur, GPT-4. Le PDG d’OpenAI a déclaré : « Actuellement, GPT-4 ne peut raisonner que de manière extrêmement limitée, et sa fiabilité est également limitée », d’où l’objectif d’améliorer ses fonctionnalités actuelles.

GPT, qui signifie « Generative Pre-trained Transformer » (transformateur génératif pré-entraîné), est un modèle de langage basé sur l’apprentissage profond et conçu pour produire des textes qui ressemblent à l’écriture humaine. Il possède davantage de compétences en matière de traitement du langage naturel et est largement utilisé dans de nombreuses applications.

En plus d’être fiable, Altman a précisé que « l’adaptabilité et la personnalisation seront également très importantes ». « Les gens attendent des choses très différentes de GPT-4 ; des styles différents, des ensembles d’hypothèses différents — nous rendrons tout cela possible », a-t-il ajouté.

Altman a souligné que la capacité de GPT-5 à utiliser les données personnelles, notamment à comprendre les e-mails, les détails du calendrier, les préférences en matière de prise de rendez-vous, et à s’intégrer à des sources de données externes, sera l’une des principales avancées.

L’IA multimodale est conçue pour apprendre et utiliser une variété de types de contenus tels que les images, le son, la vidéo et les données numériques. OpenAI a déclaré que GPT-4 est un modèle multimodal, capable de traiter à la fois du texte et des images, bien qu’il soit limité à la génération de sorties sous forme de texte uniquement, mais que GPT-5 utiliserait plus de données pour s’entraîner.

« Nous avons lancé des images et du son, et la réponse a été beaucoup plus forte que prévu. Nous pourrons aller beaucoup plus loin, mais les progrès les plus importants concerneront peut-être la capacité de raisonnement », a déclaré Altman à Gates dans son podcast.

OpenAI a déjà indiqué qu’elle travaillait sur un assistant « super intelligent » capable de faire fonctionner un ordinateur à la place de son utilisateur. Il rivaliserait avec les assistants de travail IA de Microsoft et de Google, mais ces programmes n’en seraient qu’à leurs balbutiements.

Quand ChatGPT-5 sera-t-il lancé ?

Altman n’a toutefois pas révélé de date précise pour sa sortie. En novembre, il a déclaré au Financial Times que des équipes travaillaient sur le Large Language Model, mais il n’a pas précisé la date de sortie.

S’exprimant lors du World Governments Summit (WGS) à Dubaï cette semaine, Altman a réaffirmé que ChatGPT-5 « sera plus intelligent ».

« Ce n’est pas comme si ce modèle allait s’améliorer un peu, c’est parce que nous allons les rendre tous plus intelligents, ils seront meilleurs dans l’ensemble », a-t-il poursuivi. Il a également déclaré à Bloomberg qu’il s’attendait à ce que l’entreprise « prenne son temps » et s’assure de lancer un produit dans lequel elle se sentira « bien et responsable ».

Malgré le lancement rapide de GPT-4 à la suite de ChatGPT, ce dernier a fait l’objet de plus de deux ans de formation, de développement et de tests. Si GPT-5 suit un calendrier similaire, il pourrait arriver en 2025. Néanmoins, cela ne signifie pas que nous ne verrons pas de mises à jour de GPT-4. OpenAI devrait poursuivre le développement de GPT-4 et pourrait même introduire une mise à jour provisoire, potentiellement appelée GPT-4.5, dans l’intervalle.

ChatGPT-5 sera-t-il gratuit ?

Bien qu’il existe une version gratuite de ChatGPT, on ne sait pas si ChatGPT-5 nécessitera un abonnement comme son prédécesseur. Le plan d’abonnement ChatGPT Plus coûte 20 dollars par mois et offre aux abonnés des avantages exclusifs, notamment un accès prioritaire pendant les périodes de forte affluence, des temps de réponse améliorés, la possibilité d’utiliser des plugins et un accès exclusif à GPT-4. Les utilisateurs ont également accès à son modèle d’image IA interne, DALL-E.

Il est également important de noter que les modèles linguistiques actuels sont déjà coûteux à former et à entretenir. Cela signifie que lorsque GPT-5 sera finalement lancé, son accès nécessitera probablement un abonnement à ChatGPT Plus ou Copilot Pro.

En fin de compte, le lancement de GPT-5 pourrait permettre à GPT-4 de devenir plus abordable et accessible. Par le passé, le coût élevé de GPT-4 a dissuadé un certain nombre d’utilisateurs. Cependant, une fois qu’il sera moins cher et largement disponible, la capacité de ChatGPT à gérer des tâches complexes telles que le codage, la traduction et la recherche pourrait s’améliorer de manière significative.

Lire plus
Intelligence Artificielle

OpenAI lance Sora, un nouveau modèle d’IA pour la conversion de texte en vidéo

Screen Shot 2024 02 15 at 1.40.0 jpg

OpenAI ne se contente pas d’être connue comme la société ChatGPT ou même LLM. Dans une démarche innovante, OpenAI se lance dans la génération vidéo avec Sora, un modèle de GenAI qui transforme le texte en vidéos de 1080p. Ce développement vise à aider les utilisateurs à relever les défis de l’interaction avec le monde réel en générant des vidéos qui adhèrent étroitement aux prompts spécifiés tout en conservant une grande fidélité visuelle.

Le cofondateur et PDG Sam Altman a déclaré sur X (anciennement Twitter) qu’il s’agissait d’un « moment remarquable ».

Bien que le produit ne soit pas encore officiellement utilisable par le plus grand nombre en raison de ce que Altman a qualifié dans son message de « red-teaming initial », c’est-à-dire de tests opposés de ses défenses de sécurité, de ses failles et de ses utilisations abusives, le fondateur a indiqué qu’il était mis à la disposition d’un « nombre limité de créateurs », l’expansion publique étant prévue à une date ultérieure.

Sora se distingue par sa capacité à créer des scènes dynamiques avec divers personnages, types de mouvements et détails d’arrière-plan, promettant une immersion à la hauteur des films. Le modèle peut également enrichir des clips vidéo existants, ajoutant des détails manquants pour une expérience plus complète.

ezgif 1 a559a3c1e8

ezgif 1 02294151d2

ezgif 1 c767cd7883

Avec une compréhension profonde du langage, Sora interprète avec précision les demandes des utilisateurs, donnant vie à des personnages expressifs et de vives émotions. Ce modèle comprend la demande non seulement dans le contexte du langage, mais aussi dans sa manifestation physique réelle.

Sora est capable de générer des vidéos jusqu’à une minute dans une variété de styles, y compris photoréaliste, animé, et noir et blanc, évitant ce que l’on pourrait appeler les « bizarreries de l’IA » communes à d’autres technologies de génération de texte en vidéo.

Quelques limites identifiées

Si Sora présente des capacités impressionnantes en matière de génération de scènes vidéo détaillées et complexes, il rencontre également des difficultés en ce qui concerne la précision de la simulation physique et la reconnaissance des détails dans l’espace. Ces défis mettent en évidence les limites actuelles du modèle dans la compréhension et la reproduction des complexités de la physique et des relations spatiales du monde réel.

OpenAI positionne Sora comme un aperçu de recherche, conscient du potentiel d’abus de cette technologie et travaillant activement à développer des outils pour détecter les vidéos générées par Sora. La société envisage une collaboration avec des experts, des décideurs politiques, des enseignants et des artistes pour explorer les cas d’utilisation positive de cette technologie, tout en incluant des métadonnées de provenance dans les productions générées pour garantir une utilisation sûre et responsable de Sora.

Lire plus
Intelligence Artificielle

Gemini 1.5 de Google : une révolution IA pour les professionnels et développeurs

press kit gemini header

Seulement quelques semaines après le déploiement de Gemini, le Large Language Model de Google destiné à révolutionner le secteur de l’IA, la firme de Mountain View annonce déjà son successeur : Gemini 1.5. Accessible dès aujourd’hui pour les développeurs et les entreprises, en prélude à un lancement grand public imminent, Google mise pleinement sur Gemini comme outil professionnel et assistant personnel.

Gemini 1.5 se distingue par de nombreuses améliorations, notamment Gemini 1.5 Pro, la version grand public, qui rivalise désormais avec Gemini Ultra, le modèle haut de gamme récemment introduit. Surpassant Gemini 1.0 Pro dans 87 % des benchmarks, Gemini 1.5 utilise une technique de plus en plus répandue, le « Mixture of Experts » (MoE). Cette méthode permet d’activer seulement une partie du modèle pour une requête donnée, optimisant ainsi la rapidité d’utilisation pour l’utilisateur et l’efficacité opérationnelle pour Google.

L’innovation majeure de Gemini 1.5 réside dans son contexte élargi, capable de traiter des requêtes bien plus vastes et d’examiner une quantité d’informations considérable en une seule fois. Avec une fenêtre de contexte atteignant le million de tokens, bien au-delà des 128 000 de GPT-4 d’OpenAI et des 32 000 de l’actuel Gemini Pro, cette avancée permet d’aborder des contenus d’une ampleur sans précédent. Sundar Pichai, PDG de Google, simplifie la comparaison : « cela représente environ 10 ou 11 heures de vidéo, des dizaines de milliers de lignes de code ».

press kit tokens scale static jpg

Cette capacité étendue ouvre des perspectives nouvelles, tant pour les utilisateurs individuels que pour les entreprises. Pichai évoque la possibilité pour les cinéastes de soumettre un film entier à Gemini pour anticiper les critiques, ou pour les entreprises d’analyser d’immenses volumes de données financières. « Je considère cela comme l’une de nos percées les plus significatives, » affirme-t-il.

Pour l’instant, Gemini 1.5 est exclusivement disponible pour les utilisateurs professionnels et les développeurs via Vertex AI et AI Studio de Google. À terme, il remplacera Gemini 1.0, et la version standard de Gemini Pro, accessible à tous via gemini.google.com et les applications de l’entreprise, sera mise à niveau vers 1,5 Pro, avec une fenêtre de contexte de 128 000 tokens. L’accès à la fenêtre d’un million de tokens sera soumis à un surcoût. Google teste également les limites de sécurité et d’éthique du modèle, notamment en ce qui concerne la nouvelle fenêtre de contexte élargie.

Gemini1.5Pro AIStudio Sherlock J jpg

Une course à l’IA

Dans la course effrénée pour développer le meilleur outil d’IA, Google semble prendre une longueur d’avance, notamment pour ceux déjà intégrés dans son écosystème. Cependant, la concurrence reste vive, notamment avec les récentes annonces d’OpenAI concernant la « mémoire » pour ChatGPT et ses ambitions dans la recherche Web.

Selon Pichai, l’évolution rapide de la technologie sous-jacente continue de captiver l’attention du public, même si, à terme, l’expérience utilisateur primera sur les détails techniques.

Cette initiative de Google marque une étape importante dans le développement des capacités de l’IA, ouvrant la porte à des applications plus vastes et plus complexes. Reste à voir comment ces avancées seront adoptées par les développeurs et les entreprises, et quel impact elles auront sur l’évolution future des modèles d’IA générative.

Lire plus
Intelligence Artificielle

Gemini se réinvente : l’avenir des écouteurs connectés avec Google

vs2CpSW8PQQuYFYLl1Iy0E2sZeGOPFVrsVNAGCrxt7oB3aHZkKeXhzNvUTN3U0tPNE2 HXlmzNXBVqEICsPeSfrIDCKGBb3WfNMgrw e365 w3000

Depuis son lancement (ou sa renaissance sous un nouveau nom) la semaine dernière, Google n’a cessé d’enrichir Gemini, la dernière version de son chatbot, avec de nouvelles mises à jour. Tout a commencé avec le changement de nom de « Bard » en « Gemini », visant à aligner le branding sur le nom du Large Language Model (LLM) qui l’anime.

Puis, une version payante a été introduite, ainsi qu’une application mobile pour Android, transformant Gemini en un assistant virtuel pour smartphone.

Selon une découverte récente de l’équipe de 9to5Google, qui a fouillé dans le code de la dernière version bêta de l’application Google pour Android (version 15.6), Google pourrait être en train de préparer une mise à jour encore plus significative pour Gemini, qui changerait notre utilisation des écouteurs connectés.

Actuellement, l’invocation de l’assistant virtuel par des écouteurs tels que les Pixel Buds active toujours Google Assistant, même si Gemini est configuré comme assistant par défaut sur le smartphone de l’utilisateur.

Toutefois, des indications cachées dans le code suggèrent que cela pourrait bientôt changer. Bien que Google n’ait pas encore annoncé officiellement ou laissé entendre une telle intégration, la présence d’une chaîne de caractères décrite comme « l’application mobile Gemini travaille à élargir sa disponibilité pour être accessible depuis vos écouteurs » nous donne une idée claire de ce qui est en préparation, sans toutefois préciser comment l’intégration sera gérée.

Quels avantages pour les utilisateurs ?

L’intégration de Gemini dans les écouteurs pourrait révolutionner l’expérience d’écoute. Imaginez un contrôle mains libres et ultra-performant : changer de pistes, contrôler la lecture, se faire lire des résumés d’articles, voire résoudre des formules complexes tout en se déplaçant.

Bien que ces développements en soient encore à leurs débuts, ils pourraient ouvrir la voie à une nouvelle ère de son et de capacités pilotées par l’IA, comme un égaliseur adapté à vos habitudes d’écoute ou à la chanson que vous écoutez à un moment donné. Les possibilités semblent infinies et promettent d’être passionnantes à explorer. Espérons que nous n’aurons pas à attendre trop longtemps pour découvrir cela.

Lire plus
Intelligence Artificielle

MWC 2024 : Nokia prépare l’industrie avec MX Workmate, son nouvel assistant IA

62edd851 6442 4e19 b63b f4a99a85c9a2

La prochaine édition du Mobile World Congress (MWC) ne se limitera pas à la présentation des derniers smartphones haut de gamme, tels que le Honor Magic 6 Pro et le Xiaomi 14 Ultra, attendus avec impatience par le public international. Cette année, Nokia réserve également une surprise de taille.

Contrairement aux attentes, le géant finlandais ne dévoilera pas un nouveau smartphone facile à réparer tel que le Nokia G22. Nokia s’apprête plutôt à présenter un assistant personnel alimenté par l’intelligence artificielle (IA).

Avant de soupirer d’indifférence, sachez que cette innovation n’est pas une énième réponse aux assistants IA populaires comme Gemini de Google. Selon Reuters, l’outil IA de Nokia est conçu pour générer des messages destinés aux travailleurs industriels, incluant des alertes sur les équipements défectueux basés sur des données en temps réel, et propose même des recommandations pour augmenter la production en usine.

Baptisé « MX Workmate », cet outil entend enrichir la technologie de communication existante de Nokia, déjà utilisée par des clients industriels, en exploitant les modèles de langage génératif pour rédiger des textes semblables à ceux d’un humain, a indiqué l’entreprise.

La première version de cet assistant IA sera présentée lors du prochain MWC qui se tiendra à la fin février à Barcelone. Certaines fonctionnalités de l’assistant sont encore au stade de la recherche, les développeurs souhaitant éviter les « hallucinations IA » — c’est-à-dire lorsque l’IA fournit une réponse convaincante, mais totalement fictive.

Une première version

« L’outil doit être précis, clair et correct. Il doit également être traçable et modéré », a expliqué Stéphane Daeuble, responsable du marketing des solutions d’entreprise chez Nokia. Des mesures de sécurité initiales, telles que la validation des prompts de l’IA par une personne, seront mises en place.

Nokia fournit déjà des technologies 4G et 5G pour les communications internes, permettant aux entreprises industrielles d’accéder aux données issues des capteurs de machines. « L’idée est maintenant de disposer d’un assistant pour aider les travailleurs à interpréter toutes ces données », a ajouté Daeuble.

Il conclut en estimant qu’il faudra peut-être attendre un an, voire un an et demi, avant de voir la première mise en œuvre concrète de cette technologie.

Lire plus
Intelligence Artificielle

Gemini de Google : avancées et questions de vie privée

Gemini SS.width 1300 1

Un avertissement de Google sur la protection de la vie privée indique qu’il existe un risque si les utilisateurs divulguent des informations personnelles lorsqu’ils utilisent des applications d’intelligence artificielle (IA).

La société Alphabet Inc. a confirmé le changement de nom de Bard, qui s’appellera Gemini et deviendra l’assistant d’intelligence artificielle phare des appareils Android. L’application apportera des avancées et une plus grande cohésion entre les différents services sur les smartphones, mais il semble aussi avoir un coût.

Comme le rapporte ZDNet, dans les informations en petits caractères contenues dans le Hub de confidentialité des applications Gemini, un avertissement stipule que Google recueille des conversations, la localisation, des commentaires et des informations d’utilisation lorsque Gemini est activé.

L’objectif de la collecte de ces informations est énoncé de manière vague, mais il pourrait amener les utilisateurs à se demander qui a accès à leurs conversations avec l’outil Gemini et pourquoi.

Google déclare : « Nous prenons votre vie privée au sérieux et nous ne vendons vos informations personnelles à personne. Pour améliorer Gemini tout en protégeant votre vie privée, nous sélectionnons un sous-ensemble de conversations et utilisons des outils automatisés pour supprimer les informations permettant d’identifier l’utilisateur (telles que les adresses électroniques et les numéros de téléphone) ».

Avertissement sur la confidentialité de Gemini

Cette partie ne semble pas trop préoccupante, mais l’avertissement suit, dans la section intitulée Vos données et les applications Gemini, avec ce qui suit : « Veuillez ne pas saisir d’informations confidentielles dans vos conversations, ni de données que vous ne souhaiteriez pas qu’un évaluateur voie ou que Google utilise pour améliorer nos produits, nos services et nos technologies d’apprentissage automatique ».

Du point de vue de la protection de la vie privée, la confirmation que les données des utilisateurs sont conservées pendant 3 ans constitue une révélation alarmante. Les conversations Gemini examinées par des évaluateurs humains sont conservées pendant cette période, même si l’activité de l’application est supprimée, car elles sont conservées séparément et ne sont pas liées à un compte Google.

Le géant de la technologie a été transparent, dans une certaine mesure, sur le fait qu’il faut bien réfléchir aux informations que l’on échange avec Gemini et ne pas fournir de détails personnels sensibles que l’on ne souhaiterait pas voir conservés par la technologie d’intelligence artificielle.

Vous êtes prévenus.

Lire plus
Intelligence Artificielle

Révolutionnez votre travail d’équipe avec Slack AI

Slack AI Search

Slack s’apprête à révolutionner la gestion du travail en équipe avec le lancement d’une suite de fonctionnalités intégrées d’intelligence artificielle, destinées à optimiser la communication et l’organisation au sein des entreprises.

Cette avancée, baptisée Slack AI, promet de transformer l’expérience utilisateur sur la plateforme en offrant des résumés de discussions et des récapitulatifs de canaux, tout en permettant aux utilisateurs de poser des questions spécifiques sur leur environnement de travail.

L’initiative Slack AI, qui a fait l’objet de tests préliminaires l’année dernière, est désormais en cours de déploiement sous forme d’option payante pour les utilisateurs de Slack Enterprise. Cette innovation pourrait s’avérer particulièrement utile pour les employés cherchant à se mettre à jour sur des fils de discussion auxquels ils ont été mentionnés, ou désireux de se tenir informés des conversations récentes au sein de leurs canaux de travail.

Avec l’emploi de l’IA générative pour améliorer la recherche et la capacité de résumé, Slack AI est conçu pour analyser et condenser d’énormes volumes de données en informations concises et exploitables. Cette facilité d’accès à l’information est désormais disponible en tant qu’option payante pour les abonnés de Slack Enterprise, offrant une solution intuitive qui ne nécessite aucune formation préalable et peut être mise en œuvre ou interrompue rapidement. Cette option offre la possibilité de résumer les messages non lus, ceux publiés au cours des 7 derniers jours, ou ceux envoyés sur une période personnalisée, facilitant ainsi le rattrapage des informations clés après une absence.

Slack AI Summarize

En outre, Slack AI est capable de répondre à des questions concernant des projets spécifiques ou la politique de l’entreprise, à condition que ces sujets aient été abordés dans Slack. L’outil peut même définir les acronymes utilisés, s’appuyant sur les messages pertinents pour fournir des éclaircissements.

Slack AI Search

L’intégration de Slack AI avec d’autres applications tierces enrichit encore cette expérience, en permettant par exemple de résumer des documents Notion directement dans les aperçus de liens, ou de poser des questions sur des contenus stockés dans Box.

Uniquement en anglais américain et britannique pour le moment 

Slack AI Digest

Slack ne se contente pas de ces nouveautés et annonce le développement d’autres outils destinés à résumer et prioriser l’information. Parmi les fonctionnalités à venir, une nouvelle option de digest offrira les points forts des canaux sélectionnés, idéale pour les utilisateurs pressés par le temps. La plateforme travaille également à l’intégration native d’Einstein Copilot, un chatbot IA capable de rédiger des messages aux collègues.

Il est important de souligner que les modèles de Large Language Model (LLM) utilisés par Slack sont hébergés directement sur la plateforme, garantissant ainsi que les données des clients restent isolées et ne sont pas utilisées au profit d’autres clients. Slack assure également que ces données ne serviront pas à l’entraînement des LLM.

Bien que les détails concrets sur la tarification de l’option Slack AI restent à préciser, le service sera initialement disponible en anglais américain et britannique, avec des plans supplémentaires et des options de prise en charge linguistique prévus pour bientôt.

Lire plus
Intelligence Artificielle

Sam Altman, PDG d’OpenAI, révèle le danger de l’IA qui l’empêche de dormir

1663509d 7d6d 4948 9d46 9671ce3dfc3a

Le PDG d’OpenAI, Sam Altman, a fait des commentaires prudents sur l’importance d’atténuer les dangers de l’intelligence artificielle (IA), tout en révélant les préoccupations qui l’empêchent de dormir.

S’exprimant par liaison vidéo lors du World Government Summit à Dubaï (Émirats arabes unis), il a demandé qu’un régulateur universel joue un rôle crucial dans la protection des progrès futurs de l’IA, afin d’écarter la menace de dommages graves pour la société.

Le dirigeant de 38 ans a fait référence à l’Agence internationale de l’énergie atomique comme étant le type d’organisme qu’il envisage pour cette industrie, y compris une relation distante avec les développeurs, comme l’a rapporté ABC News.

« Il y a là des choses faciles à imaginer où les choses tournent vraiment mal et je ne suis pas très intéressé par les bots tueurs qui se promènent dans les rues et qui tournent mal », a déclaré Altman.

« Je suis beaucoup plus intéressé par les déséquilibres sociétaux très subtils où nous avons ces systèmes dans la société et où, sans mauvaise intention particulière, les choses tournent terriblement mal », a-t-il ajouté.

Le temps de l’action

Parvenant à trouver le ton juste avec son auditoire, Altman a indiqué que des entreprises comme OpenAI — le développeur de ChatGPT — devraient être liées par une organisation jouant un rôle de supervision et bénéficiant de l’apport de nombreux acteurs du secteur technologique à l’échelle mondiale.

« Nous en sommes encore au stade des discussions. Tout le monde organise une conférence. Tout le monde a une idée, un document d’orientation, et c’est très bien ainsi », a poursuivi Altman. « Je pense que nous sommes encore à une époque où le débat est nécessaire et sain, mais à un moment donné dans les prochaines années, je pense que nous devons nous diriger vers un plan d’action avec une véritable adhésion dans le monde entier ».

Après son retour à OpenAI en décembre, le patron de l’entreprise soutenue par Microsoft a évoqué les appréhensions de la société à l’égard de l’IA avancée, en annonçant la création d’un conseil d’éthique de l’IA. Les commentaires qu’il a formulés lors du sommet mondial des gouvernements reflètent donc une approche cohérente.

Lire plus