Le récap

Le récap de la semaine · 27 septembre

IA Contenu généré par intelligence artificielle : texte écrit par une IA, lu par des voix de synthèse · sujet sensible, traité avec prudence.

Intégrer ce passage sur votre site

Collez ce code dans votre article ou votre page : le lecteur prend la largeur disponible.

Thème

Transcription avec les sources de chaque passage

Token FM

Token FM, la radio de l'IA, faite par l'IA. Place au récap.

Ondine

Ringg affirme que ses agents d’intelligence artificielle utilisant GPT-5.6 résolvent jusqu’à 65 % des appels de ses clients, selon OpenAI. L’entreprise indique que ses agents multilingues fonctionnent par téléphone, sur le chat, WhatsApp et le Web. Ringg affirme aussi que GPT-5.6 coûte 90 % de moins que GPT-4.1 pour ces agents.

Ondine

OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles pensés pour des usages différents et pour réduire le coût de certaines tâches. Sol vise les travaux complexes, notamment le codage et les processus en plusieurs étapes. Luna cible plutôt les réponses rapides et les usages à fort volume. OpenAI présente ainsi deux options qui arbitrent différemment entre capacités et coût. L’entreprise annonce une réduction de 90 % sur les jetons d’entrée déjà mis en cache, et attribue la baisse des tarifs à des améliorations du cache et de l’inférence. La comparaison avec la génération précédente doit toutefois être lue avec prudence : Clubic indique qu’elle pourrait s’appuyer sur des tarifs promotionnels, sans préciser lesquels. Les modèles sont disponibles dans l’interface de programmation, ChatGPT Work, Codex et Amazon Bedrock. Leur arrivée dans le chat en ligne de ChatGPT n’était pas encore confirmée de manière uniforme au lancement. OpenAI propose également des standards internationaux fondés sur des évaluations communes, le signalement des incidents et une gouvernance coordonnée. L’entreprise veut notamment encadrer les recherches automatisées et maintenir une supervision humaine. OpenAI présente donc à la fois de nouveaux modèles et une proposition de règles communes pour évaluer les systèmes et signaler les incidents. Pour les nouveaux modèles, l’entreprise met en avant des tarifs plus bas ; pour la sécurité, elle préconise des méthodes partagées et une gouvernance coordonnée.

Ondine

Sonar compare Claude Opus 5.5 à Opus 5 sur 544 tâches de programmation, avec des tests exécutables. Opus 5.5 réussit 87,7 % des tâches, contre 88,6 % pour son prédécesseur. Le nouveau modèle affiche donc un taux de réussite légèrement inférieur dans cette évaluation. Il génère toutefois 27,5 % de lignes de code en moins et utilise 40 % de jetons en moins. Sonar recense 10 941 problèmes pour Opus 5.5, contre 18 814 pour Opus 5, soit une baisse de 42 %. Pour les problèmes les plus graves, les résultats recensés diminuent de 41 % en fiabilité, de 53 % en sécurité et de 20 % en maintenabilité. Ce bilan n’est pas uniforme. La densité de bugs augmente de 12 %, passant de 576 à 644 par million de lignes de code. Les problèmes de concurrence, qui surviennent lorsque plusieurs opérations interagissent, progressent eux aussi de 44 %. Les résultats distinguent le nombre total de problèmes de la densité de bugs : les premiers diminuent, tandis que la seconde augmente. Sur les tâches évaluées, Opus 5.5 produit donc moins de code et présente moins de problèmes recensés au total que son prédécesseur, mais son taux de réussite est légèrement inférieur et certains indicateurs de défauts progressent. Pour comparer les deux modèles, il faut tenir compte à la fois de la réussite, du volume de code produit et des différentes catégories de problèmes relevés.

Ondine

SpaceXAI lance Grok 4.7, un modèle multimodal doté d’une fenêtre de contexte de 500 000 jetons et d’outils pour rechercher sur le Web ou X, appeler des fonctions et exécuter du code, selon Next. Il accepte du texte et des images, et sa base de connaissances s’arrête à mai 2026. L’entreprise le présente comme une évolution de Grok 4.6, avec davantage de capacité et un entraînement par renforcement plus long sur des tâches complexes. Les premiers résultats rapportés ne donnent pas un verdict uniforme. Artificial Analysis relève des progrès dans la création de documents, mais plusieurs testeurs jugent le modèle en retrait face à des concurrents. Un autre bilan le place en milieu de tableau sur un indice général et le situe derrière Claude Fable 5.1 et GPT-6 sur plusieurs tests. Les comparaisons restent à interpréter selon les tâches et les niveaux de raisonnement utilisés. SpaceXAI affirme aussi que Grok 4.7 vérifie mieux son travail, tient mieux les longs contextes et possède de solides capacités de défense informatique. Ses revendications sur un test de cybersécurité et sur la proportion de requêtes risquées refusées ne sont pas établies indépendamment. La disponibilité, elle, s’étend à des outils de développement : Grok 4.7 est accessible sur Cursor et Grok Build, et son intégration à plusieurs offres Copilot est progressive. Son tarif d’API reste celui de Grok 4.6, à 2 dollars par million de jetons en entrée et 6 dollars en sortie. Mais sa plus grande verbosité peut augmenter la facture réelle. C’est le point à retenir : un prix unitaire inchangé ne garantit pas un coût total identique si le modèle consomme davantage de jetons. Grok 4.7 élargit donc les options disponibles pour le codage et le travail intellectuel, mais ses avantages annoncés restent à distinguer des résultats effectivement comparés.

Ondine

Une enquête menée pour Politico indique que 62,3 % des personnes interrogées en France voient dans l’intelligence artificielle avancée un risque au moins modéré de détruire l’humanité, selon Clubic. L’institut Public First a réalisé ce sondage en ligne du 13 au 15 septembre auprès de 2 094 adultes en France. Les réponses se répartissent entre 26,6 % qui évaluent ce risque comme modéré, 23,5 % qui le jugent important et 12,2 % qui considèrent la destruction de l’humanité par l’intelligence artificielle presque certaine. À l’inverse, seuls 6,3 % écartent tout danger. Parmi les 6 pays occidentaux étudiés, seuls les Allemands et les Espagnols sont nettement moins nombreux que les Français à percevoir un risque au moins modéré. Ces réponses montrent que les inquiétudes ne se limitent pas aux spécialistes et aux dirigeants de laboratoires. Elles ne signifient pas pour autant que les personnes interrogées prédisent toutes le même scénario ou le même horizon : le sondage mesure un niveau de perception du risque, pas une probabilité scientifique de catastrophe. Le résultat prend une résonance particulière après les prises de parole sur la sécurité de l’IA et la nécessité d’une coopération internationale. Des dirigeants ont défendu des évaluations communes et le maintien d’un contrôle humain, tandis que la cadence des nouveaux modèles reste soutenue. Ce qu’il faut retenir, c’est l’ampleur de la préoccupation déclarée en France : près de 2 personnes sur 3 interrogées voient au moins un risque modéré. Le chiffre invite à prendre au sérieux la confiance du public, tout en gardant à l’esprit qu’un sondage décrit des opinions et ne tranche pas le niveau réel du danger.

Ondine

Proaction affirme avoir augmenté ses ventes de 60 % et économisé plus de 75 heures grâce à Codex, selon OpenAI. Le groupe utilise également GPT-Live-1 et GPT-6 Astra pour développer, exploiter et vendre ses solutions de gestion de flottes. Ces résultats sont ceux qu’OpenAI attribue à l’utilisation de Codex chez Proaction.

Une erreur ?

Signalez-la : le message part avec l'adresse de cette page, son titre et son heure de diffusion. Une personne mise en cause peut aussi exercer son droit de réponse.

Signaler une erreur

Un mot pour la rédaction ?

Une remarque, une idée de sujet, un avis sur ce passage : votre message va à la rédaction seulement, il n'est pas publié.