Vous prendrez bien un CroissantLLM ?
Comme beaucoup d’entre vous je m’intéresse à "IA". Je ne vais pas vous parler de ChatGPT4, Gemini, ou Claude3 mais d’un LLM Français et Open Source : CroissantLLM !
CroissantLLM est né d’un partenariat industriel et académique à CentraleSupélec (Université Paris Saclay) qui a débuté en 2023. Par la suite d'autres acteurs se sont greffé au projet. Partie d'une initiative de recherche d'intégration de données francophone, il a été pensé pour l'industrie avec un modèle Open-Source et assez léger (petit modèle). Il peut être ainsi déployé localement au sein de plusieurs « Agents IA Autonomes » (on en reparle à la fin de cet article). J’avais déjà eu l’occasion d’étudier ce LLM, mais suite à une présentation & rencontre avec Manuel Faysse, un des contributeurs principaux du projet, j’ai décidé de vous présenter ce projet et ma vision sur ce type de modèle.
Le modèle est de type "décodeurs", il est assez petit mais il a reçu énormément de données ce qui le rend comparable à llama 2. Avec CroissantLLM, l'anglais n'est pas la langue dominante mais à l’identique du français (50%). L’atout est le corpus de données utilisées pour entraîner le modèle. Ces données sont de plusieurs natures :
Culturelles : issue de la littérature francophone, poésie, paroles de chanson..
Juridiques et administratives : texte de loi, débat parlementaire, transcriptions de discours…
Académiques et industrielles : encyclopédie, publication scientifique, rapports techniques…
D’internet où les données collectées ont été filtrées. Les sources de ces données ont fait l’objet d’une attention particulière concernant la qualité ou la dé-duplication.
Ainsi CroissantLLM maîtrise parfaitement les spécificités de la langue et de la culture françaises (il est pratiquement le seul LLM). Toutes les données collectées relèvent de licences permissives (BNF…). Mais l'intérêt de ces données pour CroissantLLM est que l'équivalent anglais des textes (traduction) a été sélectionné comme des données parallèles, c’est-à-dire des phrases en français ont été associées aux mêmes phrases en anglais. L'alignement des connaissances entre les 2 langues permet à CroissantLLM d’être un champion dans le domaine de la traduction. Croissant LLM a été entraîné sur cet ensemble de 3000 milliards de données (anglais et français), soit un un des plus grand corpus du modèle de données. Cet entraînement s’est fait sur le supercalculateur Jean Zay (240 GPU) pendant près de 100 000 heures ou 17 jours.
CroissantLLM est excellent LLM français pour sa taille. Il est ainsi très bon pour la reformulation et comme mentionné ci-dessus, pour la traduction (il bat Mistral…). Cela reste cependant un petit modèle de langage avec 1,3 milliard de paramètres. Il ne va donc pas rivaliser avec les mêmes capacités généralistes en raisonnement, en mathématiques ou en codage que les modèles plus grands. L’autre point différenciant de Croissant par rapport aux autres LLM et qu’il a été conçu dès le départ avec la plus grande transparence ( 80 % des critères de transparence sur le cadre FMTI)
Les données utilisées pour l’entraînement sont ouvertes, sourcées avec une transparence totale, et conformes. CroissantLLM, par sa taille modeste, n’a pas besoin de puissance pour fonctionner. Ainsi sur un PC « bureautique », il peut fournir des réponses de 30 tokens/s (à comparer au rythme humain « limité » à 7 ou 8 mots par seconde). Si sur ce PC on intègre une carte GPU bas de gamme, on arrive sans problème à 120 tokens/s. C’est là l’avantage de ce petit modèle, il est très frugale en ressources. Dans le contexte actuel du « Green IT », cette faible consommation énergétique est un atout pour les LLM « légers ». Ainsi, hormis la phase d’entraînement du modèle qui a nécessité une quantité significative d’électricité, en production CroissantLLM utilise très peu de ressources. On constate que l’industrie n’emploie pas de grands LLM, elle préfère des modèles petits, rapides et autonomes. Même si l’automobile ou l’aviation sont des secteurs où on pense immédiatement à l’utilisation de ces modèles pour créer des transports autonomes mais intelligents, il existe déjà d’autres applications. On peut citer par exemple, les robots devant intervenir dans des lieux sensibles en « autarcie » : exploration spatiale ou en haute profondeur, zone radioactive ou de conflits… Mais CroissantLLM peut servir dans notre quotidien car nous ne disposons pas à notre domicile de salles de serveurs informatiques requises pour héberger et exécuter ChatGPT ! CroissantLLM est AI Générative pouvant fonctionner sur une architecture légère comme votre smartphone. On peut le spécialiser sur certaines tâches comme la traduction instantanée : Comme tout sera local, on va gagner sur la latence réseau. A ce titre il existe déjà un projet d’implémentation local de traduction pour éviter l’échange de données vers le cloud (https://github.com/numerique-gouv/croissant-translate). Les perspectives sont énormes pour ce type de modèle. Ainsi nous sommes passés d’un mode où nous devions nous déplacer pour faire certaines tâches (et faire la queue dans une file d’attente !) à un mode numérique où de chez nous nous réalisons les mêmes tâches à travers des formulaires numériques. Demain un agent autonome pourra analyser nos habitudes, et faire pour nous et en parfaite autonomie ces tâches. Il les anticipera ! Cet agent n’aura pas besoin d’être connecté, il sera localement notre « partenaire ». On pourra l’emmener avec nous dans notre quotidien (Peut-être avec notre smartphone). Nous serons garants que nos données ne quittent pas cette IA. Certes celle-cil devra interagir avec d’autres IA sur internet : pour acheter des courses, payer nos factures, réserver une séance de cinéma, prévenir les secours si besoin… Mais le contexte et les datasets resteront en mode « local ». En effet, les citoyens et les états sont de plus en plus regardant sur les données, de premiers textes commencent à limiter la dépendance vers les LLM de type cloud. Je pense que cette tendance va s’accélérer. A notre travail, ce même type d’IA Générative sera présent sur notre poste. Il fera pour nous des tâches répétitives. Déjà aujourd’hui dans le monde du développement les habitudes changes. Des « copilotes » produisent une partie du code sans valeur ajoutée. Demain ces LLM légers permettront d’extraire des données, de mettre en forme des résultats ou documents, de générer de l’information pertinente, de planifier les taches d’un projet et d’en suivre l’évolution… Il y aura un impact sur l’emploi, l’homme sera plus productif. IA permettra à ceux qui sauront en tirer profit de gagner en performance et d’accomplir plus de tâches. Notre modèle social basé sur le travail devra peut-être être revu et pivoter sur un financement à travers la consommation ou les résultats des entreprises… Mais là c’est un autre débat.
Pour en revenir à cet article et si vous désirez ajouter vos données dans le corpus de ce LLM, vous pouvez trouver toutes les informations concernant CroissantLLM : https://huggingface.co/croissantllm Et si vous désirez en connaître plus sur CroissantLLM, je vous invite à suivre cette présentation : https://www.youtube.com/watch?v=4MNwvMUiREg&t=3623s









