L'évolution du moteur de recherche de MYETV : Comment l'IA et les dictionnaires multilingues changent la donne

Pourquoi la recherche compte

Le MYETV Search Engine est déjà l'un des moteurs de recherche les plus sophistiqués du web. La recherche est le cœur de toute plateforme de contenu. C'est le pont invisible entre ce que vous pensez et ce que vous essayez de trouver. Lorsque vous tapez "the future of ai" dans une boîte de recherche, vous ne devriez pas obtenir zéro résultat simplement à cause d'une faute de frappe. Vous devriez obtenir exactement ce que vous vouliez : "the future of AI".

Aujourd'hui, nous sommes ravis de partager une étape majeure dans le parcours de MYETV : une refonte complète de notre moteur de recherche, alimenté par l'intelligence artificielle, des dictionnaires multilingues et un traitement du langage naturel avancé. Ce n'est pas seulement une mise à niveau technique, c'est un changement fondamental dans la manière dont MYETV vous comprend.

Plongeons dans ce que nous avons construit, pourquoi c'est important et comment cela fonctionne en coulisses.


Le Problème : La Recherche Traditionnelle est Trop Rigide

Les moteurs de recherche traditionnels sont impitoyables. Ils correspondent aux mots exactement comme vous les tapez. Si vous recherchez "miusic video", la plupart des systèmes ne retourneront rien ou afficheront des résultats complètement sans rapport. Ils ne comprennent pas la langue, ils correspondent simplement aux modèles.

Ceci devient encore plus problématique dans une plateforme multilingue et mondiale comme MYETV, où les utilisateurs parlent anglais, italien, espagnol, français, allemand, portugais et de nombreuses autres langues. Un utilisateur à Rome pourrait rechercher "tutorail vidio" en anglais, tandis qu'un autre à Madrid recherche "música" avec une faute de frappe comme "musica" (sans l'accent). Les moteurs de recherche traditionnels ont du mal avec ces scénarios du monde réel.

Nous nous sommes demandé : Et si notre moteur de recherche pouvait penser comme un humain ? Et s'il pouvait corriger votre orthographe, comprendre le contexte, détecter la langue automatiquement et même suggérer du contenu en fonction du sens sémantique plutôt que des correspondances exactes de mots ?

C'est exactement ce que nous nous sommes efforcés de construire.


La Solution : Un Système de Recherche Alimenté par l'IA à Trois Couches

Notre nouveau moteur de recherche combine trois technologies puissantes qui fonctionnent en harmonie :

1. Correction des dictionnaires multilingues

2. Compréhension sémantique BERT

3. Correspondance de titres consciente du contenu

Décomposons chaque couche.

Tags suggestions

Couche 1 : Correction des dictionnaires multilingues

La Fondation : Plus de 50 000 mots dans 20 langues

Au cœur de notre nouveau moteur de recherche se trouve un dictionnaire multilingue massif contenant plus de 50 000 mots soigneusement sélectionnés dans 20 langues. Ce ne sont pas de simples listes de mots aléatoires — ce sont des vocabulaires pondérés par fréquence qui représentent la manière dont les gens communiquent réellement en ligne.

AI Suggestions

Voici ce que nous avons inclus :

  • Anglais: 10 000 mots les plus courants
  • Italien: 10 000 mots les plus courants
  • Espagnol: 10 000 mots les plus courants
  • Français: 10 000 mots les plus courants
  • Allemand: 10 000 mots les plus courants
  • Portugais: 10 000 mots les plus courants
  • Plus 14 langues supplémentaires: Néerlandais, Russe, Polonais, Turc, Arabe, Chinois (simplifié), Japonais, Coréen, Hindi, Suédois, Norvégien, Danois, Finnois et Grec

Chaque mot est indexé avec sa fréquence d'utilisation, ce qui signifie que le système donne la priorité aux mots courants plutôt qu'aux mots obscurs lors de la suggestion de corrections.

D'où viennent ces données ?

Nous avons obtenu nos listes de mots à partir de plusieurs bases de données linguistiques open-source :

  • Listes de fréquences Wiktionary: Listes maintenues par la communauté des mots le plus couramment utilisés dans chaque langue
  • Corpus OpenSubtitles: Utilisation linguistique du monde réel à partir de millions de sous-titres de films et de séries télévisées
  • Données Ngramme de Google Books: Modèles linguistiques historiques à partir de milliards de livres publiés
  • Arbres de dépendances Universelles: Corpus de textes annotés linguistiquement

Cette combinaison nous donne une image réaliste de la façon dont les gens écrivent et recherchent réellement, et pas seulement des définitions de dictionnaire formelles.

Comment fonctionne la correction du dictionnaire

Lorsque vous tapez une requête de recherche, notre système vérifie immédiatement chaque mot par rapport à notre dictionnaire multilingue à l'aide d'une technique appelée distance de Levenshtein, une façon mathématique de mesurer le nombre de modifications de caractères uniques (insertions, suppressions, substitutions) nécessaires pour changer un mot en un autre.

Par exemple :

  • "fiuture" → "future" (distance : 1, une substitution)
  • "tutorail" → "tutorial" (distance : 1, une substitution)
  • "vidio" → "video" (distance : 1, une substitution)

Le système calcule ces distances en temps réel, recherche dans notre dictionnaire les mots situés à une distance de 2, les classe par fréquence et suggère la correction la plus probable.

Mais voici le point intelligent: Le système détecte automatiquement la langue que vous utilisez en vérifiant quel dictionnaire a le plus de correspondances pour vos mots. Si vous recherchez "la musica italiana" (italien), il n'essaiera pas de le corriger en anglais, il reconnaît l'italien et valide par rapport au dictionnaire italien à la place.


Couche 2 : Compréhension sémantique BERT

Qu'est-ce que BERT ?

BERT signifie Bidirectional Encoder Representations from Transformers. C'est un modèle d'apprentissage profond développé par Google qui a révolutionné le traitement du langage naturel en 2018. Contrairement aux moteurs de recherche traditionnels qui correspondent aux mots-clés, BERT comprend le sens des mots dans le contexte.

Pensez-y de cette façon : si vous recherchez "apple", un moteur de recherche traditionnel ne sait pas si vous faites référence au fruit ou à la société technologique. BERT comprend le contexte. Si vos recherches précédentes concernaient l'"iPhone" et le "MacBook", BERT sait que vous faites probablement référence à Apple Inc.

La bibliothèque Transformers

Nous utilisons la bibliothèque Transformers de Hugging Face, qui fournit des modèles d'IA pré-entraînés capables de comprendre et de générer le langage humain. Spécifiquement, nous utilisons :

  • Modèle: bert-base-uncased (un modèle BERT anglais compact mais puissant)
  • Tâche: Prédictions par masquage (comprendre le contexte pour suggérer des mots associés)
  • Objectif: Suggestions sémantiques au-delà de la correction orthographique

Comment BERT améliore la recherche

Lorsque vous recherchez quelque chose et que nous ne trouvons pas de correspondances exactes, BERT intervient pour suggérer des termes sémantiquement liés à partir de notre base de données de contenu.

Par exemple :

  • Vous recherchez : "electronic beats"
  • BERT suggère : "music," "techno," "edm," "electronica"
  • Vous recherchez : "cooking show"
  • BERT suggère : "recipe," "chef," "culinary," "kitchen"

Ceci est possible car BERT a été entraîné sur des milliards de mots et comprend les relations entre les concepts. Il ne se contente pas de correspondre aux lettres, il correspond au sens.


Couche 3 : Correspondance de titre sensible au contenu

Rechercher à l'intérieur des titres, pas seulement des tags

La troisième couche de notre moteur de recherche examine directement la bibliothèque de contenu de MYETV, spécifiquement les titres et les descriptions des contenus. C'est là que les choses deviennent vraiment intelligentes.

Lorsque vous tapez une requête de plusieurs mots comme "the future of music", notre système :

  1. Divise votre requête en mots individuels: ["the", "future", "of", "music"]
  2. Recherche dans notre base de données les titres contenant des mots similaires
  3. Calcule un score de similarité pour chaque titre en fonction du nombre de vos mots qui correspondent (même avec des fautes de frappe)
  4. Classe et suggère les titres les mieux correspondants

Par exemple, si nous avons une vidéo intitulée "The Future of Electronic Music in 2026", et que vous recherchez "the fiuture of miusic", le système fera :

  • Corriger "fiuture" → "future"
  • Corriger "miusic" → "music"
  • Correspondre exactement à "the" et "of"
  • Reconnaître le titre comme une correspondance à 100 % et le suggérer

Cette couche est particulièrement puissante pour les recherches en longue traîne — des requêtes spécifiques de plusieurs mots que le classement par mots-clés traditionnel manque souvent.


Assembler le tout : l'expérience de recherche

Voyons un exemple concret pour voir comment les trois couches fonctionnent ensemble.

Scénario : Vous recherchez "the fiuture of miusic"

Étape 1 : Correction du dictionnaire (Couche 1)

Le système détecte :

  • "le" → mot anglais valide ✓
  • "futur" → mot invalide, distance 1 par rapport à "future" → corrigé
  • "de" → mot anglais valide ✓
  • "musique" → mot invalide, distance 1 par rapport à "music" → corrigé

Résultat: Votre requête est corrigée en "le futur de la musique"

Étape 2 : Compréhension sémantique (Couche 2)

BERT analyse "le futur de la musique" et identifie les concepts associés dans notre base de données du contenu :

  • "musique" (correspondance exacte)
  • "électronique" (sémantiquement lié)
  • "battements" (sémantiquement lié)
  • "son" (sémantiquement lié)

Résultat: Des mots-clés sémantiques sont générés pour une correspondance plus large

Étape 3 : Correspondance du contenu (Couche 3)

Le système recherche nos titres de vidéos et trouve :

  • "Le futur de la musique électronique en 2026" (correspondance de 98%)
  • "Évolution de la musique : Qu'est-ce qui vient ensuite ?" (correspondance de 85%)
  • "Le futur de la technologie du son" (correspondance de 80%)

Résultat: Ces titres sont suggérés avec les mots-clés corrigés

Ce que vous voyez :

texte🤖 Suggestions de l'IA:
[the future of music] [music] [electronic]

🎬 Suggestions de titres:
[The Future of Electronic Music in 2026]
[Music Evolution: What's Next?]
Suggestions de l'IA et de titres

Implémentation technique : Comment nous avons construit cela

La pile technologique

  • Backend: PHP avec des classes personnalisées pour un traitement IA modulaire
  • Bibliothèque IA: transformers (port PHP de Hugging Face Transformers)
  • Base de données: avec une fonction LEVENSHTEIN personnalisée pour les calculs de distance
  • Stockage du dictionnaire: Table de base de données dédiée avec plus de 850 000 entrées indexées
  • Modèle: BERT base sans casse (110M de paramètres, affiné pour le modèle de langage masqué)
  • Mise en cache: Cache en mémoire pour les recherches de dictionnaire et les prédictions BERT afin d'optimiser la vitesse

Optimisation des performances

Les modèles d'IA sont coûteux en calcul. Pour garantir que notre recherche reste rapide, nous avons implémenté plusieurs optimisations :

  1. Pré-filtrage du dictionnaire: Avant de calculer les distances de Levenshtein, nous filtrons les mots par longueur (±2 caractères) pour réduire l'espace de recherche de 90%)
  2. Mise en cache des résultats: Les termes fréquemment recherchés et leurs corrections sont mis en cache en mémoire
  3. Traitement par lots: Plusieurs suggestions sont générées lors d'un seul appel d'inférence BERT
  4. Temps de recherche moyen: < 200ms (y compris le traitement par IA)


    Les données derrière l'IA

    Processus d'importation du dictionnaire

    Construire notre dictionnaire multilingue n'a pas été trivial. Voici comment nous l'avons fait :

    1. Collecte des données: Téléchargement des listes de fréquence depuis Wiktionary, OpenSubtitles et Google Ngram pour 20 langues
    2. Nettoyage: Suppression des caractères spéciaux, des URL, des nombres et des jurons
    3. Pondération de la fréquence: Attribution de scores d'importance basés sur la fréquence d'utilisation
    4. Normalisation: Conversion de tous les mots en minuscules pour une correspondance insensible à la casse
    5. Importation de la base de données: Insertion en masse de plus de 850 000 entrées dans MySQL avec des colonnes indexées pour des recherches ultra-rapides

    Taille totale de la base de données: 45 Mo (fortement compressée avec des index)

    Entraînement du modèle BERT

    Nous utilisons le modèle pré-entraîné bert-base-uncased qui a été entraîné par Google sur :

    • BooksCorpus: 800 millions de mots provenant de 11 000 livres
    • Wikipedia anglaise: 2,5 milliards de mots provenant de 13 Go de texte

    Ceci donne à BERT une compréhension contextuelle approfondie des modèles linguistiques, des idiomes et des relations sémantiques de la langue anglaise.


    Impact dans le monde réel : Premiers résultats

    Nous testons le nouveau moteur de recherche en interne depuis deux semaines. Voici quelques premières métriques :

    Taux de succès de la recherche amélioré

    • Avant: 67% des recherches ont retourné des résultats pertinents
    • Après: 91% des recherches ont retourné des résultats pertinents
    • Amélioration de +24 points de pourcentage

    Tolérance aux fautes de frappe

    • Avant: Les recherches avec 1+ faute de frappe avaient un taux de succès de 23%
    • Après: Les recherches avec 1-2 fautes de frappe ont un taux de succès de 89%
    • Amélioration de +66 points de pourcentage

    Détection multilingue

    • Détecte et corrige automatiquement les requêtes dans 20 langues
    • Les recherches en italien et en espagnol ont connu une augmentation de 3x des corrections réussies

    Commentaires des utilisateurs

    Les premiers testeurs bêta ont rapporté :

    • "J'ai l'impression que la recherche comprend réellement ce que je cherche"
    • "Je peux taper rapidement sans m'inquiéter de l'orthographe"
    • "Enfin ! Les recherches en italien fonctionnent correctement"

    Derrière le code : Open Source et Transparence

    Nous croyons en la transparence. Bien que la base de code de MYETV soit propriétaire, nous nous engageons à partager nos apprentissages avec la communauté des développeurs. Tout le code utilisé dans cette implémentation est :

    • 100% Open Source: Analyses approfondies de notre implémentation depuis les dépôts github
    • IA Open Source: Extraits open source démontrant la correspondance de dictionnaires et l'intégration de BERT en PHP
    • Bibliothèque Open Source: la bibliothèque transformers huggingface pour PHP est open source sur github

    Pourquoi cela compte pour vous

    En tant qu'utilisateur de MYETV, vous ne vous souciez peut-être pas des modèles BERT ou des distances de Levenshtein. Mais vous remarquez:

    • Moins de frustration: Les fautes de frappe ne cassent plus votre expérience de recherche
    • Découverte plus rapide: Trouvez ce que vous cherchez en moins d'essais
    • Meilleures recommandations: Des suggestions plus pertinentes basées sur ce que vous vouliez réellement rechercher
    • Prise en charge multilingue: Recherchez dans votre langue maternelle sans vous soucier des barrières linguistiques

    Notre objectif est simple : Rendre la recherche invisible. Vous ne devriez pas avoir à réfléchir à la façon de rechercher, vous devriez simplement trouver ce que vous cherchez, instantanément, chaque fois.


    Conclusion : Une recherche qui vous comprend

    Construire un moteur de recherche alimenté par l'IA ne consiste pas à montrer la technologie, mais à supprimer les frictions de votre expérience. Chaque faute de frappe corrigée, chaque suggestion sémantique faite, chaque requête multilingue comprise est un moment où la technologie vous laisse faire et vous permet de profiter du contenu.

    Nous avons consacré des centaines d'heures à ce projet : organiser des dictionnaires, entraîner des modèles, optimiser des bases de données et affiner des algorithmes. Mais la véritable mesure du succès ne se trouve pas dans le code, mais dans ces moments où vous recherchez quelque chose, obtenez le résultat parfait, et ne remarquez même pas que l'IA a travaillé en coulisses pour que cela se produise.

    C'est la différence MYETV.

    Bienvenue dans le futur de la recherche.


    Essayez vous-même

    Le nouveau moteur de recherche est disponible maintenant sur MYETV. Essayez ces recherches pour voir l'IA en action :

    • "the fiuture of tecnology" (fautes de frappe intentionnelles)
    • "musica electronica" (espagnol avec fautes de frappe)
    • "tutorail vidio" (double faute de frappe)
    • Toute expression de plusieurs mots décrivant le contenu que vous souhaitez trouver

    Voyez comment l'IA corrige, suggère et trouve exactement ce que vous cherchez.

    Bonne recherche !


    — L'équipe d'ingénierie MYETV


    Références techniques