Por Qué Importa la Búsqueda
El MYETV Search Engine ya es uno de los motores de búsqueda más sofisticados de la web. La búsqueda es el latido de cualquier plataforma de contenido. Es el puente invisible entre lo que piensas y lo que intentas encontrar. Cuando escribes "the future of ai" en una caja de búsqueda, no deberías obtener cero resultados solo por un error tipográfico. Deberías obtener exactamente lo que quisiste decir: "the future of AI".
Hoy, estamos emocionados de compartir un hito importante en el viaje de MYETV: una revisión completa de nuestro motor de búsqueda impulsado por inteligencia artificial, diccionarios multilingües y procesamiento avanzado del lenguaje natural. Esto no es solo una actualización técnica, es un cambio fundamental en cómo MYETV te entiende.
Exploremos lo que construimos, por qué es importante y cómo funciona detrás de escena.
El Problema: La Búsqueda Tradicional Es Demasiado Rígida
Los motores de búsqueda tradicionales son implacables. Coinciden las palabras exactamente como las escribes. Si buscas "miusic video", la mayoría de los sistemas devolverán nada o mostrarán resultados para algo completamente no relacionado. No entienden el lenguaje, solo coinciden patrones.
Esto se vuelve aún más problemático en una plataforma multilingüe y global como MYETV, donde los usuarios hablan inglés, italiano, español, francés, alemán, portugués y muchos otros idiomas. Un usuario en Roma podría buscar "tutorail vidio" en inglés, mientras que otro en Madrid busca "música" con un error tipográfico como "musica" (sin el acento). Los motores de búsqueda tradicionales tienen dificultades con estos escenarios del mundo real.
Nos preguntamos: ¿Qué pasaría si nuestro motor de búsqueda pudiera pensar como un humano? ¿Qué pasaría si pudiera corregir tu ortografía, comprender el contexto, detectar el idioma automáticamente e incluso sugerir contenido basándose en el significado semántico en lugar de coincidencias exactas de palabras?
Eso es exactamente lo que nos propusimos construir.
La Solución: Un Sistema de Búsqueda Impulsado por IA de Tres Capas
Nuestro nuevo motor de búsqueda combina tres tecnologías potentes que trabajan en armonía:
1. Corrección de Diccionario Multilingüe
2. Comprensión Semántica BERT
3. Coincidencia de Títulos con Conocimiento del Contenido
Desglosemos cada capa.

Capa 1: Corrección de Diccionario Multilingüe
La Base: Más de 50,000 Palabras en 20 Idiomas
En el núcleo de nuestro nuevo motor de búsqueda hay un diccionario multilingüe masivo que contiene más de 50,000 palabras cuidadosamente seleccionadas en 20 idiomas. Estas no son solo listas de palabras al azar, son vocabularios ponderados por frecuencia que representan cómo la gente realmente se comunica en línea.

Esto es lo que incluimos:
- Inglés: 10,000 palabras más comunes
- Italiano: 10,000 palabras más comunes
- Español: 10,000 palabras más comunes
- Francés: 10,000 palabras más comunes
- Alemán: 10,000 palabras más comunes
- Portugués: 10,000 palabras más comunes
- Más 14 idiomas adicionales: neerlandés, ruso, polaco, turco, árabe, chino (simplificado), japonés, coreano, hindi, sueco, noruego, danés, finés y griego
Cada palabra se indexa con su frecuencia de uso, lo que significa que el sistema prioriza las palabras comunes sobre las oscuras al sugerir correcciones.
¿De dónde vienen estos datos?
Obtuvimos nuestras listas de palabras de varias bases de datos lingüísticas de código abierto:
- Listas de frecuencia de Wiktionary: Listas mantenidas por la comunidad de las palabras más utilizadas en cada idioma
- Corpus OpenSubtitles: Uso del lenguaje del mundo real a partir de millones de subtítulos de películas y programas de televisión
- Datos Ngram de Google Books: Patrones lingüísticos históricos de miles de millones de libros publicados
- Árboles de dependencias universales: Corpora de texto anotados lingüísticamente
Esta combinación nos da una imagen realista de cómo la gente realmente escribe y busca, no solo de las definiciones formales de los diccionarios.
Cómo funciona la corrección de diccionarios
Cuando escribes una consulta de búsqueda, nuestro sistema comprueba inmediatamente cada palabra contra nuestro diccionario multilingüe utilizando una técnica llamada distancia de Levenshtein, una forma matemática de medir cuántas ediciones de un solo carácter (inserciones, eliminaciones, sustituciones) se necesitan para cambiar una palabra por otra.
Por ejemplo:
- "fiuture" → "future" (distancia: 1, una sustitución)
- "tutorail" → "tutorial" (distancia: 1, una sustitución)
- "vidio" → "video" (distancia: 1, una sustitución)
El sistema calcula estas distancias en tiempo real, busca en nuestro diccionario palabras dentro de una distancia de 2, las clasifica por frecuencia y sugiere la corrección más probable.
Pero aquí está la parte inteligente: El sistema detecta automáticamente el idioma que estás utilizando comprobando qué diccionario tiene más coincidencias para tus palabras. Si buscas "la musica italiana" (italiano), no intentará corregirlo a inglés, sino que reconoce italiano y valida contra el diccionario italiano en su lugar.
Capa 2: Comprensión Semántica de BERT
¿Qué es BERT?
BERT significa Bidirectional Encoder Representations from Transformers. Es un modelo de aprendizaje profundo desarrollado por Google que revolucionó el procesamiento del lenguaje natural en 2018. A diferencia de los motores de búsqueda tradicionales que hacen coincidir palabras clave, BERT realmente entiende el significado de las palabras en contexto.
Piénsalo de esta manera: si buscas "apple" (manzana), un motor de búsqueda tradicional no sabe si te refieres a la fruta o a la compañía tecnológica. BERT entiende el contexto. Si tus búsquedas anteriores fueron sobre "iPhone" y "MacBook", BERT sabe que probablemente te refieres a Apple Inc.
La Biblioteca Transformers
Estamos utilizando la biblioteca Transformers de Hugging Face, que proporciona modelos de IA preentrenados que pueden comprender y generar lenguaje humano. Específicamente, estamos utilizando:
- Modelo:
bert-base-uncased(un modelo BERT en inglés compacto pero potente) - Tarea: predicciones de máscara de relleno (comprensión del contexto para sugerir palabras relacionadas)
- Propósito: sugerencias semánticas más allá de la corrección ortográfica
Cómo BERT Mejora la Búsqueda
Cuando buscas algo y no encontramos coincidencias exactas, BERT interviene para sugerir términos semánticamente relacionados de nuestra base de datos de contenido.
Por ejemplo:
- Buscas: "electronic beats"
- BERT sugiere: "música", "techno", "edm", "electronica"
- Buscas: "cooking show"
- BERT sugiere: "receta", "chef", "culinario", "cocina"
Esto es posible porque BERT ha sido entrenado con miles de millones de palabras y comprende las relaciones entre conceptos. No solo coincide letras, coincide el significado.
Capa 3: Coincidencia de Títulos con Conocimiento del Contenido
Buscar Dentro de Títulos, No Solo Etiquetas
La tercera capa de nuestro motor de búsqueda mira directamente en la biblioteca de contenido de MYETV específicamente, los títulos y las descripciones de los contenidos. Aquí es donde las cosas se vuelven realmente inteligentes.
Cuando escribes una consulta de varias palabras como "the future of music", nuestro sistema:
- Divide tu consulta en palabras individuales: ["the", "future", "of", "music"]
- Busca en nuestra base de datos por títulos que contengan palabras similares
- Calcula una puntuación de similitud para cada título basándose en cuántas de tus palabras coinciden (incluso con errores tipográficos)
- Clasifica y sugiere los títulos que mejor coinciden
Por ejemplo, si tenemos un video titulado "The Future of Electronic Music in 2026", y buscas "the fiuture of miusic", el sistema:
- Corrige "fiuture" → "future"
- Corrige "miusic" → "music"
- Coincide exactamente con "the" y "of"
- Reconoce el título como una coincidencia del 100% y lo sugiere
Esta capa es particularmente poderosa para las búsquedas de cola larga: consultas específicas de varias palabras que el emparejamiento tradicional de palabras clave a menudo omite.
Poniéndolo Todo Junto: La Experiencia de Búsqueda
Repasemos un ejemplo real para ver cómo funcionan las tres capas juntas.
Escenario: Buscas "the fiuture of miusic"
Paso 1: Corrección del Diccionario (Capa 1)
El sistema detecta:
- "the" → valid English word ✓
- "fiuture" → invalid word, distance 1 from "future" → corrected
- "of" → valid English word ✓
- "miusic" → invalid word, distance 1 from "music" → corrected
Resultado: Su consulta se corrige a "el futuro de la música"
Paso 2: Comprensión Semántica (Capa 2)
BERT analiza "el futuro de la música" e identifica conceptos relacionados en nuestra base de datos de contenido:
- "music" (coincidencia exacta)
- "electronic" (semánticamente relacionado)
- "beats" (semánticamente relacionado)
- "sound" (semánticamente relacionado)
Resultado: Se generan palabras clave semánticas para una coincidencia más amplia
Paso 3: Coincidencia de Contenido (Capa 3)
El sistema busca nuestros títulos de video y encuentra:
- "The Future of Electronic Music in 2026" (coincidencia del 98%)
- "Music Evolution: What's Next?" (coincidencia del 85%)
- "The Future of Sound Technology" (coincidencia del 80%)
Resultado: Estos títulos se sugieren junto con palabras clave corregidas
Lo que ves:
text🤖 Sugerencias de IA:
[the future of music] [music] [electronic]
🎬 Sugerencias de Títulos:
[The Future of Electronic Music in 2026]
[Music Evolution: What's Next?]

Implementación Técnica: Cómo Construimos Esto
La Pila
- Backend: PHP con clases personalizadas para procesamiento de IA modular
- Librería de IA:
transformers(port de PHP de Hugging Face Transformers) - Base de Datos: con función LEVENSHTEIN personalizada para cálculos de distancia
- Almacenamiento del Diccionario: Tabla de base de datos dedicada con más de 850,000 entradas indexadas
- Modelo: BERT base sin casos (110M parámetros, ajustado para modelado de lenguaje enmascarado)
- Almacenamiento en Caché: Caché en memoria para búsquedas del diccionario y predicciones de BERT para optimizar la velocidad
Optimización del Rendimiento
Los modelos de IA son computacionalmente caros. Para garantizar que nuestra búsqueda siga siendo rápida, implementamos varias optimizaciones:
- Prefiltrado del Diccionario: Antes de calcular las distancias de Levenshtein, filtramos las palabras por longitud (±2 caracteres) para reducir el espacio de búsqueda en un 90%
- Almacenamiento en Caché de Resultados: Los términos buscados con frecuencia y sus correcciones se almacenan en memoria
- Procesamiento por lotes: Se generan múltiples sugerencias en una sola llamada de inferencia de BERT
- Recolección de datos: Descargamos listas de frecuencia de Wiktionary, OpenSubtitles y Google Ngram para 20 idiomas
- Limpieza: Eliminamos caracteres especiales, URL, números y palabrotas
- Ponderación de frecuencia: Asignamos puntuaciones de importancia basadas en la frecuencia de uso
- Normalización: Convertimos todas las palabras a minúsculas para una coincidencia insensible a mayúsculas y minúsculas
- Importación a la base de datos: Insertamos en lote más de 850,000 entradas en MySQL con columnas indexadas para búsquedas ultrarrápidas
- BooksCorpus: 800M de palabras de 11,000 libros
- Wikipedia en inglés: 2,500M de palabras de 13GB de texto
- Antes: El 67% de las búsquedas arrojaron resultados relevantes
- Después: El 91% de las búsquedas arrojaron resultados relevantes
- Mejora de +24 puntos porcentuales
- Antes: Las búsquedas con 1+ errores tipográficos tenían una tasa de éxito del 23%
- Después: Las búsquedas con 1-2 errores tipográficos tienen una tasa de éxito del 89%
- Mejora de +66 puntos porcentuales
- Detecta y corrige automáticamente consultas en 20 idiomas
- Las búsquedas en italiano y español vieron un aumento de 3 veces en las correcciones exitosas
- "Parece que la búsqueda realmente entiende lo que estoy buscando"
- "Puedo escribir rápidamente sin preocuparme por la ortografía"
- "¡Por fin! Las búsquedas en italiano funcionan correctamente"
- 100% Código Abierto: Análisis profundos de nuestra implementación desde los repositorios de github
- IA de Código Abierto: Fragmentos de código abierto que demuestran la coincidencia de diccionarios y la integración de BERT en PHP
- Librería de Código Abierto: la librería transformers huggingface para PHP es de código abierto en github
- Menos frustración: Los errores tipográficos ya no rompen tu experiencia de búsqueda
- Descubrimiento más rápido: Encuentra lo que buscas en menos intentos
- Mejores recomendaciones: Sugerencias más relevantes basadas en lo que realmente querías buscar
- Soporte multilingüe: Busca en tu idioma nativo sin preocuparte por las barreras idiomáticas
- "el fiuture de tecnology" (errores tipográficos intencionales)
- "musica electronica" (español con errores tipográficos)
- "tutorail vidio" (doble error tipográfico)
- Cualquier frase de varias palabras que describa el contenido que quieres encontrar
- BERT: Devlin et al., "BERT: Pre-entrenamiento de Transformers Bidireccionales Profundos para la Comprensión del Lenguaje" (2018)
- Librería Transformers: https://github.com/huggingface/transformers
- Transformers de PHP: https://github.com/CodeWithKyrian/transformers-php
- Distancia de Levenshtein: https://en.wikipedia.org/wiki/Levenshtein_distance
- Dependencias Universales: https://universaldependencies.org/
Tiempo promedio de búsqueda: < 200ms (incluido el procesamiento de IA)
Los datos detrás de la IA
Proceso de importación del diccionario
Construir nuestro diccionario multilingüe no fue trivial. Esto es cómo lo hicimos:
Tamaño total de la base de datos: 45MB (altamente comprimido con índices)
Entrenamiento del modelo BERT
Estamos utilizando el modelo preentrenado bert-base-uncased , que fue entrenado por Google en:
Esto le da a BERT una comprensión contextual profunda de los patrones lingüísticos, modismos y relaciones semánticas del idioma inglés.
Impacto en el mundo real: Resultados iniciales
Hemos estado probando el nuevo motor de búsqueda internamente durante las últimas dos semanas. Aquí hay algunas métricas iniciales:
Tasa de éxito de la búsqueda mejorada
Tolerancia a errores tipográficos
Detección multilingüe
Comentarios de los usuarios
Los primeros testers beta informaron:
Detrás del Código: Código Abierto y Transparencia
Creemos en la transparencia. Aunque la base de código de MYETV es propietaria, estamos comprometidos a compartir nuestros conocimientos con la comunidad de desarrolladores. Todo el código utilizado en esta implementación es:
Por qué es importante para ti
Como usuario de MYETV, puede que no te importen los modelos BERT o las distancias de Levenshtein. Pero notarás :
Nuestro objetivo es simple: Hacer la búsqueda invisible. No deberías tener que pensar cómo buscar, solo debes encontrar lo que buscas, al instante, cada vez.
Conclusión: Una Búsqueda que te Entiende
Construir un motor de búsqueda impulsado por IA no se trata de mostrar tecnología, se trata de eliminar la fricción de tu experiencia. Cada error tipográfico corregido, cada sugerencia semántica realizada, cada consulta multilingüe entendida es un momento en el que la tecnología se aparta del camino y te permite disfrutar del contenido.
Hemos invertido cientos de horas en este proyecto: curando diccionarios, entrenando modelos, optimizando bases de datos y ajustando algoritmos. Pero la verdadera medida del éxito no está en el código, sino en esos momentos en que buscas algo, obtienes el resultado perfecto y nunca te das cuenta de que la IA simplemente trabajó tras bambalinas para lograrlo.
Esa es la diferencia de MYETV.
Bienvenido al futuro de la búsqueda.
Pruébalo tú mismo
El nuevo motor de búsqueda está disponible ahora mismo en MYETV. Prueba estas búsquedas para ver la IA en acción:
Ve cómo la IA corrige, sugiere y encuentra exactamente lo que estás buscando.
¡Feliz búsqueda!
— El equipo de Ingeniería de MYETV
Referencias Técnicas


