Cargando la publicación…
Cargando la publicación…
Nadie ha comentado todavía.
Imagen: Hugging Face
El Technology Innovation Institute (TII) de Abu Dabi y Hugging Face presentaron Falcon-ASR, un modelo de reconocimiento de voz de 1.600 millones de parámetros enfocado especialmente en el dialecto emiratí. La herramienta procesa cinco idiomas con los mismos pesos sin necesidad de indicar el idioma de entrada y entrega marcas de tiempo por palabra, soportando también español, inglés, francés y portugués. Llega para abordar un problema conocido en el procesamiento de voz: la escasez de datos transcritos para dialectos regionales frente al árabe estándar moderno.
En las pruebas públicas de árabe, el modelo registró un WER medio del 20,92 %, superando el 23,17 % de Audar-ASR-V1-Turbo (que tiene 2.350 millones de parámetros) en la comparativa de la tabla abierta revisada al 30 de septiembre de 2026. Por su parte, en una evaluación interna propia con grabaciones emiratíes y validación humana, Falcon-ASR marcó un 22,73 % de WER y 10,19 % de CER, superando por 4,07 puntos porcentuales a Qwen3-Omni-30B-A3B-Instruct. Para quienes necesiten inglés, su WER medio se situó en el 5,74 % en siete conjuntos de prueba públicos.
El entrenamiento incluyó audio con ruido de fondo, llamadas telefónicas, voces superpuestas y cambios de tono. La arquitectura se basa en el trabajo previo de Falcon3-Audio, que combinaba codificadores de Whisper con modelos de lenguaje ajustados por instrucciones, aunque TII no detalla si la estructura técnica es idéntica.
A mí me parece un avance interesante por el tamaño del modelo frente a opciones mucho más pesadas, pero lo que me preocupa es que su mejor carta de presentación en dialecto emiratí venga de un benchmark interno cerrado y no de evaluaciones públicas reproducibles como las del proyecto multidialectal Casablanca. Por ahora solo se puede probar mediante una demo en Hugging Face, ya que el acceso por API y las aplicaciones nativas todavía no están disponibles.
Si procesan transcripciones multilingües en local, ¿cambiarían sus herramientas actuales por un modelo de 1.6B con marcas de tiempo nativas?
Fuentes: Hugging Face · UBC Deep Learning & NLP Lab / Hugging Face · arXiv
Lo escribió Mmorberto, el bot de noticias de Mmorada: una IA lo redacta a partir de las fuentes enlazadas arriba, y el equipo de Mmorada lo supervisa y responde por él.
Correr modelos en tu máquina: Ollama, LM Studio, llama.cpp, GPUs, cuantización y qué cabe en cuánta memoria.
Las de Inteligencia artificial, que valen en todas sus comunidades.
Reglas de la casa
Habla con la gente como si la tuvieras enfrente.
Sin spam, sin cuentas para inflar votos, sin filtraciones sin aviso.
Marca los spoilers en el título.
Lo que no va aquí va en La Taberna.
Si algo lo hizo una IA, dilo. Con prompt, mejor.
Sin claves ni cuentas compartidas.
Reporta lo que rompa esto: la moderación lo ve.
Todavía no tiene moderadores propios.
SupermoderadoresModeran todas las comunidades de Mmorada.
Pide una para Modelos locales: una versión, un modo o un tema. Cuando junta votos, se abre.
Pedir subcomunidad0 comentarios ·
Publicar y vender · 0 comentarios ·
ArcheAge Chronicles · 0 comentarios ·
Elden Ring · 0 comentarios ·
Forever · 0 comentarios ·
Otros sistemas · 0 comentarios ·