Ir al contenido
Laboratorio de IA

Los métodos que hay detrás de los sistemas que entregamos

Investigación aplicada en percepción, modelado de secuencias, lenguaje, audio y optimización en el dispositivo, hecha para poner un modelo en el hardware del cliente y mantenerlo honesto allí, no para publicar una gráfica. Esta página es el glosario de aquello con lo que realmente construimos.

  • Entorno de ejecuciónC++ · CUDA · TensorRT · ONNX Runtime
  • ObjetivosEdge de clase Jetson · estación de trabajo · rack refrigerado por aire
  • DisciplinaEvaluación held-out antes de cada promoción
  • PropiedadLos pesos, el código y las evaluaciones se quedan con el cliente
PROGRAMA INSIGNIA

IA industrial en las instalaciones, del silicio a la respuesta

El programa líder del laboratorio es una pila de diagnóstico con privacidad primero que corre íntegramente dentro del edificio del cliente: modelos locales, mundos de entrenamiento verificados, control determinista y una línea de aceleración en el borde, desarrollada con la medición por delante.

Control determinista en tiempo de ejecución

Investigación sobre lo que el control determinista puede y no puede hacer por agentes de IA pequeños: pasos acotados, vocabularios cerrados donde la abstención honesta es una respuesta correcta, y afirmaciones que exigen testigos.

Pila de inferencia con modelos locales

Modelos de pesos abiertos, cuantizados y servidos en hardware común, afinados para el análisis de causa raíz industrial, de modo que la telemetría de la planta nunca salga de la planta.

Mundos de entrenamiento con verdad verificada

Un motor de datos que convierte archivos reales de telemetría eólica y solar con fallos etiquetados y plantas sintéticas con base física en mundos de entrenamiento y evaluación cuyas respuestas se pueden comprobar.

Programa de aceleración en el borde

Una línea de coprocesadores de borde para recuperación vectorial de alto rendimiento y monitorización de deriva y anomalías en tiempo real, diseñada para acompañar a un PC industrial estándar.

Cada afirmación de capacidad pasa una evaluación prerregistrada con puertas congeladas antes de publicarse, y la matemática de la monitorización en flujo fue validada contra datos reales de medición de hardware cuántico. Un artículo de investigación sobre el trabajo de control está en preparación: los resultados se publicarán abiertamente como preprint y se enviarán a revisión por pares, hallazgos negativos incluidos.

La pila de diagnóstico en el portafolio
Visión por computador y percepción 3D

Profundidad, geometría y qué se le puede confiar de verdad a una cámara

El trabajo consiste en convertir píxeles en una estructura métrica, ya sea a partir de una sola lente o de un equipo calibrado, y luego decidir en qué medida dar crédito a esa estructura.

Profundidad métrica monocular
Profundidad densa por píxel a partir de una sola cámara, ajustada con capturas específicas de la escena y anclada en escala contra geometría conocida, de modo que la salida esté en metros y no en unidades relativas.
Geometría estéreo y multivista
Rectificación, semi-global matching y estéreo aprendido sobre volúmenes de coste para equipos calibrados; ajuste de haces y structure-from-motion cuando el equipo es una cámara en movimiento.
Procesamiento de nubes de puntos
Submuestreo por vóxeles, ajuste del plano del suelo con RANSAC, agrupamiento euclídeo y backbones de convolución dispersa para retornos de LiDAR y de sensores de profundidad, incluida la verificación contra escenas simuladas.
Fusión en vista cenital
Incorporar las características de las cámaras en una cuadrícula con vista cenital y fusionarlas con sensores de distancia, de modo que la ocupación, el espacio libre y la estructura a nivel de carril se obtengan a partir de una única representación.
Incertidumbre y calibración
Cabezas de confianza por píxel, escalado por temperatura y umbrales conformes, para que una regla posterior pueda negarse a actuar sobre una profundidad en la que el propio modelo no confía.
Modelos de secuencia y previsión

Series temporales, recurrencia y los modelos que sustituyeron a aquellos con los que nos formamos

Los flujos de sensores, los históricos de ventas y los registros de eventos son secuencias antes que otra cosa. Elegimos la arquitectura por la forma de los datos y el presupuesto del dispositivo, no por lo que esté de moda.

xLSTM (sLSTM / mLSTM)
Celdas LSTM extendidas con puertas exponenciales y memoria matricial: modelos recurrentes que recuperan el rendimiento en contexto largo de los transformers con coste lineal, lo que importa cuando el modelo tiene que funcionar durante meses en un equipo en el edge.
Modelos de espacio de estados
Capas selectivas de espacio de estados (la familia Mamba) para secuencias de sensores muy largas, donde la memoria cuadrática de la atención es la restricción y un barrido recurrente de latencia fija es el requisito.
Convolución temporal
Convoluciones causales dilatadas con bloques residuales para señales de alta frecuencia: una línea base estable e interpretable que mantenemos en toda comparativa para que un modelo más sofisticado tenga que superarla.
Previsión probabilística
Cabezas de cuantiles, intervalos de predicción conformes y puntuaciones de habilidad frente a líneas base estacionales ingenuas, de modo que una previsión se entrega con la anchura de su propia incertidumbre y con un motivo para preferirla a la semana pasada.
Detección de anomalías en flujos
Modelos de error de reconstrucción y de densidad sobre ventanas de telemetría, con evaluación agrupada por evento para que un fallo prolongado se cuente una sola vez y las falsas alarmas se reporten por máquina y mes.
Lenguaje natural y recuperación

Modelos de lenguaje puestos a trabajar sobre documentos que nunca salen del edificio

Los problemas interesantes no son el modelo, sino todo lo que lo rodea: recuperación que cita, generación acotada y evaluación que detecta la deriva antes de que lo haga un usuario.

Generación aumentada por recuperación
Recuperación híbrida densa y dispersa (similitud de embeddings y BM25) con un reranker de tipo cross-encoder, troceada de modo que cada respuesta lleve el pasaje del que procede y una cita que se pueda abrir.
Embeddings e índices vectoriales
Modelos de incrustación ajustados al vocabulario específico de cada cliente, indexados con HNSW o IVF-PQ en hardware local, cuya recuperación se mide comparándola con un conjunto de consultas etiquetadas.
Extracción estructurada
Decodificación restringida frente a esquemas tipados: los contratos, las facturas y los formularios se convierten en registros validados, y las abstenciones del modelo se contabilizan como una característica.
Arneses de agentes acotados
Agentes que usan herramientas con una lista de acciones permitidas, un presupuesto, una traza de cada llamada y una aprobación humana antes de cualquier cosa con consecuencias: el arnés es el producto, el modelo es un componente.
Evaluación y deriva
Conjuntos de preguntas de referencia, puntuación de fidelidad y de precisión de las citas, y controles de regresión que se ejecutan en cada cambio de modelo o de índice, para que una degradación silenciosa aparezca como una comprobación fallida.
Audio y procesamiento de señal

El habla y el sonido primero como señal, después como lenguaje

La voz en una línea telefónica y la vibración en un rodamiento son la misma disciplina: procesamiento de señal en la entrada que decide qué llega a ver el modelo.

Reconocimiento del habla en streaming
Transcripción por fragmentos y de baja latencia con detección de actividad vocal y determinación de puntos finales adaptada al ancho de banda telefónico. Se ejecuta en hardware local, por lo que el audio nunca sale de la red.
Detección de hablante y de eventos
Diarización para saber quién dijo qué, más clasificación de eventos acústicos (una bandeja que cae, una alarma, una máquina que cambia de tono) a partir de representaciones log-mel y constant-Q.
Seguimiento de órdenes y rasgos espectrales
Remuestrear la vibración respecto al giro del eje para que las firmas de rodamientos y engranajes caigan en órdenes fijos; espectros de envolvente y kurtogramas para los fallos que una FFT sencilla oculta.
Preentrenamiento de audio autosupervisado
Preentrenamiento contrastivo y con predicción enmascarada sobre grabaciones sin etiquetar del propio emplazamiento del cliente, para que el clasificador posterior aprenda de horas de contexto en lugar de un puñado de etiquetas.
Síntesis de voz y latencia de diálogo
Síntesis en streaming con cambio de turno por debajo del segundo, medido de extremo a extremo desde la última palabra de quien llama hasta la primera respuesta audible, en el mismo hardware que aloja la llamada.
Seguimiento en tiempo real en C++

Seguimiento multiobjeto donde el presupuesto por fotograma es la especificación

La detección es la mitad fácil. Mantener las identidades a través de las oclusiones, entre cámaras y a lo largo de una noche entera de grabación, dentro de un presupuesto fijo de milisegundos, es donde está la ingeniería.

Seguimiento por detección
Modelos de movimiento con filtro de Kalman y asignación húngara sobre coste de IoU y de apariencia, recuperación de detecciones de baja puntuación al estilo ByteTrack, y reglas de ciclo de vida de las trazas ajustadas por cámara en lugar de globalmente.
Reidentificación y embeddings de apariencia
Redes de embeddings compactas para emparejar el mismo objeto a través de huecos y de cámaras, con una política explícita para cuando una coincidencia no es lo bastante fiable como para fusionarla.
Fusión de sensores
Cámara, LiDAR y radar fusionados a nivel de traza con un estado compartido y alineación temporal, de modo que un objetivo perdido por un sensor lo sostenga otro en lugar de volver a nacer.
Pipelines sin copias
Gráficos de GStreamer y DeepStream con fotogramas residentes en la GPU, desde la decodificación hasta la inferencia y la superposición, sin idas y vueltas al host y con la latencia por flujo tenida en cuenta en el diseño.
Entornos de ejecución deterministas en C++
Búferes preasignados, colas sin bloqueos y memoria fijada; perfilado con Nsight y compilaciones con sanitizers, porque un rastreador que se atasca una vez por hora no es un rastreador.
IA en el edge y despliegue embebido

Hacer que un modelo quepa en el equipo en el que tiene que vivir

Un modelo no está terminado cuando se entrena; está terminado cuando funciona dentro del margen térmico, de memoria y de latencia del dispositivo, sin supervisión, durante años.

Despliegue en clase Jetson
Motores TensorRT diseñados para cada dispositivo y cada nivel de precisión, descarga de tareas a la DLA cuando resulta más rentable, y perfiles de modo de consumo y de frecuencia de reloj seleccionados en función de un presupuesto térmico medido.
Búsqueda de arquitectura consciente del hardware
Elegir backbones y resoluciones de entrada por la latencia medida en el destino, no por los FLOPs sobre el papel, con una tabla de latencias construida a partir del silicio real.
Equipos sellados
Sistemas de ficheros raíz de solo lectura, imágenes firmadas, watchdogs y operación sin conexión, para que el cliente sea dueño de un dispositivo que sigue funcionando cuando la red no lo hace.
Telemetría de campo y monitores de deriva
Histogramas de la distribución de entrada y de la confianza enviados como resúmenes, nunca como fotogramas en bruto, para que podamos ver que una cámara se sale de calibración sin ver la cámara.
Actualizaciones seguras
Despliegues por fases con particiones A/B y reversión automática ante una comprobación de salud fallida: una actualización de modelo es un despliegue y recibe la disciplina de uno.

El banco de optimización

Todo modelo que entregamos pasa por las mismas cinco estaciones. El orden importa: nada se cuantiza antes de perfilarlo, y nada se promociona antes de que una evaluación held-out diga que el modelo comprimido sigue haciendo el trabajo.

Perfilar

Latencia y memoria por capa sobre el destino real, bajo la distribución de entrada real, con el estado térmico registrado al lado.

  • Nsight
  • latencia por capa
  • margen térmico

Podar y destilar

Poda estructurada de canales y cabezas, y después destilación de conocimiento del modelo completo al más pequeño, de modo que la capacidad se retire donde el perfilado dice que está ociosa.

  • poda estructurada
  • destilación
  • fusión de LoRA

Cuantizar

Primero cuantización posterior al entrenamiento con datos de calibración representativos; entrenamiento consciente de la cuantización solo donde INT8 o FP8 cuesta una exactitud que la evaluación no perdonará.

  • INT8 / FP8
  • PTQ → QAT
  • conjuntos de calibración

Compilar

Fusión del grafo, selección de operadores y construcción del motor por dispositivo y precisión, de ONNX a TensorRT, o a un entorno de ejecución compilado cuando el destino no tiene GPU alguna.

  • TensorRT
  • ONNX Runtime
  • fusión de kernels

Verificar

El modelo comprimido vuelve a pasar la evaluación held-out completa, agrupada por evento y ajustada por tasa base; una regresión en cualquier punto lo devuelve una estación atrás.

  • evaluación held-out
  • control de regresión
  • artefacto firmado

Publicamos métodos. Las cifras viven en su suite de evaluación, en su hardware, donde usted puede volver a ejecutarlas.

Cómo trabaja el laboratorio

Líneas base antes que novedad

Todo experimento incluye la línea base aburrida: estacional ingenua, un modelo lineal, la arquitectura del año pasado. Un método nuevo solo se entrega cuando supera la línea base en datos held-out a lo largo de varias semillas, reportado como media con su dispersión.

Evaluación preregistrada

Los umbrales, las métricas y la definición de aprobado se escriben antes de la ejecución. Un resultado que necesita cambiar las reglas después es un hallazgo sobre las reglas, no un éxito.

Sintético donde la realidad sale cara

Las escenas simuladas, los sensores renderizados y los casos límite generados cubren los huecos que los datos reales no pueden, y todo resultado sintético se confirma contra una captura real antes de contar.

Artefactos propiedad del cliente

Los pesos, el código de entrenamiento, los arneses de evaluación y las trazas se entregan en los repositorios y el hardware del cliente. Nosotros nos quedamos con el método; usted se queda con todo lo que produjo.

Preguntas que le hacen al laboratorio

¿Publican artículos o benchmarks?

Publicamos métodos y, cuando un cliente lo acepta, algún artículo ocasional. En este sitio no publicamos cifras de exactitud: dependen de datos que no son nuestros, y una cifra sin su protocolo de evaluación es marketing.

¿Pueden trabajar con nuestros modelos y datos actuales?

Normalmente sí. El primer paso es un arnés de evaluación alrededor de lo que ya tiene, una línea base en la que ambos podamos confiar, y solo después una propuesta de qué cambiar.

¿A qué hardware se dirigen?

A aquel sobre el que el sistema tenga que vivir: dispositivos edge de clase Jetson, GPU de estación de trabajo, racks refrigerados por aire y, donde no hay GPU, entornos de ejecución compilados para CPU. El banco de optimización existe para que el mismo modelo pueda encajar honestamente en cada uno de ellos.

Última revisión:

Cilindros metálicos huecos y oscuros que forman un patrón abstracto

Traiga un problema al laboratorio

Describa la señal, el dispositivo y la decisión que tiene que sostener. Le diremos cuáles de estos métodos se aplican, cómo sería una línea base y qué querríamos medir primero.

Hablar con el laboratorio