Ir al contenido

Documentación técnica

Cómo compara videos Similiter y dónde se detiene.

Esta guía describe el comportamiento verificable del motor actual. Separa duplicados byte a byte, coincidencias visuales de videos completos y casos no compatibles. Los umbrales generan candidatos para revisar, no permisos de eliminación. Usa estos datos para interpretar cada resultado y decidir cuándo hace falta verificación manual o un nuevo análisis.

Pipeline progresiva

La comparación empieza con controles económicos y llega a la verificación más costosa solo para candidatos plausibles. Un prefiltro muestreado precede al SHA-256 completo; cinco fotogramas realizan el cribado, veinticuatro construyen la huella y cuarenta y ocho verifican el resultado. Una verificación incompleta queda pendiente o falla de forma segura.

  • SHA-256 completo para copias con los mismos bytes.
  • 5 fotogramas para cribado inicial.
  • 24 para la huella temporal.
  • 48 para verificación final.

Cómo interpretar los resultados

Un duplicado exacto tiene una prueba criptográfica. “Mismo video” y “match probable” derivan de huellas visuales coherentes a lo largo de la duración y exigen revisar fotogramas, ruta, tamaño y calidad. La confianza ayuda a ordenar el trabajo, pero no sustituye la decisión del usuario ni justifica una eliminación automática.

  • Duplicado exacto: SHA-256 completo igual.
  • Mismo video: coherencia visual fuerte del video completo.
  • Match probable: suficiente para revisar, no para eliminar.

Límites técnicos actuales

La pipeline alinea muestras en posiciones relativas de la misma duración; no busca una secuencia dentro de otro video. Por eso segmentos, offsets, montajes, velocidad, reverse, crop, reframing y reutilización en timeline no son fiables. El audio está excluido y Similiter no lee grafos, líneas de tiempo o dependencias NLE.

  • Sin búsqueda de segmentos.
  • Sin comparación de audio.
  • Sin interpretación de proyectos NLE.
  • Sin normalización de crop, espejo, reverse o velocidad.

Rendimiento y benchmarks

No hay un benchmark reproducible publicado para bibliotecas grandes, por lo que no se prometen tiempos para miles de archivos o terabytes. Un benchmark fiable deberá indicar versión, hardware, corpus, códecs, archivos, horas y TB, primer análisis, caché, errores, falsos positivos y criterios de verificación.

  • Los análisis repetidos pueden reutilizar datos de archivos sin cambios.
  • La velocidad depende de códec, duración, almacenamiento y decodificación.
  • Solo se publicarán cifras con corpus y método reproducibles.

Hablemos

Solicitar información

Guía técnica y límites de Similiter Configura la solicitud. Te responderemos con disponibilidad y precio confirmado.

Solo nombre y email son obligatorios.

Al enviar la solicitud confirmas que has leído la política de privacidad.