Vista de pájaro (BEV) en sistemas avanzados de asistencia al conductor (ADAS) L2/L2+ 

Percepción de alto rendimiento de todo el vehículo con redes BEV en los procesadores acelerados por IA de TI

Lea la guía del usuario
Vista de pájaro (BEV) en sistemas avanzados de asistencia al conductor (ADAS) L2/L2+ 

Descripción general de la aplicación

La vista de pájaro (BEV) es uno de los componentes fundamentales para los sistemas de fusión de sensores L2/L2+ en aplicaciones de conducción autónoma. Los sistemas avanzados de asistencia al conductor (ADAS) modernos y los vehículos autónomos requieren una comprensión integral del entorno del vehículo. Los enfoques tradicionales ejecutan conductos de percepción independientes para cada cámara y combinan los resultados después de la inferencia. Este proceso aumenta la latencia, incrementa la sobrecarga de memoria y también puede introducir inconsistencias en los límites de la cámara. En cambio, el enfoque BEV fusiona varias entradas de cámara en una única representación espacial unificada antes de la detección de objetos, lo que permite una única inferencia de red neuronal con un costo total del sistema más bajo.  

La BEV en tiempo real requiere una potencia de procesamiento considerable para gestionar entradas de varias cámaras, realizar transformaciones geométricas, ejecutar inferencias de redes neuronales para la detección de objetos y mantener una latencia baja. Los procesadores TDA están diseñados específicamente para este tipo de cargas de trabajo con varias cámaras y cuentan con la NPU C7™ y las interfaces necesarias para implementar BEV con alto rendimiento.

El procesador del SDK incluye la demostración de FastBEV, que puede ejecutarse de inmediato como paso inicial durante la evaluación antes de desarrollar una solución personalizada. La demostración permite la fusión de las transmisiones de imágenes de 6 cámaras y realiza la detección simultánea de objetos, creando una perspectiva unificada de "vista de pájaro". Es importante destacar que la percepción de BEV en este caso se basa solo en la visión. Los datos de la nube de puntos de lidar se utilizan exclusivamente como referencia de verdad fundamental para validar los objetos detectados, no como entrada en vivo al conducto de percepción. 

Inicio de la evaluación

Recopilación de datos

Los sistemas BEV de fusión de sensores para aplicaciones L2/L2+ requieren configuraciones de varias cámaras calibradas con cobertura total alrededor del vehículo. 

La recopilación de datos debe abarcar diversas situaciones de conducción, incluidas las diferentes condiciones de iluminación (diurna, nocturna, con sombras), las condiciones climáticas, los tipos de carreteras, las densidades de tráfico y la presencia de diversos vehículos, peatones y obstáculos relevantes para la conducción autónoma.

Los datos de la nube de puntos de lidar sirven como verdad fundamental para validar objetos detectados en la representación BEV durante el desarrollo y la evaluación; no son una entrada necesaria en el conducto de percepción implementado. Si se utiliza la verdad fundamental de lidar, la captura sincronizada de los fotogramas de la cámara y los escaneos de lidar es esencial para una validación precisa. 

Para los sistemas BEV mejorados con IA con detección simultánea de objetos, los datos de entrenamiento etiquetados deben identificar vehículos, peatones, ciclistas, marcas de carril, límites de la carretera y otras características relevantes críticas para las funciones de conducción autónoma.

Evaluación de la calidad de los datos

La exactitud de la calibración de la cámara es fundamental para la transformación de la vista de perspectiva a BEV. Esto se basa en dos categorías de parámetros:

Parámetros intrínsecos: describen las propiedades ópticas internas de cada sensor y lente de la cámara. Esto incluye aspectos como la distancia focal, el punto principal y los coeficientes de distorsión. Estos determinan cómo un punto 3D del mundo se proyecta en un plano de imagen 2D dentro de una sola cámara.
Parámetros extrínsecos: describen la posición y orientación de cada cámara en relación con un sistema de coordenadas BEV compartido. 

Ambos son fundamentales para mapear con precisión la profundidad y la posición espacial a partir de fotogramas de imágenes 2D. Los errores en cualquiera de los dos se propagarán directamente a la exactitud espacial de los objetos detectados en la representación BEV.

Construya y entrene a su modelo

En el Model Zoo de TI hay disponibles modelos de BEV previamente entrenados que están listos para su evaluación e implementación. 

Es posible que los desarrolladores también quieran preparar su propio modelo de BEV. En ese caso, se podría aprovechar edgeai-mmdetection3d, un marco de trabajo unificado para el desarrollo, el entrenamiento y la evaluación de varios modelos de detección 3D de BEV, basado en mmdetection3d. Como alternativa, los desarrolladores avanzados pueden optar por utilizar sus propios entornos de entrenamiento personalizados. 

Independientemente de cómo se entrene el modelo, antes de la implementación se debe compilar para TIDL a fin de ejecutarse en la NPU C7™. Los modelos en formatos ONNX o LiteRT se pueden compilar con edgeai-tidl-tools, que optimizará la red para los aceleradores de aprendizaje profundo de TI.

Encuentre el modelo adecuado para sus necesidades

La selección del modelo debe equilibrar la exactitud de detección con las restricciones de latencia. El Model Zoo de TI y las herramientas de referencia proporcionan datos de rendimiento para guiar la selección en función del hardware de destino.

El modelo que se utilizó en la demostración de FastBEV de TI emplea una arquitectura de red troncal ResNet-18 con FPN y se basa en el modelo Fast-BEV de código abierto, que se diseñó específicamente para ser capaz de realizar una percepción BEV más rápida en los chips integrados en el vehículo. El modelo se entrenó y validó con el conjunto de datos nuScenes.

Implementación de su modelo

La demostración de FastBEV muestra la implementación típica de un modelo BEV mediante el marco de trabajo Vision Apps incluido como parte del SDK para los procesadores TDA. 

Conducto de percepción central: el conducto basado en OpenVX integra la captura de 6 cámaras, el escalado de hardware de MSC, el preprocesamiento de A72, la inferencia TIDL en la NPU C7™ y el posprocesamiento de A72.

Integración de la verdad fundamental de lidar: además del conducto principal, los datos de la nube de puntos del lidar se ingieren en paralelo y se superponen en la salida BEV como referencia espacial. Esto permite a los desarrolladores comparar visualmente los objetos detectados con una verdad fundamental durante la evaluación.

Características adicionales del conducto: la demostración también incluye la supervisión del rendimiento en tiempo real y una visualización de doble vista que representa los objetos detectados tanto en la imagen de la cámara individual como en las perspectivas BEV de arriba hacia abajo. 

Elección del dispositivo adecuado para usted

La selección de dispositivos para los sistemas de vista de pájaro (BEV) L2/L2+ depende del número de cámaras, la resolución, los requisitos de frecuencia de fotogramas y las necesidades de procesamiento simultáneo de IA. Estas aplicaciones se benefician de los procesadores de grado automotriz de la familia TDA4x con alto ancho de banda de memoria, aceleradores de visión dedicados (VPAC), varios núcleos de NPU C7™ para la aceleración de IA y la capacidad de dividir las redes entre núcleos para lograr un rendimiento óptimo.

Número de producto
Núcleo de procesamiento
Rendimiento de NPU
Puntos de referencia de vista de pájaro
Rendimiento de fastbev_plus_nms_r18_f1 (256 x 704)
TDA4VH-Q1
8 núcleos Arm® Cortex®-A72 y 4 NPU C7™
32 TOPS

51.9 ms

19.3 FPS

TDA4VPE-Q1 4 núcleos Arm® Cortex®-A72 y 2 NPU C7™ 16 TOPS

61.8 ms

16.2 FPS

TDA4VL-Q1 2 núcleos Arm® Cortex®-A72 y 1 NPU C7™ 8 TOPS

93.1 ms

10.7 FPS

FPS (fotogramas por segundo)

 

Todo el hardware, software y recursos que necesitará para comenzar

Hardware

TDA4VH-Q1
El TDA4VH es un sistema en chip (SoC) de alto rendimiento que cumple con los requisitos de seguridad funcional y está diseñado para ADAS avanzados, vehículos autónomos y robótica. Cuenta con 32 TOPS de rendimiento de IA, DSP C7x cuádruples, ocho núcleos Arm Cortex A72, aceleradores de visión dedicados y redes de alta velocidad.

J784S4XEVM
El módulo de evaluación (EVM) J784S4 es una plataforma para evaluar el SoC TDA4VH-Q1 en aplicaciones de análisis de visión y redes en mercados industriales y automotrices. Estos procesadores funcionan especialmente bien en aplicaciones de control de dominio de sistemas avanzados de asistencia al conductor (ADAS), de fusión de sensores y multicámara.

Herramientas de desarrollo y software

Herramientas de línea de comandos
Las herramientas de línea de comandos, como edgeai-modelmaker para el entrenamiento y edgeai-tidl-tools para modelos personalizados, se pueden encontrar en las páginas principales de herramientas para desarrolladores de MPU en el GitHub de TI.

PROCESSOR-SDK-J784S4
El procesador del SDK para RTOS y el procesador del SDK para Linux se pueden usar juntos a fin de implementar varios casos de uso en robótica, visión y sistemas avanzados de asistencia al conductor (ADAS) para el sector automotriz.

CCStudio™ Edge AI Studio
Esta herramienta contiene herramientas para entrenar, compilar e implementar un modelo en los procesadores Edge AI de TI. Una herramienta de selección de modelos está disponible para ver los puntos de referencia pregenerados de modelos populares.

Recursos de soporte

El marco de trabajo Vision Apps incluido en el procesador del SDK proporciona la demostración de FastBEV como implementación de referencia. En esta guía del usuario, se proporciona una breve descripción general e instrucciones para ejecutar la demostración de FastBEV.

Desarrollo, entrenamiento y optimización de modelos de detección 3D de vista de pájaro para dispositivos de TI.

Un marco de trabajo unificado para el desarrollo, el entrenamiento y la evaluación de varios modelos de detección 3D de BEV, basado en mmdetection3d.

Industrial | Visión

Encuentre y localice objetos específicos y personas en tiempo real a altas velocidades de fotogramas con procesadores acelerados por IA y software estándar de la industria

Industrial | Visión

Detecte obstáculos y rutas de grano fino a partir de imágenes en tiempo real con los procesadores equipados con NPU C7™