El tema me ha despertado curiosidad y he investigado un poco la potencia de cálculo de diversos dispositivos.
Creo que es interesante para tener un orden de magnitud de la capacidad del ordenador FSD. También para entender porqué es un sistema propietario, optimizado, cuyo diseño es tan largo. AI5 se tardó 9 meses en diseñarlo y se consideró un tiempo récord, se terminó en abril 2026 para empezar a montarse en 2027.
- Xbox Series X (600€): 12 TFLOPS
- PlayStation 5 Pro (900€): 16.7 TFLOPS
- Mi PC (~1000€):
Ryzen 7 8700F + NPU: 16 TOPS
RTX 4060 8GB: ~15 TOPS (probablemente bastante más optimizada para IA)
- Sistema de infoentretenimiento Tesla (Ryzen): GPU Navi 23 (RDNA2) ≈ 10-12 TOPS
Ordenador FSD:
- HW3: 144 TOPS
- HW4: ~500+ TOPS
** Las comparaciones de TOPS y TFLOPS no son 100% directas por si hay alguien muy técnico, pero el orden de magnitud es válido para la idea del mensaje.
Mm no es que sean 100% directas, es que no son comparables ni de lejos y es muy engañoso esos datos que pones , porque no estáis espeficiando a que te refieres con TOPS. TOPS no es otra cosa que trillones (americanos) de operaciones por segundo, pero pueden ser operaciones de muchos tipos. De hecho es un término que muchas compañías usan alegremente para timar incautos (NVIDIA por ejemplo lo hace mucho). FLOPS si que especifica al menos que se usa coma flotante, aunque no especifica si son FP16, FP32 etc.. (a mayor precisión el rendimiento decrece exponencialmente)
No es lo mismo una operación en INT8 que en coma flotante y otras magnitudes, ni tampoco para distintos típos de cálculo.
Ahí, por ejemplo, estás poniendo que una RTX 4060 tiene 15 TOPS, no se exactamente en qué, pero teniendo en cuenta que estáis comparando con el SOC de Tesla , supongo que queréis comparar con procesamiento por IA, y el
HW4 usa INT8 en sus NPU para el FSD.Pues bien,
una simple RTX 4060 de 8 GB tiene una capacidad de procesamiento IA de 242 TOPS en INT8... cuando el HW4 solo alcanza entre 100 y 150 TOPS aproximados en INT8... (los 500 serían con sparsity, algo que, si no recuerdo mal, no soporta por hardware ese chip por lo que no tiene sentido, tampoco valdría de mucho porque es un chip hecho a medida para FSD y no tendría que andar procesando datos random)
Creo que los 15 TOPS lo sacas de los 15 TFLOPS que puede manejar la RTX 4060 en FP32... pero claro, eso es como si comparas las veces que puede una persona levantar una pesa de 100 gramos (INT8) con la que puede levantar una pesa de 100 kg (FP32). Evidentemente, son muchos más con INT8. Para que la comparación tenga sentido, hay que comparar TOPS en INT8 con TOPS en INT8.
Los datos de la PS5 Pro y demás lo mismo, son TFLOPS a una precisión FP32, mucho mayor que la que puede manejar el HW4. De hecho en INT8 da unos 300 TOPS solo su GPU integrada.
En realidad, el AI4 del HW4 es un chip bastante modesto, basado en diseños estándar Cortex-A72 (que tienen ya unos añitos), y lo impotante, las 3 NPU que tiene ofrecen el mismo rendimiento cada una que las NPU que meten Intel/AMD/qualcomm en sus procesadores de portátil de ultra bajo consumo (unos 30-50 TOPS por NPU). El AI5 sí que dará un salto interesante.
En cualquier caso, el rendimiento y capacidad depende de más cosas como el ancho de banda de memoria y demás, el HW4 no deja de ser un sistema cerrado centrado en una tarea, que hará siempre mejor que un chip de uso general como una GPU. Además, todas esas cifras de TOPS/TFLOPS suelen darlas los fabricantes en el mejor de los casos, muchos incluyendo sparsity (a grandes rasgos, se "salta" datos para simplificar cálculos de IA y conseguir más rendimiento), por lo que es difícil hacer una comparación entre chips con los "TOPS".