La respuesta corta
Tu teléfono tiene dos «cerebros». Uno diminuto, que nunca se apaga, escucha el micrófono y solo sabe reconocer cómo suena «Oye Siri»; todo lo demás lo tira. Si algo se parece, despierta al procesador grande, que lo revisa con una red seis veces mayor y comprueba que es tu voz.
Paso a paso
- El micrófono convierte tu voz en 16.000 muestras por segundo y la corta en trozos de 0,2 segundos.
- Cada trozo pasa por una red neuronal mínima, de 5 capas de 32 neuronas, que solo sabe cómo suena «Oye Siri».
- Cuanto más se parece, más sube una puntuación. Si cruza el umbral, despierta al procesador grande.
- El grande lo revisa con una red seis veces más ancha (5 capas de 192 neuronas) y compara la voz con la tuya.
- Se hace en dos pasos para ahorrar batería: tener al procesador grande escuchando todo el día la vaciaría.
El dato curioso

¿Sabías que…?
La red que escucha «Oye Siri» todo el día es diminuta: 5 capas de 32 neuronas. Por eso a veces la despierta una frase de la tele o el ruido de una cremallera.
Tú haces algo parecido: en un bar lleno de ruido no sigues ninguna conversación… hasta que alguien dice tu nombre. Es el «efecto cóctel».
Fotogramas del vídeo



Ponte a prueba
Una pregunta de este vídeo
Fuentes
- Apple Machine Learning Research, «Hey Siri: An On-device DNN-powered Voice Trigger» (2017)
- Apple Machine Learning Research, «Personalized Hey Siri» (2018)
- Lopez v. Apple: acuerdo de 95 millones de dólares (2025)