Preguntas sobre el espectro
Tamaños de FFT, decibelios, zumbidos y lo que un micrófono puede oír.
¿Qué es una FFT y qué es el ancho de bin?+
Una transformada rápida de Fourier toma un fragmento corto de sonido y lo divide en frecuencias equiespaciadas llamadas bins. La separación entre ellos, el ancho de bin, es la frecuencia de muestreo dividida entre el tamaño de la FFT: a 48 kHz, 8,192 puntos dan bins separados 5.86 Hz, y 32,768 puntos dan 1.46 Hz. Un tono que cae entre los centros de dos bins se reparte entre ambos, y por eso esta página ajusta una curva a los bins vecinos para situar un pico con más precisión de la que permite la separación por sí sola.
¿Por qué un tamaño de FFT mayor hace que la pantalla vaya más lenta?+
Más detalle en frecuencia exige un fragmento de sonido más largo. 32,768 puntos a 48 kHz son 683 milisegundos de audio, así que una nota tiene que durar eso para quedar representada por completo, y un cambio rápido se emborrona a lo largo de la ventana. 2,048 puntos son 43 milisegundos y reaccionan casi al instante, pero sus bins de 23.4 Hz no pueden separar 50 Hz de 60 Hz. Usa un tamaño grande para sonidos estables como un zumbido o una nota sostenida, y uno pequeño para la voz, la batería o cualquier cosa que cambie. Además, el ruido de banda ancha marca menos por bin a medida que los bins se estrechan, mientras que un tono puro se mantiene en el mismo nivel.
¿Es un sonómetro? ¿Qué diferencia hay entre dBFS y dB SPL?+
No. dBFS son decibelios relativos a la escala completa digital, donde 0 dBFS es el valor más alto que puede contener el conversor, y todas las lecturas de aquí están en esa escala, con una onda senoidal a escala completa en 0 dBFS. dB SPL es la presión sonora en la habitación, y para llegar a ella harían falta la sensibilidad del micrófono, la ganancia del preamplificador y el volumen de entrada del sistema operativo, datos que un navegador no puede conocer. Baja el volumen de entrada y todas las lecturas caen, aunque la habitación siga sonando exactamente igual de fuerte. La forma del espectro y la altura relativa de sus picos tienen sentido; los números absolutos no son volumen.
¿Por qué debo desactivar la supresión de ruido y el resto del procesamiento de voz?+
Los navegadores limpian el audio del micrófono para las llamadas antes de que ninguna página lo reciba. La supresión de ruido elimina sonidos constantes como ventiladores y el zumbido de la red eléctrica, que a menudo es justo lo que intentas encontrar. La cancelación de eco resta todo lo que reproducen los altavoces, lo que puede hacer desaparecer un tono de prueba. El control automático de ganancia sube y baja el nivel mientras miras. Los tres empiezan desactivados aquí, y la línea bajo cada interruptor muestra lo que el navegador dice que aplicó realmente, ya que algunos navegadores ignoran la petición en algunos dispositivos.
¿Cómo encuentro el zumbido de la red eléctrica a 50 o 60 Hz?+
Ajusta el tamaño de la FFT a 16K o 32K para que los bins estén a menos de 3 Hz entre sí, y usa la vista de espectro con el eje logarítmico. El zumbido de red está en 50 Hz en Europa, África, la mayor parte de Asia y Australia, y en 60 Hz en América y partes de Asia, con armónicos en múltiplos enteros: 100, 150 y 200 Hz, o 120, 180 y 240 Hz. Una línea fuerte en 100 o 120 Hz sobre una fundamental débil suele apuntar a un transformador o una fuente de alimentación más que a un bucle de tierra. Observa la lista de picos mientras desconectas o mueves los cables de uno en uno.
¿Por qué mi teléfono o mi portátil no muestra casi nada por debajo de 100 Hz?+
Los micrófonos integrados son diminutos y se filtran a propósito para dejar fuera el ruido de manipulación, el viento y la vibración del propio dispositivo, así que la mayoría cae bruscamente por debajo de unos 100 Hz. El analizador muestra lo que entrega el micrófono, no lo que hay en la habitación. Para ver graves reales, usa un micrófono de medición o un buen micrófono USB o de interfaz, y mantén desactivado el procesamiento de voz, ya que parte de él añade su propio corte de graves.
¿Qué muestra el espectrograma?+
El tiempo corre de derecha a izquierda, la frecuencia de abajo arriba, y el brillo es el nivel: el color de la tinta de la página para el silencio, pasando por el verde lima, hasta casi blanco para lo más fuerte. Un tono estable dibuja una línea horizontal, una voz dibuja una pila de curvas paralelas (sus armónicos), un silbido que se desliza dibuja una pendiente y una palmada es una franja vertical corta. Sigue llenándose mientras miras otra vista, así que al cambiar a él ves las últimas decenas de segundos.
¿Qué precisión tiene la frecuencia de pico?+
Para un tono estable, mucha. Cada pico se ajusta con una parábola que pasa por los tres bins que lo rodean y, en pruebas con tonos sintéticos a través de la misma ventana de Blackman que usa el navegador, la estimación quedó a menos de 0.007 de bin, es decir, menos de 0.04 Hz con los 8,192 puntos predeterminados a 48 kHz. El sonido real añade ruido, vibrato y parciales cercanos, así que considérala precisa hasta una pequeña fracción del ancho de bin mostrado. El reloj de audio también influye: un conversor que va 50 partes por millón más rápido lee cada frecuencia 50 partes por millón más alta. Y el pico más fuerte suele ser un armónico y no la nota que se está tocando.
¿Puedo usarlo para encontrar una frecuencia de acople o una resonancia de la sala?+
Sí, como herramienta de comparación. Para el acople, sube la ganancia poco a poco hasta que el sistema empiece a pitar, congela la pantalla y lee el pico más fuerte: esa es la frecuencia que hay que recortar en el ecualizador, con su nota más cercana al lado. Para un modo de la sala, reproduce ruido rosa o un barrido senoidal lento y busca picos que se mantengan en su sitio al mover el micrófono, normalmente por debajo de 300 Hz. Como el micrófono no está calibrado, compara posiciones y ajustes entre sí en lugar de leer los números como absolutos.
¿Se sube o se graba algo?+
No. El analizador lee el micrófono o el archivo dentro de esta pestaña con la API Web Audio y solo conserva el último fotograma para dibujarlo. No se envía nada a ningún servidor, no se guarda nada en el navegador y no se graba nada. Un PNG o un CSV solo existe cuando pulsas exportar, y va directamente a tu dispositivo. Al detener el micrófono, este se libera y el indicador de grabación del navegador debería apagarse. Un archivo local se reproduce desde tu propio dispositivo y nunca se sube.