Video · sonido
El único sonido nuestro es un clic.
Música instrumental muy baja, la voz al frente y un clic cuando el interruptor se enciende. Nada de golpes, subidas ni barridos.
Aquí suena unos 15 dB más fuerte que en el video, para que lo oigas solo.
La idea
Tres capas, y la voz manda.
La voz va a 0 dB; la música y el clic, unos 20 dB más abajo. Mueve la música y mira qué pasa.
Ejemplo: los primeros 16 segundos de «La vida de un chat». Si al quitar la música la pieza cambia, la música estaba muy alta.
Música
La música se siente, no se escucha.
- Qué música
- Instrumental, sin melodía protagonista, unos −20 dB por debajo de la voz.
- Cuando habla la voz
- Baja 3 o 4 dB con una rampa corta y, en el silencio, vuelve a subir: respira con la voz.
- Sin subidas ni golpes
- Ningún golpe fuerte ni subida de tensión. El giro lo marca el clic, no la música.
La pista, en cuatro preguntas
- ¿Tiene una melodía que compita con la voz?No
- ¿Tiene subidas de tensión o golpes?No
- Con la voz encima y a −20 dB, ¿la voz sigue clara?Sí
- ¿Se puede usar en un video de la marca?Se revisa su licencia antes de usarla.Sí
Estas son las respuestas que debe dar la pista.
El sonido de marca
Un clic seco al encenderse el botón.
Dura 50 milisegundos y suena justo cuando el botón llega arriba.
Aquí suena más fuerte que en el video. Toca «Repetir» para verlo y oírlo juntos.
Ver el clic cuadro por cuadro y dónde suena en las demos
En el cuadro exacto: 15 cuadros de subida y el clic en el último
A 30 fotogramas por segundo, el botón sube con la curva de estado en 15 cuadros (500 ms). El clic suena cuando llega; después el círculo pasa a azul en 6 cuadros (200 ms).
Dónde suena en las demos
Demo larga · 44 s
Reel · 18 s
En azul, el clic. En gris, el pop de las burbujas: sonido de interfaz, casi inaudible (−34 dB), que no es de marca.
Ver cómo se hace el clic
- Golpe seco
- Ruido que se apaga en 1,2 ms
- Dos tonos
- 2300 y 900 Hz, que se apagan en 6 y 12 ms
- Pico
- −20 dBFS · 48 kHz
def clic(): # golpe seco corto + resonancia breve; pico −20 dBFS
t = np.arange(int(0.05 * SR)) / SR; rng = np.random.default_rng(1)
y = rng.standard_normal(len(t)) * np.exp(-t / 0.0012) * 0.6 + np.sin(2 * np.pi * 2300 * t) * np.exp(-t / 0.006) * 0.5 + np.sin(2 * np.pi * 900 * t) * np.exp(-t / 0.012) * 0.4
return (y / np.abs(y).max() * 0.1).astype(np.float32)Se sintetiza con Python y numpy: no hay que comprar ni licenciar nada. El pico se normaliza a 0,1 (−20 dBFS).
Silencio
Antes de la frase clave, silencio.
De 300 a 500 ms, para que la frase que cambia el mensaje entre sola.
Volumen
Un solo ajuste de volumen, al final.
La pieza suena igual de fuerte que en YouTube e Instagram, sin que nada llegue a distorsionar.
Dibujo esquemático: los picos de una mezcla, en dB.
Ver las medidas y los comandos
- Volumen medio
- −14 LUFS
- Pico más alto
- −1 dBTP o menos (pico real)
- Audio final
- 48 kHz
1 · Medir
ffmpeg -i mezcla.wav -af loudnorm=I=-14:TP=-1:LRA=11:print_format=json -f null -
2 · Aplicar con lo medido
ffmpeg -i mezcla.wav -af loudnorm=I=-14:TP=-1:LRA=11:measured_I=…:measured_TP=…:measured_LRA=…:measured_thresh=… -ar 48000 audio-final.wav
Se mide con el mismo filtro que normaliza y se revisa el resultado antes de exportar. La mezcla se normaliza una sola vez, al final.
Producción
Cinco pasos, siempre en este orden.
Cada paso deja algo y el siguiente parte de ahí. Toca un paso para ver el detalle.
- Qué se hace
- Se escribe la historia completa en texto: voz, pantalla y transición con sonido, en tres columnas. La voz manda.
- Qué deja
- El guion en un solo archivo. Ejemplo de tres columnas (CSV)
- Qué se hace
- La graba Martín, o es una voz sintética que habla de la empresa. Se graba limpia, en un cuarto con ropa y cortinas y sin ventilador. Después se saca el tiempo de cada palabra.
- Qué deja
- La voz y el segundo exacto de cada palabra.
- Qué se hace
- Cada elemento entra cuando la voz lo nombra y los subtítulos salen del tiempo de cada palabra. El video se hace sin sonido, a propósito.
- Qué deja
- El video, todavía sin sonido. Cómo entra cada elemento
- Qué se hace
- Se juntan la voz, la música baja y el clic en su segundo exacto. Luego se iguala el volumen y se mide.
- Qué deja
- El audio listo para unir al video.
- Qué se hace
- Se une el audio al video, se revisa sin sonido y en un teléfono real, y salen los tres tamaños.
- Qué deja
- El video final en 16:9, 9:16 y 4:5, cada uno con su versión sin sonido.
Ver las diez etapas y por qué el video se hace sin sonido
| Etapa | Con qué | Deja |
|---|---|---|
| 1 · Guion | Texto plano, guion.json | guion.json |
| 2 · Voz | Martín grabado o voz sintética; pico entre −12 y −6 dBFS, cuarto con ropa y cortinas, sin ventilador | voz.mp3 |
| 3 · Tiempos | whisper-cli, por palabra | palabras.json |
| 4 · Imágenes | Ilustración, captura o foto | carpeta public/ |
| 5 · Animación | Remotion y el guion.json | carpeta src/ |
| 6 · Render mudo | remotion render --muted | video-mudo |
| 7 · Mezcla | Python con numpy + ffmpeg, −14 LUFS | audio.wav |
| 8 · Subtítulos | palabras.json, libass | subs.ass |
| 9 · Revisión | Sin sonido, en teléfono real | lista de control |
| 10 · Exportes | ffmpeg, sin recodificar la imagen: 16:9, 4:5, 9:16 y nombres | final.mp4 |
El video se hace siempre sin sonido; el audio se mezcla aparte.
Un componente de audio por cada efecto vuelve el render unas 8 veces más lento. Con la mezcla aparte, un cambio de sonido no obliga a renderizar de nuevo.
Tiempo de render, relativo.
Exportar
Tres tamaños, todos con sonido.
Texto, logo y botón van solo dentro de la zona azul. En 9:16, así se evitan los botones de la app.
Ejemplo de lo que se entrega
- El video final, con sonido
- El mismo video, sin sonido
- El audio suelto
Pieza, formato y versión, en minúsculas, con guion bajo y sin tildes ni espacios.
Ver la tabla, las medidas y las especificaciones
| Formato | Tamaño | Para qué | Archivo de ejemplo |
|---|---|---|---|
| 16:9 | 1920 × 1080 | Explicativo y clip de charla | |
| 9:16 | 1080 × 1920 | Reel, historia y anuncio | |
| 4:5 | 1080 × 1350 | Feed de Instagram |
- Zona segura 16:9
- Lados 120, arriba 84, abajo 96. El título, en y 324.
- Zona segura 9:16
- x de 80 a 1000, y de 272 a 1248. Nada en el 14 % de arriba ni en el 35 % de abajo.
- Zona segura 4:5
- Márgenes de 80. El título, en y 408.
- Imagen
- 30 fotogramas por segundo · H.264 en MP4
- Audio
- 48 kHz · AAC dentro del MP4 y WAV suelto
- Volumen
- −14 LUFS · pico real de −1 dBTP o menos
- Antes de salir
- Se mira sin sonido, en un teléfono real
Lo que no se hace
Tres maneras de ensuciar el sonido.
Cada una, dibujada como esquema, con su motivo y la manera correcta al lado.
1 · Música que tapa la voz
A −20 dB, la música se siente y la voz se entiende.
A −6 dB la voz se pierde y hay que subir el volumen para entender.
2 · Música con subidas y golpes
Música pareja y baja. El giro lo marca el clic, no la música.
Los golpes fuertes y las subidas de tensión rompen la calma y compiten con la voz.
3 · Silencio relleno
De 300 a 500 ms de silencio quieto: la frase clave entra sola.
Una subida o un golpe en la pausa: ya no hay pausa y la frase llega gritada.
Ver lo que no entra en ninguna pieza
- ×
Whoosh. Un barrido largo entre escenas. Nuestro corte es seco.
- ×
Riser. Una subida de tensión. La marca es calma.
- ×
Impacto o «boom». Un golpe grave en cada corte: es el sello de otro canal, no el nuestro. The Diary of a CEO pone un efecto en casi cada corte; nosotros, uno en toda la pieza.
- ×
Música de stock con drops. Un golpe fuerte rompe la calma y tapa la voz.
- ×
Paquetes de whooshes, risers e impactos. Traen el sonido de otro estilo.
Sigue por aquí