Vídeos
Cada capítulo de 2047: Arquivos do depois de antes gera duas cenas, criadas a partir do texto da narrativa. Os vídeos são projetados na instalação artística e publicados aqui, conforme nosso agente de IA coleta notícias sobre os impactos ambientais da inteligência artificial e as páginas são impressas no espaço expositivo.
Como as cenas são feitas
Cada capítulo ganha duas cenas de cinco segundos, geradas a partir do próprio texto. Quem as faz é o MiniMax H3, um modelo aberto de vídeo, rodando na máquina da obra, ao lado da impressora. O modelo também gera som junto com a imagem. A obra descarta esse som, e a parede fica muda.
O H3 não cabe numa placa doméstica. Somados, os três modelos que ele usa passam de 130 GB. São eles o transformer que desenha o vídeo, com 62 GB, o modelo que lê o texto e o retrato, com 63 GB, e o decodificador de imagem, com cerca de 10 GB. A placa da obra, uma RTX 3090, tem 24 GB. Para fazer o H3 rodar ali, Felipe Sztutman desmontou o modelo e o remontou peça por peça.
A geração foi partida em dois processos que nunca ocupam a placa juntos. O primeiro lê o texto e o retrato do personagem, com o leitor reduzido a oito bits e carregado camada por camada. O segundo desenha o vídeo. No transformer, as 300 camadas mais pesadas foram convertidas para oito bits e ficaram com 19 GB. Elas moram na memória do computador e sobem para a placa um bloco por vez, cinquenta vezes a cada passo. A versão de quatro bits foi testada e recusada no olho, porque a imagem perdia demais. A parte que regula cada bloco conforme o nível de ruído foi calculada de antemão e guardada numa tabela de 97 MB, já com a LoRA Turbo de Larryvrh embutida. A atenção, que compara cada pedaço do vídeo com todos os outros, só calcula cerca de um quarto das comparações, com a técnica Sol-Attn. E a LoRA Turbo derruba o processo para seis passos, sem a segunda passada de orientação que o modelo original pede.
O caminho até essa montagem começou em abril de 2026, no TurboQuant, a pesquisa de Felipe Sztutman sobre como comprimir modelos de linguagem para que rodem em placas domésticas sem perder o que importa no resultado. Em agosto o trabalho passou para o vídeo, com outras técnicas. O repositório é aberto, em github.com/sztlink/turboquant-cuda-bench.
O resultado usa 19 dos 24 GB da placa e entrega cada cena de 5,17 segundos, em 1920×1088, em cerca de doze minutos, com perto de 54 Wh medidos na própria placa. Na RTX 4090 do estúdio, a mesma montagem leva pouco mais de cinco minutos.
Não há montagem nem escolha quadro a quadro. A máquina gera, a parede mostra e o site guarda. Na primeira leva, a camada que simula o mundo digital saiu em cor de argila, porque o modelo leu ao pé da letra a palavra clay, que no 3D quer dizer apenas superfície sem textura. Corpos viraram bonecos, rostos se fundiram com objetos, pés sobraram. Vinte e uma dessas cenas foram refeitas com outra camada, a das normais, que pinta cada superfície pela direção em que ela aponta. As demais continuam como saíram.
Quase tudo aqui roda localmente, com pesos abertos. A exceção são os rostos dos personagens, propostos por um modelo proprietário e escolhidos à mão. É vídeo feito em tempo real por uma máquina que erra do seu jeito e vai aprendendo diante de quem olha.