¿Es Seedance 2.5 el último modelo de IA de personajes asequible?

19 de agosto de 202613 min read
Glassworker weighs two furnaces inside a converted hydroelectric dam

Entra en una casa de alquiler de cámaras un año después de la llegada de un nuevo cuerpo insignia y una vieja regla de la tecnología se hace visible en las estanterías. La cámara que ayer era la mejor aún puede producir imágenes hermosas, pero su tarifa de alquiler ha bajado. El fabricante ha recuperado parte de sus costes de desarrollo, los competidores se han puesto al día y el mercado considera ahora la misma máquina un producto de generación anterior. La tecnología creativa se deprecia.

El vídeo generado por IA parece romper esa regla porque un modelo de IA no es simplemente una cámara. Es una cámara, una granja de renderizado y un laboratorio cinematográfico reunidos en un servicio de pago por uso. El cliente nunca compra el instrumento; paga por cada acto de computación. Cada fotograma generado debe fabricarse a partir del ruido, tanto si el modelo se lanzó ayer como si lo hizo el año pasado. Cuando llega una cámara nueva, la antigua permanece en la estantería.

Cuando llega un modelo de vídeo nuevo, el antiguo todavía debe realizar miles de millones de cálculos cada vez que alguien le pide crear un plano.

Eso convierte la llegada de Seedance 2.5 de ByteDance en algo más que otra entrada en la cada vez más concurrida tabla de clasificación de modelos. Plantea una incómoda cuestión económica. Si cada mejora importante exige más computación de entrenamiento, conjuntos de datos más grandes e inferencias más costosas, ¿llegaremos finalmente a un modelo técnicamente impresionante pero económicamente definitivo?

¿Está Seedance 2.5 cerca del punto a partir del cual los creadores —o incluso las empresas que desarrollan estos sistemas— ya no podrán permitirse el siguiente paso?

La respuesta breve probablemente sea no. La respuesta más útil es que la pregunta expone una fractura real en la economía de la IA: crear la frontera tecnológica es cada vez más caro exactamente al mismo tiempo que las capacidades de ayer se vuelven mucho más baratas de utilizar.

El trabajador del vidrio entra en la sala del horno de la presa al comienzo de la producción

Qué aporta realmente Seedance 2.5 a la IA de personajes

El ritmo del desarrollo reciente de ByteDance ayuda a explicar por qué la preocupación parece plausible. Seedance 2.0 se lanzó oficialmente en febrero de 2026. Podía aceptar texto, imágenes, vídeo y audio como referencias, generar audio y vídeo sincronizados y producir resultados de 15 segundos con varios planos.

Según el material de lanzamiento de ByteDance, un usuario podía proporcionar hasta nueve imágenes, tres clips de vídeo y tres clips de audio en una sola solicitud.

Seedance 2.5 llegó solo unos meses después. Duplica la generación máxima individual hasta 30 segundos y amplía el límite de referencias a 30 imágenes, diez clips de vídeo y diez clips de audio. Ofrece extensiones en varias rondas, edición a nivel de marca temporal, un trabajo de chroma mejorado, perspectivas de cámara más controladas y mayor continuidad entre cambios de escena.

ByteDance lo presenta no solo como un generador de clips mejor, sino como un sistema capaz de interpretar un paquete de materiales creativos y llevar una idea más lejos en la producción.

En este contexto, la IA de personajes no es simplemente una interfaz conversacional. Es la capacidad del modelo para preservar la identidad, la interpretación, el vestuario y la continuidad espacial mientras un personaje se mueve dentro de un plano o atraviesa varias escenas.

Para los cineastas, esa distinción importa. Un clip más largo no es automáticamente un plano mejor, y un modelo que inventa más partes de la secuencia también puede inventar más errores. Sin embargo, pasar de un prompt y un fotograma inicial a referencias, blocking, instrucciones de edición y control temporal representa un progreso real. Acerca el modelo a la forma en que ya trabajan los directores: mediante decisiones acumuladas, no a partir de una única descripción verbal.

También vuelve más exigente la computación. El vídeo combina complejidad espacial y temporal. Una duración mayor implica más fotogramas; una resolución más alta significa más información en cada fotograma; el sonido sincronizado añade otra secuencia generada; y los vídeos de referencia deben interpretarse antes de producir el resultado. En las arquitecturas actuales de difusión de vídeo, un clip de 720p y cinco segundos puede desplegarse en más de 100.000 tokens internos.

Los investigadores que trabajan en difusión eficiente de vídeo describen la atención —el mecanismo que relaciona esos tokens entre sí— como el principal cuello de botella de escalabilidad.

Desde esa perspectiva, el temor a un techo de costes parece racional. Cada anuncio de un modelo promete más: planos más largos, mayor resolución, física más sólida, sonido nativo, más referencias, mejor edición y menos errores de continuidad. Cada promesa parece añadir otra carga a la máquina.

Las dos curvas de costes de la inteligencia artificial

La primera curva es la que concentra la mayor parte de la alarma. El desarrollo de la IA de frontera requiere cantidades extraordinarias de capital. El análisis de Epoch AI estima que la computación de entrenamiento de los modelos lingüísticos de frontera ha crecido aproximadamente cinco veces por año desde 2020, mientras que el coste de entrenamiento ha aumentado unas 3,5 veces anuales. Las necesidades energéticas se han duplicado cada año.

Un centro de datos de IA típico con un gigavatio de capacidad informática representa ahora aproximadamente 38.000 millones de dólares de capital inicial.

Los desarrolladores de modelos de vídeo revelan muchos menos datos de los necesarios para hacer un cálculo equivalente, por lo que no se deben presentar sin más las cifras de los modelos lingüísticos como si fueran los costes de Seedance. Sin embargo, sí muestran la dirección del desarrollo de los modelos fundacionales. Los sistemas más capaces requieren cada vez más una infraestructura que solo un puñado de empresas u organizaciones respaldadas por Estados puede reunir.

Cinco hiperescalares ya controlan más de dos tercios de la computación mundial de IA.

Si esta fuera la única curva, la conclusión sería sombría. Los modelos de frontera serían cada vez más caros; los proveedores de API trasladarían el coste a los clientes o venderían generaciones por debajo de su coste total; los laboratorios independientes desaparecerían; y el acceso creativo dependería de la voluntad de ByteDance, Google, OpenAI y unas pocas empresas más de subvencionarlo.

Pero una segunda curva avanza en dirección contraria. El coste de obtener un nivel fijo de capacidad de IA está cayendo con enorme rapidez. El AI Index 2025 de Stanford descubrió que el coste de inferencia de un sistema con un rendimiento equivalente al de GPT-3.5 cayó más de 280 veces entre noviembre de 2022 y octubre de 2024.

Los costes del hardware descendieron alrededor de un 30 % anual, mientras que la eficiencia energética mejoró aproximadamente un 40 % al año. Investigaciones más recientes del MIT estimaron que el precio de alcanzar un nivel fijo de rendimiento estaba cayendo entre cinco y diez veces al año, y que las mejoras algorítmicas representaban aproximadamente una ganancia de eficiencia de tres veces anual.

Por eso un modelo más nuevo puede ser más capaz y más barato. GPT-4o se lanzó a la mitad del precio y al doble de velocidad que GPT-4 Turbo. Google redujo Veo 3 de sus 0,75 dólares originales por segundo a 0,40, al tiempo que introdujo Veo 3 Fast a 0,15 dólares por segundo.

El hardware nuevo, la cuantización, la destilación, la computación dispersa, el almacenamiento en caché, un batching mejor y un software de servicio optimizado cambian continuamente la cantidad de trabajo útil que puede extraerse de cada dólar de computación.

La aritmética del modelo antiguo no desaparece mágicamente, pero tampoco queda congelada en el centro de datos donde nació. Sus pesos pueden servirse en chips más nuevos y mediante software mejor. Con mayor frecuencia, los proveedores no reducen indefinidamente el precio de un producto antiguo. Lo retiran o lo sustituyen por un modelo más pequeño y rápido que ofrece resultados comparables de forma más eficiente. La inteligencia de ayer se convierte en una función del modelo económico de mañana.

El trabajador del vidrio extrae del horno una figura de vidrio luminosa y secuencial

Cuánto cuesta realmente un segundo de vídeo generado por IA

Los propios precios de Seedance revelan por qué las comparaciones generacionales simples resultan engañosas. En la API de Runway, que ofrece varios modelos de terceros bajo un mismo sistema de facturación, Seedance 2.0 cuesta actualmente 0,36 dólares por segundo de salida a 720p. Seedance 2.5 cuesta 0,30 dólares por segundo a la misma resolución, aunque el vídeo de entrada y el de referencia conllevan cargos adicionales.

A 1080p, la relación se invierte: Seedance 2.0 cuesta 0,40 dólares por segundo y Seedance 2.5, 0,68. La tabla de precios completa contiene diferencias igualmente amplias entre las variantes estándar, rápidas y ligeras de otros modelos.

BytePlus hace aún más explícita la variabilidad. Su paquete de cinco millones de tokens de Seedance 2.5 se anuncia como capaz de producir aproximadamente entre 120 y 500 segundos de vídeo a 480p. Es un rango superior a cuatro veces con la misma cantidad de tokens, según el modo de generación y las entradas.

No existe una respuesta única y honesta a la pregunta «¿cuánto cuesta Seedance 2.5 por segundo?» sin especificar resolución, duración, referencias, proveedor y flujo de trabajo.

Para un profesional creativo, sin embargo, incluso ese cálculo está incompleto. La métrica útil no es el coste por segundo generado, sino el coste por segundo aceptado.

Supongamos que un modelo antiguo cuesta 30 céntimos por segundo, pero necesita ocho intentos antes de producir un plano con anatomía, interpretación y continuidad aceptables. Un modelo nuevo a 60 céntimos por segundo solo necesita tres. El modelo supuestamente caro ya ha ganado antes de contar las horas dedicadas a enmascarar errores, reconstruir referencias o convencer a un cliente de que el abrigo del actor cambió de color por razones artísticas.

Los precios del vídeo generado por IA rara vez incluyen el rendimiento de los intentos fallidos, pero el fracaso es el destino de una parte importante de los presupuestos de producción.

Como sostiene la guía de Ciaro Pro sobre cómo presupuestar una película hecha con IA, la tarifa visible de generación es solo una parte del coste de producción; la planificación, la continuidad, la iteración, el trabajo editorial y el acabado determinan si esos segundos generados se convierten en una película.

Un modelo que sigue el storyboard, respeta la interpretación de referencia y conserva el decorado durante un movimiento de cámara puede ser económicamente superior incluso al doble del precio de lista. Por tanto, una IA de personajes fiable puede justificar un precio de generación más alto cuando reduce las tomas descartadas y las reparaciones de continuidad. A la inversa, un modelo espectacular puede ofrecer una mala relación calidad-precio cuando sus mejores cualidades son irrelevantes para el plano.

Un inserto con cámara fija no necesita el razonamiento más caro de la industria sobre física y diálogos.

Esto cambia el papel del software de producción. La capa valiosa quizá no sea una lealtad permanente al modelo que encabeza actualmente las clasificaciones, sino un sistema para hacer películas con IA que mantenga conectados el guion, los storyboards, los personajes, las referencias, las versiones y el montaje mientras se utilizan distintos motores de generación para planos diferentes.

A medida que los modelos se especializan y sus curvas de precios divergen, el enrutamiento se convierte en una decisión creativa y financiera.

Ese enrutamiento también exige disciplina de categorías: poly ai y polybuzz ai atienden casos de uso conversacionales; magicschool ai se centra en la educación; humanizers ai, humanize ai y ai humanizer se ocupan de la transformación de texto; mientras que google ai studio y ai mode sirven para flujos de creación o búsqueda más amplios, no para la economía del vídeo plano a plano.

El techo puede cambiar la industria sin detener el progreso

Nada de esto elimina el problema del coste de frontera. Cambia su consecuencia más probable. Es menos probable que encontremos un modelo de vídeo definitivo que un mercado en el que el desarrollo de frontera se concentre en empresas capaces de justificarlo mediante varios negocios a la vez.

ByteDance no necesita que Seedance se comporte como una empresa de cámaras independiente. El modelo puede respaldar productos de creación para consumidores, servicios en la nube, herramientas publicitarias y flujos de trabajo internos de medios. ByteDance también afirma que Seedance 2.5 se está aplicando a datos sintéticos de entrenamiento, simulaciones industriales, robótica y escenarios de conducción autónoma.

Por tanto, la misma inversión en investigación puede generar valor en mercados que ninguna suscripción de cineastas independientes podría sostener por sí sola.

Google puede hacer un cálculo parecido entre la infraestructura en la nube, la publicidad, YouTube y Workspace. Meta puede financiar modelos mediante un negocio publicitario. Una empresa especializada en modelos que no cuente con esas economías circundantes afronta un problema más difícil. Incluso cuando una solicitud de API de pago deja un margen saludable en inferencia, recuperar miles de millones en investigación, adquisición de datos e infraestructura es una cuestión distinta.

Por tanto, el peligro no es que los modelos de vídeo dejen de mejorar de repente. Es que la frontera se vuelva inseparable de un pequeño número de ecosistemas corporativos. El acceso creativo podría seguir siendo asequible mientras se estrecha el control sobre la tecnología subyacente. Los precios pueden ser bajos porque la eficiencia ha mejorado, porque una plataforma está captando clientes, porque otra división se beneficia del modelo o porque un proveedor participa en una guerra de precios.

Todas esas situaciones parecen idénticas en una factura de API, pero crean dependencias a largo plazo muy diferentes.

También existe una razón técnica para no declarar un modelo definitivo. La presión creada por el escalado costoso está produciendo arquitecturas más eficientes. Los investigadores de Video Sparse Attention han informado de una reducción de 2,53 veces en la computación de entrenamiento sin un aumento correspondiente de la pérdida de difusión. En un modelo de vídeo de 14.000 millones de parámetros, su método redujo el tiempo de generación de 1.274 a 576 segundos.

La combinación de atención dispersa y destilación produjo una aceleración anunciada de 50,9 veces en un modelo más pequeño, manteniendo la calidad.

Esas cifras proceden de sistemas de investigación, no demuestran que el próximo modelo comercial vaya a ser 50 veces más barato. No obstante, muestran que el progreso no se limita a comprar más GPU. Un modelo puede mejorar porque sus desarrolladores descubren qué cálculos eran innecesarios.

Entonces, ¿es Seedance 2.5 el último modelo que podremos permitirnos?

Casi con toda seguridad, no. Seedance 2.5 incluso podría volverse mucho más barato de utilizar mientras un sucesor más capaz ocupa la categoría premium. Ese ha sido el patrón dominante en la generación de texto, imágenes y vídeo: la frontera asciende mientras sus capacidades anteriores se difunden en sistemas más rápidos y menos costosos.

El límite serio está en otro lugar. El escalado por fuerza bruta no puede seguir siendo la única vía fiable de mejora. Si cada ganancia en coherencia o precisión física exige una ejecución de entrenamiento geométricamente mayor y más computación por cada fotograma generado, el número de organizaciones capaces de competir seguirá reduciéndose. Los próximos avances decisivos tendrán que mejorar la relación entre computación y control creativo utilizable, no solo la puntuación en los benchmarks.

Para los cineastas que evalúan la IA de personajes en vídeo, esto sugiere una forma menos glamurosa pero más duradera de medir el progreso. Pregunta cuántos segundos generados sobreviven al montaje. Pregunta si las referencias permanecen estables, si el modelo puede revisar un momento sin destruir el resto y si un motor más barato puede encargarse del plano.

El sistema ganador no será necesariamente el que genere el clip más asombroso de forma aislada. Será el que desperdicie menos dinero entre una intención y una secuencia terminada.

Seedance 2.5 no es el final del vídeo generado por IA. Sin embargo, puede marcar el punto en el que la economía se vuelve imposible de ignorar. El futuro del cine generativo no estará determinado únicamente por lo que un modelo pueda imaginar, sino por la eficiencia con la que esa imaginación pueda dirigirse, repetirse y pagarse.

La secuencia de vidrio terminada se extiende por la silenciosa sala de la presa

Tu visión. Plano a plano.

Empieza gratis. Escala cuando tu producción esté lista.

Recommended articles

Tu visión. Plano a plano.

Empieza gratis. Escala cuando tu producción esté lista.