Accès ouvert déclaré
2025
preprint
Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model
H.R. Chen, Siyan Chen, Xin Chen, Y L Chen, Ying Chen, Zhuo Chen, Feng Cheng, Tianheng Cheng, Xin-qi Cheng, Xuyan Chi, Jian Cong, Jing Cui, Qinpeng Cui, Junliang Fan, Jing Fang, Zetao Fang, Chengjian Feng, Feng Han, Mingyuan Gao, Yu Gao, Dong Guo, Qiushan Guo, Boyang Hao, Qingkai Hao, Bibo He, Qian He, Richard Hu, Xi Tong Hu, Weilin Huang, Zhaoyang Huang, Zhongyi Huang, Donglei Ji, Siqi Jiang, Wei Jiang, Zhuo Jiang, Ashley Kim, Jianan Kong, Zhichao Lai, Shanshan Lao, Yichong Leng, Li Ai, Feiya Li, Gen Li, Huixia Li, Jiashi Li, Liang Li, Ming Li, Shanshan Li, Tao Li, Xian Li, Xiaojie Li, Xiaoyang Li, Xingxing Li, Yameng Li, Y. Li, Yiying Li, Chao Liang, Liang Han, Liang Jianzhong, Ying Liang, Zhiqiang Liang, Liao Wang, Yalin Liao, Heng Lin, Keng-Yu Lin, Shanchuan Lin, Xi Lin, Zhijie Lin, Fangfang Liu, Gaohong Liu, Jiawei Liu, Jie Liu, Jihao Liu, Shouda Liu, Shu Liu, Sichao Liu, Songwei Liu, Xin Liu, Ke Liu, Yibo Liu, Zikun Liu, Zu-Xi Liu, Junlin Lyu, Lecheng Lyu, Qian Lyu, Han Sheng Mu, Xiaonan Nie, X. Pan, Yanghua Peng, Lianke Qin, Xiaohan Qu, Kai Shen, Guang Shi, Lei Shi, Yan Song, Yinglong Song, Fan Sun, Li Sun, Yan Sun, Zeyu Sun, Wenjing Tang, Feng Wang, Furui Wang, Jinran Wang, Junkai Wang, Ke Wang, Kexin Wang, Qingyi Wang, Rui Wang, Sen Wang, Shuai Wang, Tingru Wang, Weichen Wang, Xin Wang, Yanhui Wang, Yue Wang, Yu‐Ping Wang, Yuxuan Wang, Ziyu Wang, Guoqiang Wei, Di Wu, Guohong Wu, Hanjie Wu, Jiankang Wu, Jie Wu, R. Ryanne Wu, Xing‐Long Wu, Yonghui Wu, Ruiqi Xia, Liang Xiang, Fei Xiao, Xuefeng Xiao, Xie Pan, Shuangyi Xie, Shuang Xu, Yan Shen, Bangbang Yang, Ceyuan Yang, Jiaqi Yang, Runkai Yang, Tao Yang, Yang Yang, Yihang Yang, Yang ZhiXian, Ziyan Yang, Yifan Yao, Zilyu Ye, B. X. Yu, Jian Yu, C. Z. Yuan, Weihong Zeng, Xuejiao Zeng, Yan Zeng, Chuntao Zhang, Heng Zhang, Kuo Zhang, Liang Zhang, Liying Zhang, Manlin Zhang, Ting Zhang, Weida Zhang, Xinyan Zhang, Yan Zhang, Yuan Zhang, Zixiang Zhang, HongLei Zhao, Yang Zhao, Hao Zheng, Jianbin Zheng, Xiaozheng Zheng, Yangyang Zheng, Yijie Zheng, Jiexin Zhou, Jiahui Zhu, Kuan Jun Zhu, Shenhan Zhu, Wenjia Zhu, Benhui Zou, Fang Zuo
0Citations signalées — pas une note de qualité
0Institutions déclarées
0Pays d’affiliation déclarés
Résumé fourni par la source
Recent strides in video generation have paved the way for unified audio-visual generation. In this work, we present Seedance 1.5 pro, a foundational model engineered specifically for native, joint audio-video generation. Leveraging a dual-branch Diffusion Transformer architecture, the model integrates a cross-modal joint module with a specialized multi-stage data pipeline, achieving exceptional audio-visual synchronization and superior generation quality. To ensure practical utility, we implement meticulous post-training optimizations, including Supervised Fine-Tuning (SFT) on high-quality datasets and Reinforcement Learning from Human Feedback (RLHF) with multi-dimensional reward models. Furthermore, we introduce an acceleration framework that boosts inference speed by over 10X. Seedance 1.5 pro distinguishes itself through precise multilingual and dialect lip-syncing, dynamic cinematic camera control, and enhanced narrative coherence, positioning it as a robust engine for professional-grade content creation. Seedance 1.5 pro is now accessible on Volcano Engine at https://console.volcengine.com/ark/region:ark+cn-beijing/experience/vision?type=GenVideo.
Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.
Contrôle bibliographique ouvert
La source scientifique ouverte est momentanément indisponible.
Sujets associés
Speech and Audio ProcessingGenerative Adversarial Networks and Image SynthesisMusic Technology and Sound Studies