首頁 -> 內地

商湯推首個“可控”人物視頻大模型

分享到:
2024-07-04 00:00 | 稿件來源:香港新聞網

【字號:

香港新聞網7月4日電 2024世界人工智能大會(WAIC 2024)4日於上海揭幕,商湯科技推出首個向廣大用戶開放的可控人物視頻生成大模型Vimi,該模型更獲頒WAIC展覽展示最高榮譽“鎮館之寶”殊榮,成為本屆大會最具創新展品。Vimi基於商湯日日新大模型的強大能力,只需要一張任何風格的照片就能生成和目標動作一致的人物類短片,並支持多種驅動方式,可通過已有人物影片、動畫、聲音、文字等多種元素進行驅動。

Vimi 可通過一張照片生成人物短片

隨著大模型和生成式A 技術快速發展,讓照片中的人物動起來已不是新鮮事,但目前市面上相關產品的實際應用仍存在挑戰,包括:

• 人物動作、表情動作無法精準控制,只能頻繁嘗試各種Prompt。

• 效果不穩定,人物外貌、背景效果變幻莫測。

• 時長有限,只能生成3至4秒短片等,無法滿足廣大短片創作者的需要。

為解决這些實際應用問題,商湯可控人物視頻生成大模型Vimi應運而生。與圖片表情控制類技術只能控制面部表情動作不同,Vimi不但可以實現精準的人物表情控制,還可控制照片中人物上半身的自然肢體動作,並自動生成與人物相符的頭髮、服飾及背景變化。同時光影變化也能做到合理生成,讓人物動作和視覺效果流暢自然,畫面和諧唯美。更重要的是,Vimi具備極強的穩定性,可穩定生成長達1分鐘的單鏡頭人物類短片,畫面效果不會隨著時間變化而降低品質或失真,真正滿足娛樂互動等需要長時間穩定短片生成的需要。

Vimi將完全向廣大用戶開放使用。用戶只需上傳不同角度的高清人物照片,即可自動生成數字分身和不同風格的寫真短片。由Vimi生成的短片人物不再只是呆板的五官運動,而是搭配手勢、肢體動作、頭髮等,形成更完整的人物動作,讓創作者可基於生成的短片素材進行剪輯和二次創作。

針對喜愛自拍的用戶,Vimi支援聊天、唱歌、舞動等多種娛樂互動場景;對於熱衷表情包的用戶而言,Vimi通過單張圖片即可驅動生成各種具趣味的人物表情包,玩法多樣,實現創作自由。此外,Vimi亦提供唯美寫真風、奇幻風等多種生成風格,讓用戶仿佛穿越不同次元,享受富電影感的沉浸式視覺體驗。(完)

【編輯:李彥洲】

視頻

更 多
大型雜技劇《唐古百戲》登香港 舞台重現大唐風采觀眾大讚:滿滿視覺享受!
組團參加少年太空人體驗營 香港中學生:最期待去酒泉衛星發射中心
36屆香港書展正式開幕 黃雨下觀眾依舊大排長龍
【通說環球】海上張網“抓”箭!中國火箭回收“不走尋常路”
“南海仲裁案裁決”被炒作 吳士存:不讓裁決書壽終正寢,南海就永無寧日
“環顧四周,很多國家都不安全,反而香港在各方面都比較安全”
【你不知道的香港】輪椅也能上天星小輪?殘障人士:香港無障礙設施不輸任何地方