AI模型

國際工商科技

Reka攜手Moonvalley推進實體AI模型與基礎設施建設

舊金山2026年6月11日 /美通社/ — 專注面向現實世界研發基礎智慧技術的AI研究實驗室Reka宣佈與Moonvalley達成合作,吸納一批優秀的AI研發人員和工程師,共同加速推進實體AI模型與基礎設施建設。 本次整合後,Mateusz Malinowski博士、Mikołaj Bińkowski博士,以及一批曾任職於DeepMind、Meta、亞馬遜、微軟、Google、Wayve和Runway的研發人員和工程師正式加入Reka。Malinowski此前是一位資深研究科學家,Bińkowski曾任Google DeepMind高階研究科學家,二人均是Google的Veo系列模型的核心研發人員,如今將加入Reka的研發領導團隊。 Reka致力於打造能夠在現實環境中進行推理、模擬與行動的AI,旗下模型旨在攻克各類複雜的現實難題,應用場景涵蓋自主防禦、智慧機器人、新一代可穿戴裝置及媒體領域等。 Reka執行長Dani Yogatama表示:「實體AI本質上是一項前沿科研課題。這支團隊在影片生成與多模態模型領域擁有頂尖專業能力。雙方將攜手打造能夠理解並在現實世界中行動的AI系統,覆蓋模擬模擬、機器人應用和實時決策等多個領域。」 Mateusz Malinowski說道:「我們研發的模型並非僅能生成影片,更能理解現實世界的執行規律。它可以模擬運動狀態、物理規則與時序動態,讓機器人在行動前預判結果,打造出更安全、更負責任的AI。我們將模擬模擬與邏輯推理融合至同一系統的發展路線,是順應行業趨勢的正確選擇。」 整合後的團隊將重點研發世界語言行動模型(WLAM)。這是一款獨特的全能模型,依託第一人稱視角及各類現實世界資料開展訓練,可透過執行高度逼真的模擬模擬來完成規劃,進而實現對現實世界的感知與行動。該模型能夠生成高保真的多模態內容,憑借領先的時空感知能力,將多模態感知資訊轉化為機器人執行指令,同時還可對長影片及流式影片進行細粒度推理。 Reka目前的業務主要分為四大板塊: Reka Labs:面向現實世界的基礎智慧技術研發平臺 Reka Infer:多模態AI推理平臺與應用程式介面(API) Reka

閱讀更多
國際工商科技

全球首個大一統多模態影片模型可靈O1釋出

香港2025年12月2日 /美通社/ — 領先的內容社群及社交平臺快手科技(「快手」或「公司」;港幣櫃臺股份代號:01024 / 人民幣櫃臺股份代號:81024)宣佈,12月1日,可靈AI正式釋出其全新產品「可靈O1」,定位為首個大一統的多模態創作工具。可靈O1基於全新的影片和影象模型,整合文字、影片、圖片、主體等多模態輸入,將所有生成和編輯任務融合於一個全能引擎之中。可靈O1的推出,徹底解決了AI影片生成中角色、場景等一致性難題,為影視、自媒體、廣告電商等應用場景,提供了深度適配的一站式解決方案。 大一統模型,解決影片創作的所有難題 作為首個大一統多模態影片模型,可靈O1基於多模態視覺語言(MVL)理念,突破傳統單一影片生成任務的模型邊界,將參考生影片、文生影片、首尾幀生影片、影片內容增刪、影片修改變換、風格重繪、鏡頭延展等多種任務,融合於同一個全能引擎之中,使用者無需切換模型及工具,即可一站式完成從生成到編輯的全流程創作。 憑藉深層語義理解力,可靈O1可將使用者上傳的圖片、影片、主體、文字均視為指令。模型打破了模態限制,能夠從不同視角綜合理解一張照片、一段影片或一個主體,精準生成各項細節。 可靈O1的多模態指令輸入區,讓繁瑣的剪輯後期變成了簡單的對話。使用者無需手動遮罩或輸入關鍵幀,只需輸入「移除路人」、「將白天改為黃昏」或「替換主角服裝」等指令,模型即可讀懂影像邏輯,實現從區域性主體替換到整體風格重繪的畫素級語義重構。此外,它也全面支援圖片/主體參考、影片內容編輯、鏡頭切換、首尾幀生成及文生影片等多種能力。 針對AI影片落地中常見的角色與場景不一致的痛點,可靈O1底層強化了對輸入影象及影片的理解。它能像人類導演一樣,「記住」主角、道具和場景,確保主體特徵在鏡頭變化中始終保持穩定。此外,該模型展現了強大的多主體融合能力。使用者可以自由組合多個不同主體,或將主體與參考圖混搭。即便是在複雜的群像戲或互動場景中,模型也能獨立鎖定並保持每一位角色或道具的特徵,確保「主角」在不同鏡頭中實現工業級的特徵統一。 可靈O1支援「技能組合」,不再侷限於單點任務。使用者可以指令其「在影片中增加主體的同時修改背景」,或者「在圖片參考生成時,同步修改風格」。這種一次生成多種創意變化的能力,極大地拓展了創作的自由度,讓創意的化學反應成為可能。 在時長控制上,可靈O1將定義時間的權力交還給創作者,支援3-10秒自由生成。無論是短促的視覺衝擊,還是悠長的故事鋪陳,都由使用者自由掌控。值得一提的是,作為統一模型的一部分,可靈O1的首尾幀能力也將支援3-10秒的生成時長選擇(即將釋出),進一步增強敘事的張弛度。 同時釋出的還有可靈影象O1模型,可實現從基礎影象生成到高階細節編輯全鏈路無縫銜接,使用者既可透過純文字生成影象,也可上傳最多10張參考圖進行融合再創作。該模型具備四大核心優勢:特徵高度保持,讓主體元素穩定不偏差;細節修改精準響應,讓每一處調整都符合預期;風格調性準確把控,讓畫面氛圍始終統一;超豐富想像力,讓創意呈現更具張力,真正實現「所想即所得」。 一個模型覆蓋多創作場景:影視、自媒體、廣告電商 全新的可靈O1集生成與編輯於一體,廣泛適用於影視、自媒體、廣告電商等多種場景。無論是從零構建的敘事生成,還是對既有素材的深度重塑,可靈O1都能根據不同需求,靈活呼叫其參考、編輯的能力,輕鬆完成創作。 在影視創作領域,可靈O1憑藉強大一致性的圖片(主體)參考,結合主體庫功能,可以精準鎖定每個分鏡的角色及服化道,輕鬆生成多個連貫的影視鏡頭。對於影片後期、自媒體創作者而言,只需輸入「刪除背景中的路人」、「讓天空變藍」等簡單對話指令,就能讓可靈O1自動完成畫素級的智慧修補與重構。 針對傳統線下廣告實拍成本高,製作週期長的問題,使用者現在只需上傳商品、模特和場景圖,輔以簡單指令,即可快速生成多個酷炫的商品展示廣告,大幅降低實拍成本。針對模特約拍麻煩與換裝難題,可靈O1可搭建永不落幕的虛擬T臺:上傳模特和服裝實拍圖,輸入指令,便能完美還原服飾的質感和細節,批次生產高品質的Lookbook影片。 可靈O1能實現上述強大而全面的功能,源於在技術底座的深層創新。全新的可靈影片O1模型打破影片模型在生成、編輯與理解上的功能割裂,構建了全新的生成式底座。透過融合多模態理解的Multimodal Transformer和多模態長上下文,實現了多工的深度融合與統一。

閱讀更多