Knowledge Base

閱讀站

首頁而家只顯示最近 50 篇文章,避免文章量愈大愈拖慢首頁載入。

共 2916 篇文章
完成

Hermes從毛坯房到精裝修攏共分幾步

將 Hermes 由毛坯房升級到精裝修:一套七步方案,令佢由臨時助手變成真正智能 Agent。

完成

不用學剪輯!這個 Skill 準備了 104 張鏡頭卡給 Agent 做視頻

唔使學剪輯,用 104 張鏡頭卡同 149 個音效,AI Agent 就幫你整到產品宣傳片

完成

普通人的第一個AI工作流5:AI總在同一個地方出錯?給工作流建立一份錯誤日誌

建立AI工作流錯誤日誌,將重複出錯變成可複用規則

完成

Seedance 2.5 發佈 我測出了更強大的用法...

SEEDANCE 2.5 / 產業場景實測一分鐘速覽 字節發佈 Seedance 2.5:單條 30 秒直出、一次吃 50 份素材、成片能只改一處。發佈當天排隊合作的是徐工、小鵬和三家機器人公司。 看完演示和測試完效果,多數人的第一反應是「人人都能拍電影了」。但是我發現了它的另外的用法 電網巡檢、危險實驗課、消防演練,機器人訓練這些你想不到的場景它其實都能派上大用場07 / 31 RELEASE這次迭代升級了四件事字節跳動正式發佈 Seedance 2.5:單條 30 秒直出、一次吃 50 份參考素材、成片能只改一處、10 餘種語言直接寫。這代升級把視頻生成從「能出片」推向了「能幹活」,而且要乾的遠不止影視... 15 秒 → 30 秒單條直出時長翻倍一段有起承轉合的完整敍事、一個完整的操作步驟,一條裝得下 15 → 50 份單次參考素材上限白模、綠幕、產品包裝這類企業已有資產直接當控制信號,配套有 Maya/Blender 插件 改一處 · 不重抽新增視頻局部編輯成片裏單獨改背景、改商品、改人物,其餘畫面原樣保留 10 餘種原生支持語言中文寫完直接生成,說明書視頻批量出多語言版本30 秒之外還能接着延長。最長可以延長到180秒支持兩次延長,Long Video 模式一次直出 30-180 秒,3 分鐘長片不用分段拼接而且輸入方式也跟着變了。提示詞額可以帶時間戳、帶素材編號:0 到 3 秒發生什麼、@圖2 對應誰,寫提示詞已經像在填一張分鏡表。上手的門檻降了,把話說清楚的門檻升了。實測指令 · 30 秒一鏡到底 【生成目標】生成一段寫實工業紀錄片風格的跟拍視頻。核心主體是一位30歲左右的中國女工程師,穿銀色隔熱服、戴透明防護面罩,面部清晰可見。主要事件是她在鋼鐵廠澆鑄車間完成一次巡檢。全程一鏡到底,跟拍長鏡頭,畫面以橙紅色鋼水火光為主光源。【階段一】開始時:女工程師背對鏡頭,沿車間通道向澆鑄區走去,遠處鋼水包正在向模具傾倒橙紅色鋼水,火花四濺。主要事件:她走到澆鑄區旁的操作枱前停下。結束時:她站定在操作枱前,側面對鏡頭,身後是持續傾倒的鋼水和飛濺的火花。【階段二】承接上一階段:她保持站在操作枱前的位置。主要事件:她抬起手中的紅外測温儀對準鋼水流測温,然後低頭在平板上記錄。結束時:她抬起頭,望向車間上方。【階段三】主要事件:鏡頭緩緩後拉並升高,展現整個澆鑄車間:多條澆鑄線同時作業,火花與蒸汽交織,她的身影立在通道中央。結束時:畫面定格在火光通明的車間大全景。【保持一致】保持女工程師的面部特徵、隔熱服和防護面罩全程一致;保持鋼水的橙紅色光源方向一致;保持車間空間佈局穩定。寫實風格,橙紅火光與冷色鋼結構對比,淺景深。<鋼水澆鑄的低沉轟鳴><火花的噼啪聲>。無人聲對白,無字幕,無背景音樂。一些案例 / CASES升級實際什麼樣這裏挑五幾t個對得上升級點的,一起看看效果。30 秒裝下一場完整的戲 29 秒一鏡到底的古裝江邊送別:提示詞把 0-29 秒拆成五個情緒階段,哪一秒垂眼、哪一秒落第一滴淚都寫在指令裏。成片一條鏡頭走完,人物沒變形,情緒按腳本遞進。29 秒情緒分鏡模塊 提示詞 · 中文【情緒與動作分鏡(0-29 秒遞進)】階段一 0-3 秒【追問】,不捨的等待。動作/表情:鏡頭聚焦她的臉,她直視鏡頭(望着對面的「他」),眼裏還沒有淚,是緩緩下沉的安靜。她看着他的臉,眉頭輕蹙、嘴唇微啓,輕聲問:「你真的要走嗎?」情緒解析:直視(她沒有哭訴,是等他親口確認一個她已猜到的答案);輕語(話音落下,彷彿還有很多話堵在喉嚨裏)。階段二 3-10 秒【認命】,把苦嚥下去。動作/表情:視線緩緩從他臉上移開,望向他身側的虛空;眼瞼低垂、睫毛交疊,嘴角浮起一個轉瞬即逝的淺笑,鼻翼輕張,做了一次極剋制的安靜吸氣,胸口輕輕起伏一次。情緒解析:那個笑是自嘲與認命的苦笑(「我早知道會這樣」);胸口的起伏像是把委屈和難過硬生生咽回肚子裏。階段三 11-17 秒【銘記】,最後一次刻進心裏。動作/表情:鏡頭緩緩推近(輕微變焦)。她把視線收回到他臉上,一寸寸緩慢仔細地看過他的眉眼。眼眶已經泛紅,卻倔強地忍着不讓淚掉下來。中間有 0.5 秒死寂的停頓,嘴唇動了動又抿住,下頜繃緊,喉頭輕輕吞嚥。情緒解析:此刻的注視已不只是道別,是要把這個人的樣子在生命裏最後刻一遍。階段四 18-23 秒【遺憾】,無聲的嘆息。動作/表情:她垂下眼,淚才開始掉。第一滴淚毫無預兆地直落,落在衣領上。她不擦、不啜泣,只是安靜任它滑落。再抬眼看他時,眼裏的情緒已經變了。緊蹙的眉頭緩緩鬆開,極輕微地搖了一下頭(微小到幾乎察覺不到)。情緒解析:抬眼時的變化,從想留住他變成深深的遺憾,像在說「我們本可以很好」,但沒說出口;眉頭鬆開象徵內心逐漸放下,那一下輕搖是對無奈命運本能的、最後的嘆息與否認。階段五 24-29 秒【放手】,釋然的成全。動作/表情:鏡頭推成極特寫。她努力擠出一個温柔的笑(很輕、很柔、不帶自嘲)。笑意剛到嘴角,第二滴淚從眼角滑過鼻側停在唇邊。她不哭出聲、不崩潰,只是含淚安靜看着他,用幾乎聽不見卻極力穩住的聲音說:「你走吧。」(說「走」字時聲音有極輕微的顫,但被她硬壓住哭腔。)說完笑容定在臉上,淚繼續滑落,目光始終沒有移開,仍望着鏡頭前的「他」。鏡頭最後停在她含淚微笑的臉上,眼裏盛滿深深的遺憾。情緒解析:這個笑和前面不同,很輕很軟,沒有自嘲,只有純粹的不捨與極致的温柔。她沒有崩潰,用極致的剋制完成了最後的放手與成全。29 秒一鏡到底,古裝女子江邊送別延長套娃:12 秒開場一路接到空中開戰 先出 12 秒開場,把成片當 @視頻1 喂回去延 5 秒,再把結果喂回去延 13 秒。三段連起來,人物、場景、機位全程連貫,這就是「高保真延長」在官方案例裏的樣子。EXTEND 12s → +5s → +13s 12s開場+5s龍出水+13s空中開戰 第一次延長(+5 秒) 提示詞 · 中文參考 @視頻1 的內容,延長視頻 5 秒:龍從水裏出來對着三人怒號,發出扭曲空間的聲波,三人急忙抬手結出光盾防禦,龍的造型參考 @圖1。第二次延長(+13 秒) 提示詞 · 中文參考 @視頻1 的內容,延長視頻 13 秒。三人的光盾因承受不住怒號逐漸碎裂,隨後被震飛後退。切鏡:@圖1 的角色仍在中間,被擊退一段距離後半跪剎停,拔出背後武器向前衝鋒;@圖2 的兩個主體對視一眼也掏出武器衝出。切鏡:全景、三人背影視角,向龍衝刺一段距離後高高躍起與龍開戰,打鬥中要有火光粒子和閃電粒子特效,龍的造型參考 @圖3。結尾以三人再次被擊退的全景收束。微信內容視頻插入有限,三段成片和整套延長案例,文末的 Seedance 2.5手冊解讀裏都能看。180 秒一次直出:一條提示詞生成三分鐘完整短片 30 秒和延長之外,即夢端還有長視頻模式:單次直出最長 180 秒。官方案例《第十三個名字》是一條 3 分鐘的校園怪談,12 個角色全程用時間戳推進,0:00 到 3:00 每一段發生什麼全寫在同一條提示詞裏;3 分鐘跨度裏角色特徵、服裝細節和場景建築首尾一致。官方提示詞 · 180 秒校園怪談《第十三個名字》 提示詞 · 中文0:00-0:13,鏡頭從落滿雨珠的玻璃特寫緩緩拉開,露出濃霧籠罩的老中學校門,墨綠苔蘚爬滿深灰圍牆。@圖1 撐黑傘入畫,白襯衫前掛着鬆垮的領帶,書包壓着肩線,他抬眼望向灰濛濛的教學樓,平靜眼底閃過一絲不安。帶電流雜音的校園廣播緩緩響起:「歡迎,十二位新同學。」空曠校園裏只剩雨聲、廣播的嗡鳴迴響和遠處悶雷。0:13-0:30,鏡頭平滑推進教學樓,穿過走廊停在教室前門,切教室全景。老舊日光燈在頭頂嗡鳴,雨水沿窗玻璃蜿蜒而下,十二套桌椅整齊排列,十一名學生已就座:@圖2 坐前排回頭望向門口,對剛進門的 @圖1 露出温和又略帶神秘的笑;@圖3 扶了扶眼鏡低頭在筆記本上不停記錄,神情嚴肅認真;@圖4 抱臂靠在椅背上,身形高大挺拔,沉默望向窗外;@圖5 趴在桌上,脖子掛着相機,指尖撥着相機帶,眼裏滿是好奇;@圖6 端坐座位,左臂的學生會袖標很顯眼,神色沉穩;@圖7 捧着一本封皮磨損的都市傳說,翻頁時眼睛發亮;@圖8 雙手緊攥胸前書包帶,雙馬尾垂肩,眼神怯怯地掃視四周;@圖9 校服外套敞着,耳釘在燈下反光,靠在椅子裏一臉不耐煩。@圖1 走到最後一排空位坐下,指尖輕輕抹過桌面的濕水漬。0:30-0:42,@圖10 抱着點名冊走上講台,黑長髮垂在職業套裝肩頭,神情温和。她扶了扶鏡框,翻開點名冊按序點名,每念一個名字都有清晰的應答,鏡頭隨點名節奏依次掃過台下學生。點完第十二個名字後,@圖10 的指尖突然停在紙頁上,頓了兩秒、眉頭微蹙,下意識念出了第十三個名字。教室瞬間死寂,無人應答,只有窗外雨聲變得格外清晰。@圖10 隨即合上點名冊,語氣自然得彷彿剛才的停頓從未發生:「好了,大家先自習。」0:42-0:50,鏡頭推近 @圖1 的臉部特寫,他皺眉,目光掃過全班逐個數人,數完後滿臉疑惑。鏡頭從他身後緩緩拉遠掃過整間教室,後排陰影裏一個纖細白色身影一閃而過,快得像雨幕造成的錯覺,第一幕的懸念落在這裏。0:50-1:12,課間走廊浸在冷調天光裏,雨還在下。@圖5 舉起相機取景校園,連按幾次快門後低頭回看,眉頭越皺越緊,每張照片角落都站着一個模糊的白衣身影。她拉住路過的 @圖3 把相機遞到他眼前,@圖3 扶了扶眼鏡仔細看了半天,搖頭說什麼都沒有。旁邊的 @圖9 嗤笑着湊過來瞥了一眼,嘲諷她眼花。@圖5 攥緊相機,再抬頭看向照片對應的走廊盡頭,那裏空無一人,只有風裹着雨絲吹過,後背竄起一陣寒意。1:12-1:35,校史儲藏室裏灰塵在斜光中漂浮。@圖7 蹲在舊書堆積的櫃前翻找,指尖碰到一本封皮燒焦的學生名冊,封面印着四十年前的日期。他興奮地翻開,裏面是當年校園火災的罹難學生名單,十二個名字逐一映入眼簾,他的笑容慢慢僵在臉上,名單上的名字和現在班裏十二個同學的名字完全重合。@圖6 恰好推門進來找資料,見狀走過去翻看檔案,沉穩的臉上也浮現凝重,指尖輕叩焦黑封皮,陷入沉默。1:35-1:52,入夜,教學樓走廊陷入漆黑,只有手電光束在牆上來回晃動。穿藍色工裝的 @圖11 提着手電緩慢巡邏,鞋底踩在地板上發出沉悶聲響。走到這個班教室門口時他突然停住,門內傳來模糊人聲和桌椅挪動聲。他皺眉擰動把手推開門,教室空無一人,只有黑板正中用白粉筆寫着四個大字「歡迎回來」,粉筆灰還在空氣裏輕輕飄。留在教室訓練的 @圖4 聞聲趕來,站在門口看着黑板上的字,手臂肌肉驟然繃緊。1:52-2:10,切回晚自習教室,頭頂燈管滋滋作響、忽明忽暗。@圖8 突然趴在桌上低聲啜泣,肩膀不停發抖。@圖2 立刻起身走到她身邊輕拍後背安撫。@圖8 抽噎着開口,聲音發顫:「每天放學……都有個女生跟着我,走得很慢,一路跟到宿舍樓下,一回頭她就不見了。」教室瞬間安靜,@圖9 皺眉低聲抱怨,@圖3 和 @圖6 交換了一個眼神,壓抑的不安在十二人之間慢慢蔓延。2:10-2:35,@圖1 坐在座位上,指尖捏着新發的班級合影。他反覆數了三遍,照片裏始終是十二個人,但強烈的違和感揮之不去。他揉着脹痛的太陽穴無意間閉上眼,合影畫面卻清晰浮現在腦海,人羣正中間的空位上,站着一個白色長髮的女生,安靜地望着鏡頭。@圖1 猛地睜眼,照片裏依舊只有十二張熟悉的臉。他反覆試了幾次,每次閉眼都能清楚看到那個身影。他喃喃自語,帶着難以察覺的顫抖:「只有閉上眼……才能看見。」2:35-2:47,教室日光燈開始瘋狂閃爍,明暗交替間,一個白色身影緩緩浮現在人羣中央。@圖12 赤足立在課桌之間,白色長髮垂在白裙襬上,紅色眼瞳平靜無波,嘴角帶着極淡的笑。所有人停下動作,教室裏只剩燈管的電流聲。@圖12 輕聲開口,聲音輕得像雨絲落在耳邊:「終於……有人記得我了。」2:47-3:00,話音落下的瞬間,教室裏十二個人緩緩轉動脖頸,動作整齊得像被無形絲線牽引,一起直直望向鏡頭方向,臉上沒有任何多餘表情。鏡頭猛然向前急推,畫面瞬間切至純黑。伴隨一聲遙遠輕微的上課鈴,全片結束。180 秒一次直出的校園怪談《第十三個名字》。局部編輯:一句話把鯨魚換成白龍 原片是棉花糖雲層裏的飛天鯨魚。一句指令把主體換成白龍,順手去掉背景音樂,雲層、運鏡和其餘畫面全部不動。手冊裏還有更細的圈選玩法:在畫面上框住一隻羊,指定第 7-15 秒把它換成棕馬,其餘時間原樣。官方提示詞 · 鯨魚改白龍 提示詞 · 中文在整體視頻的 0-8 秒,全部修改。把視頻中的鯨魚修改為一條白龍。去掉 BGM。改前改後的對照片白模渲染:灰模喂進去,成片按圖紙出來 上下分屏的健身動作白模喂進去,兩個角色各持啞鈴、正確與錯誤動作分屏對照,全按提示詞渲染到位;同一份白模餵給上一代則偏差明顯,白模原片和兩代對照在手冊解讀裏可看。這一組是「企業已有 3D 資產直接當控制信號」的實證。提示詞 · 健身對比科普(白模渲染) 官方提示詞 · 中文生成一支豎版(9:16)健身動作對比科普視頻,採用上下分屏對比版式,嚴格保留白模視頻裏「正確動作」和「錯誤動作」兩組動作序列。渲染 @視頻1:畫面上半部分角色參考 @圖2 的美女 B,執行視頻中的錯誤動作,手持 @圖4 的啞鈴;下半部分角色參考 @圖1 的美女 A,執行視頻中的正確標準動作,手持 @圖3 的啞鈴。兩位人物的外貌、身材、服裝分別嚴格對應 @圖2 和 @圖1,不混臉、不互換動作,各自身份貫穿全程。動作嚴格跟隨視頻模板,錯誤與標準的差異清晰可辨,肢體連貫不變形,啞鈴始終握在手中、形態一致、不穿模不漂移。場景統一為 @圖5 的健身房環境,上下屏光線與場景風格一致。豎屏構圖、人物居中、動作完整入畫,以正面中景為主,可向發力部位緩慢推近。上下分屏邊界清晰,整體專業健身科普質感,對比清晰,人物、啞鈴與場景自然融合、光照統一。產業應用 / THE TURN不僅是「人人都能拍電影了」...看完這些案例,多數人的第一反應是「人人都能拍電影了」但是我從字節Seedance 2.5發佈當天的合作名單裏,發現了這些企業:徐工集團、小鵬汽車、靈初智能、微分智飛、穹徹智能。五家裏有重型機械製造商,有車企,有三家做機器人的。沒有一家影視公司...內容提效省製作成本 徐工集團小鵬汽車數據生成造訓練數據 穹徹智能微分智飛靈初智能他們用Seedance 來幹嘛? 徐工拿它生成工業操作培訓和工序 SOP 視頻,30 秒直出正好裝得下一個完整的操作步驟,以前這類視頻要麼實拍要麼做 3D 動畫,都不便宜。小鵬把 Seedance 接進了內部一站式 AI 設計平台 Vision-X,車型設計參考、設計測試、用戶說明書視頻都在上面跑。注意,是產品設計團隊在用,不是市場部。這兩個場景省的是實拍和動畫的製作成本,邏輯好理解。真正跳出內容生產邏輯的,是那三家機器人公司。穹徹智能:給機器人造訓練數據 穹徹做具身智能,就是讓機器人學會在真實環境裏操作物體。訓練這種模型,最難的是數據,傳統方式兩條路,都又慢又貴:真實機器人實採 一個場景一個場景地採集 慢、貴 場景覆蓋永遠不夠仿真環境建模 人力把資產、物理規律逐一嵌入 建完一個場景才能基於它迭代 也慢、也貴視頻生成 場景自動生成,免人力建模 光照、背景、紋理批量變體 數據天然帶多樣性穹徹用 Seedance 生成訓練數據,所有場景自動生成,關鍵變量批量調整。更重要的是,這樣生成的數據不依賴特定機器人型號:穹徹拿它給不同機型生成適配的操作數據,提升模型跨機器人的通用性。同方向的靈初智能,也已經在具身智能上推進應用探索。微分智飛:飛行機器人的數據集 微分智飛在飛行具身領域做了類似的事,難度更高。飛行場景的數據採集比地面機器人貴得多,飛一次摔一次都是錢,而且障礙物閃避、室內尋路、複雜鏡頭運動下的視角模擬這些高難度場景,根本沒法安全地實拍。微分智飛用 Seedance 打造了一套標準化的高難度數據集生成流程,覆蓋障礙物閃避、室內自主尋路、智能目標鎖定等場景。實測 / ROBOT ARM能不能生成機器人訓練素材,質量如何我自己上手驗證了一遍,看看到底能不能在生產和機器人訓練中用到...素材是一段現成的機械臂實拍:8 秒,雙機械臂在白色桌面上操作吐司和烤麪包機,背景是實驗室。我把它拆成四條編輯指令分別跑:環境換成火星基地、只換抓取對象(白吐司改全麥吐司)、更改操作桌面和操作環境為家庭廚房和操作車間,其他不變。每一條都要求機械臂的每個動作、每個時間點原樣保留。這樣你可以為機器人生成各種訓練數據缺的場景素材和數據。實測指令 · 背景替換成火星荒漠(官方五段式:一次只改一件事) 【編輯目標】編輯@視頻1,只把背景環境替換為火星荒漠。【原視頻職責】@視頻1是唯一編輯母版,負責機械臂的外觀、運動軌跡、桌面、桌上物體、機位、鏡頭和事件順序。【編輯對象與範圍】只把桌面以外的背景替換為火星荒漠:橙紅色天空、遠處環形山、地表紅色沙土。背景從第一幀到最後一幀持續存在,全片只有背景這一處修改。【保持內容】保持@視頻1中兩台機械臂的每個動作和時間點、桌面、桌上所有物體、機位和構圖不變。為機器人生成各種訓練數據缺的場景素材和數據機器人訓練大家都知道,訓練數據貴的地方從來在「場景覆蓋」:同一個抓取動作,換個光照、換個桌面、換個背景,模型的表現就不一樣。以前要麼搭一百個場景去實拍,要麼在仿真環境裏逐個建模。現在,一條母版視頻加幾條編輯指令,就是幾十個訓練樣本。ONE MASTER → N VARIANTSMASTER機械臂實拍母版 · 8 秒動作與時間點全程不變4 條編輯指令火星基地廚房客廳操作間換全麥吐司一條母版 + 幾條編輯指令 = 一批環境變體訓練樣本(動作全程不變)。示意圖。這就從「視頻創作工具」的邏輯,走到了「產業工具」的邏輯。名單上那三家機器人公司排隊的原因,就在這裏。實測 / 3 DIRECTIONS還能有哪些應用自動駕駛:極端工況數據 自動駕駛訓練的大瓶頸之一是極端場景數據太少。暴雨、大霧、降雪、強光反射這些天氣,加上行人突然橫穿、前車緊急變道這些 corner case(極小概率但必須處理的邊緣情況),真實道路上要麼等不到,要麼等到了也來不及採集。測試是一條編輯鏈:先生成一段正常路況的行車記錄儀母版,然後每步只改一件事,先放一輛側翻貨車,再給它點上火,再把天氣換成暴雨。一條幹淨母版,能編輯出一整個事故庫。EDIT CHAIN 每步只改一件事STEP 1正常路況母版↓STEP 2放一輛側翻貨車↓STEP 3給它點上火↓STEP 4天氣換成暴雨實測指令 · 第一步:先生成路況母版視頻 行車記錄儀第一人稱視角,鏡頭固定在擋風玻璃後,輕微廣角。白天晴朗,城市雙向四車道,本車沿中間車道勻速直行,前方兩輛轎車保持車距行駛,右側人行道有行人正常行走,前方路口綠燈通過。畫面穩定,寫實風格。無字幕,無背景音樂。實測指令 · 第二步:加入側翻事故現場(火與天氣是第三、四步) @視頻1是唯一編輯母版,負責本車的行駛軌跡、速度、道路結構、鏡頭和其餘車輛。 【編輯對象與範圍】 更換右前方轎車為貨車:視頻開始3秒後貨車突然從側後衝出撞上中間車道的轎車翻橫在路面上,車廂着地,幾隻貨箱散落在車道上,轎車被撞起火,冒煙四起,阻塞路面。本車輛緊急剎車,天空突然變陰天開始下雨 【保持內容】 保持@視頻1的光線、車道線、道路結構、其他車輛不變。工業安全:違規行為數據合成 工業現場的安全監控算法需要大量違規操作視頻做標註和訓練,但真實的違規數據要麼量不夠(總不能故意讓人違規),要麼涉及隱私和安全責任。合成路線可以控制違規類型、場景變量和嚴重程度,批量出樣本。測試思路:FPV 穿越機視角一鏡飛過整個車間,沿途自然出現三處違規細節,給檢測算法當「考題」;檢測框和標籤是算法的輸出,後期疊上去就行,不讓模型畫。測試踩坑測試裏還踩出一個值得記的坑:寫「未戴安全帽的工人」,模型多半還是給他戴上,否定詞對畫面元素不管用,得換成肯定描述:寫他「光着頭、黑色短髮清晰可見」,再讓周圍人全戴黃帽形成對比。實測指令 · FPV 穿越車間(違規寫成肯定描述,框和標籤後期疊) 【階段一】FPV 穿越機第一人稱視角,一鏡到底,快速平穩地飛過一座大型電子廠車間:先掠過流水線上方,再側身穿過兩排機櫃之間的通道,最後越過裝配工位區。車間裏的工人都穿藍色工裝、戴黃色安全帽作業。 【階段二】 飛行途中,無人機飛行速度變慢,畫面以科技感 HUD 風格依次彈出三個紅色檢測框並短暫放慢,檢測三個目標: 目標1: 其中一名工人光着頭作業未佩戴黃色安全帽,黑色短髮在燈光下清晰可見,和周圍戴黃色安全帽的工人形成對比(紅框鎖定未戴安全帽頭部,彈出「未佩戴安全帽」標籤) 目標2: 還有一名工人跨出黃色安全線操作(紅框鎖定腳下,彈出「越線作業」標籤) 目標3: 最後一處物料,其中一部分堆放超過警戒線(紅框鎖定料堆,彈出「堆放超高」標籤)。其餘工人正常作業,畫面冷色調工業風,檢測框和標籤為亮紅色描邊。<無人機高速飛行的風聲>。實測 / 3 STEPS OUT再往外推三步:電網、課堂、SOP培訓視頻測完官方點過的方向,我自己再往外推三步,挑的都是「拍不了或拍不起」的行業。行業地圖 已落地 小互實測 待驗證 工業培訓 SOP 車企設計可視化 具身智能數據 飛行機器人數據 機械臂環境變體 自動駕駛極端工況 多語言視頻說明書 工業違規數據合成 電網巡檢缺陷樣本 危險實驗教學 消防疏散演練 農機培訓 · 航空教培 · 化工推演 · 事故覆盤電網巡檢:缺陷樣本天然稀缺 巡檢算法靠缺陷樣本訓練,但絕緣子破損、橫擔上的鳥巢、冬季覆冰全是小概率事件,真樣本攢不出規模,巡檢算法卻偏偏靠它們才能學會報警。最難得的是故障瞬間:雷暴夜絕緣子閃絡(電弧沿絕緣子表面放電擊穿)的畫面,巡檢員一輩子未必拍到一次。測試兩條路:白天巡檢母版編輯出破損、鳥巢、覆冰三個缺陷變體,再直接生成一條雷暴閃絡的故障瞬間。實測指令 · 雨霧天巡檢發現三處缺陷(官方長視頻模板:一階段一處缺陷)【生成目標】生成一段無人機在雨霧天氣下對高壓輸電鐵塔進行巡檢的視頻。核心主體是一基高壓輸電鐵塔及其線路設備,主要事件是無人機沿鐵塔從下到上、從左到右巡檢,依次發現三處設備異常。【環境設定】雨霧天氣,灰白色低雲層,細密雨絲持續飄落。遠處丘陵和相鄰鐵塔被薄霧遮蔽,能見度約200米。鐵塔金屬表面附有水膜,反光增強。絕緣子和導線表面掛有雨滴。整體色調偏冷灰,對比度低於晴天。【階段一:發現金具鏽蝕】開始時:無人機從鐵塔中部起飛視角開始,鏡頭緩慢上移至塔頂橫擔左側。雨絲從畫面上方飄入。主要事件:鏡頭推近左側導線懸掛點的連接金具,金具表面覆蓋深褐色鐵鏽,局部鏽蝕剝落露出粗糙底層金屬,螺栓處鏽蝕尤為嚴重,雨水沿鏽蝕紋理流淌。結束時:金具鏽蝕細節清晰呈現在畫面中央。【階段二:發現絕緣子破損】承接上一階段:雨霧天氣、鐵塔位置和無人機高度保持不變。主要事件:鏡頭從鏽蝕金具緩慢下移至左側絕緣子串。從上往下數第三片絕緣子傘裙邊緣有一條明顯裂紋,裂紋處缺失一小塊碎片,露出內部白色瓷質,破損邊緣顏色深於完好表面。雨水沿裂紋滲入。結束時:破損絕緣子與相鄰完好絕緣子形成對比,清晰呈現在畫面中。【階段三:發現導線異物】主要事件:鏡頭從絕緣子串緩慢向右平移,沿導線方向巡視。在左側導線中段,一條深色塑料薄膜纏繞在導線上,向下垂掛約半米,被雨中的風吹動輕微擺動。薄膜表面沾有水滴。鏡頭在異物處短暫停留後繼續向右緩慢移動,畫面中遠處霧氣瀰漫的相鄰鐵塔逐漸顯現。結束時:畫面呈現導線、垂掛異物和遠處霧中鐵塔的全景。【保持一致】保持鐵塔的金屬結構、導線走向、雨霧天氣、冷灰色調和無人機航拍視角穩定。鏡頭運動全程平穩緩慢,模擬真實巡檢無人機的飛行速度。保留無人機螺旋槳嗡鳴聲、雨滴打在金屬塔身上的細碎聲、高空風聲和導線在風中的低頻振動聲。不要音樂和配音危險實驗課:學校不敢做的實驗,按教案生成 鈉遇水、粉塵爆炸這類演示,學校和實驗室要麼不敢做、要麼做不了全尺寸的,以前只能口述或看老錄像。現在按教案寫一條提示詞直接生成:粉塵爆炸的火球在高速慢鏡頭裏翻滾膨脹,警示字幕後期壓上就是一條安全課素材;配上多語言能力,教學視頻出海也是順手的事。實測指令 · 粉塵爆炸高速慢鏡頭 安全科普演示視頻,實驗室固定機位特寫。畫面中央是一個密閉的透明演示箱,箱內懸浮着均勻的白色麪粉粉塵雲。第2秒左右,箱內電極閃出一點電火花,粉塵雲瞬間被引燃:一團橙紅色火球從中心膨脹開,以慢鏡頭展現火焰翻滾的細節,火球充滿整個演示箱,觀察窗被火光映紅,隨後火焰熄滅,箱內只剩飄散的餘煙。全片只有這一次爆燃。寫實風格,高速攝影慢鏡頭質感。<沉悶的爆燃聲>。無字幕,無背景音樂。實測指令 · 中學化學實驗鈉遇水反應視頻中學化學實驗演示視頻,實驗室特寫鏡頭。一隻戴白色手套的手用鑷子夾起一小塊銀白色金屬鈉,放入盛有清水的大玻璃水槽中。金屬鈉立刻在水面劇烈反應:快速遊動、旋轉、熔成閃亮小球,冒出白煙並竄起淡黃色火苗,水面泛起漣漪。鏡頭保持固定特寫,反應全程清晰可見。畫面下方出現字幕【鈉遇水劇烈反應,產生氫氣並放熱,嚴禁徒手接觸】。寫實風格,實驗室冷白燈光。<劇烈的嘶嘶聲和輕微爆鳴聲>。連鎖餐飲:一套 SOP 拍一次就夠了 連鎖品牌最頭疼的培訓素材問題不是"拍不好",是"拍不完"。洗手消毒、操作枱清潔、食材儲存,每條 SOP 的動作流程全國統一,但每開一家新店就得重拍一版,因為後廚長得不一樣。日本門店是木質暖光裝修,東南亞門店是瓷磚冷光,國內門店又是另一套風格。同一個洗手流程,拍了十幾遍,動作完全一樣,就是背景不同。更麻煩的是語言。同一條視頻要出中文版、英文版、日語版,每個版本單獨配音、校對、剪輯。一條 30 秒的洗手視頻,乘以 8 個市場,就是 8 條獨立的製作任務。測試思路:先生成一條標準洗手流程視頻作為母版,再用局部編輯換後廚環境,最後疊加多語言配音。一條母版變出所有門店版本。實測指令 · 洗手消毒 SOP 母版(30秒完整流程)| 【生成目標】生成一段日本連鎖餐飲員工洗手消毒標準操作流程的培訓視頻。核心主體是一名穿白色廚師服、戴一次性手套和髮網的員工,主要事件是完成七步洗手法的完整流程。【階段一 · 配電間監控機位】開始時:不鏽鋼水槽區域,牆面貼有洗手步驟提示牌。員工站在水槽前,雙手自然下垂。主要事件:員工打開水龍頭,雙手在流水下淋濕,取一泵洗手液塗抹在掌心。結束時:水龍頭保持開啓,雙手覆滿泡沫。【階段二 · 走廊監控機位】承接上一階段:員工的服裝和水槽位置保持不變,泡沫仍在雙手上。主要事件:員工按七步洗手法依次搓洗:掌心對搓、手指交叉搓洗手背、指縫交叉搓洗、彎曲指關節旋轉搓洗、拇指旋轉搓洗、指尖在掌心旋轉搓洗、手腕旋轉搓洗。每個步驟停留約2秒。結束時:雙手仍在流水下方,泡沫被衝淨。【階段三 · 出口監控機位】主要事件:員工關閉水龍頭,從壁掛紙巾盒中抽取紙巾擦乾雙手,將紙巾丟入腳踏式垃圾桶,最後從牆面消毒液按壓瓶中取一泵消毒液均勻塗抹雙手。結束時:員工雙手自然展開面向鏡頭,手部乾淨且塗有消毒液。 【保持一致】保持員工的白色廚師服、髮網、水槽區域不鏽鋼牆面、頂部白色日光燈照明和固定中景正面機位穩定。保留水流聲、洗手液按壓聲、紙巾抽取聲、垃圾桶腳踏聲。【添加日語旁白配音】配音語言:標準日語。配音風格:平穩、清晰、節奏適中的培訓視頻語氣。旁白在每個洗手步驟開始時簡短提示該步驟名稱和要點。 台詞語言:標準日語。女性解說員用清晰自然的標準日語說: 階段一:{手を水で濡らし、ハンドソープを取ります} 階段二:{七つのステップで丁寧に洗います} 階段三:{ペーパータオルで拭き、消毒液を塗布します}結論 / CONCLUSION結論:不僅僅是大模型能進生產線 視頻模型也可以視頻生成模型走到今天,已經不單單是用來進行進行視頻生成和製作。更值得關注的變化是:它開始嵌進具體的業務流程,接手以前靠實拍、靠建模、靠人工才能完成的環節。同時它還能用來產生新的數據和原料來反哺其他行業的訓練和發展。視頻生成模型正在從創意工具走向生產力工具。隨着它對物理規律的理解越來越強,應用邊界會繼續擴大:不只服務內容產業,也可能成為具身智能、機器人仿真、自動駕駛場景生成、工業設計驗證等領域的重要基礎能力。 王帥 · 香港科技大學計算機科學與工程系副教授Seedance 2.5 的四個升級點,單獨看是功能迭代;放進產業場景看,解決的是批量生產、快速適配、數據擴充這些具體問題。它還遠遠談不上替代傳統生產流程。但作為流程裏的一個標準化工具插進去,從測試和展示的案例來看,已經開始跑通了,對實際生產和其他原本無關的行業也啓動了促進作用。MORE / 站內延伸閲讀Seedance 2.5 官方用戶手冊:手把手教你做電影級 AI 視頻,公式和案例全能抄參數、界面、七類場景提示詞公式帶全部案例,16 個亮點功能全配官方演示。點擊 閲讀原文 ↓字節官方 Seedance 2.5 提示詞指南:從一句話公式到 30 秒長片,模板全可直接抄素材調度、長片分段、改片延長,每類任務的官方推薦寫法與模板。閲讀 → 16000字超詳細 Seedance 2.5 官方提示詞指南及提示詞模板

完成

大廠內部用了8年的設計系統,終於開源了

Meta 內部用了8年的設計系統 Astryx 開源,主打完全可自訂、人機共用

完成

絕了,這個Codex的高階用法,直接讓我一拖三,管好幾個“員工”,不會還有人不知道吧?

Codex 高階玩法:用一個主會話管理多個獨立會話,變身 CEO 一拖三

完成

我把自己丟到AI裏面,“以身試毒”,深度給大家剖析Seedance2.5的技法!

Seedance2.5實測:AI編輯+AI動畫兩大升級,附完整綠幕合成提示詞

完成

開源信息採集工具 MediaCrawler:一套命令獲取小紅書、抖音、B站等 7 個平台

大家好,我是 Immerse專注分享 AI 玩法、獨立開發與AI 出海的 AGI 實踐者,更多幹貨歡迎關注公眾號 #沉浸式AI 或訪問 yaolifeng.comMediaCrawler 把小紅書、抖音、快手、B 站、微博、貼吧和知乎的公開信息採集放進了同一個項目。它支持關鍵詞搜索、指定內容、評論與二級評論、創作者主頁等模式,數據可以保存為 CSV、JSON、JSONL、Excel、SQLite 或 MySQL。項目基於 Playwright 管理瀏覽器登錄態,並在保留登錄狀態的瀏覽器環境中獲取請求需要的參數。下面用 uv 和 Chrome CDP 跑通一個最小的小紅書關鍵詞采集流程,再補充詳情模式、WebUI 和常見問題。開始前要保留項目原本的邊界:所有內容只用於學習和研究,禁止商業用途、大規模採集、非法使用或侵犯他人合法權益。實際操作還要遵守目標平台規則、適用法律和數據授權範圍。項目地址:NanmiCoder/MediaCrawler準備運行環境素材當前給出的要求是 Node.js 16 或更高版本、最新版 Chrome 144 或更高版本,以及 uv。安裝完成後,用下面兩條命令檢查環境:uv --versionnode --version兩條命令都應該輸出版本號。默認的 CDP 模式會連接電腦上已有的 Chrome,不需要額外安裝 Playwright 瀏覽器驅動。在 Chrome 地址欄打開 chrome://inspect/#remote-debugging,勾選 Allow remote debugging for this browser instance。頁面出現下面這行內容,說明遠程調試已經就緒:Server running at: 127.0.0.1:9222運行採集程序後,Chrome 可能彈出確認對話框,需要在 60 秒內點擊接受。沒有看到 127.0.0.1:9222 時,不要急着運行主程序,先把遠程調試狀態處理好。安裝項目依賴把倉庫下載到本地後,在終端執行:git clone https://github.com/NanmiCoder/MediaCrawler.gitcd MediaCrawleruv syncuv sync 會按照項目配置同步 Python 版本與依賴。命令正常結束、沒有依賴解析錯誤,就可以進入配置步驟。想改用標準 Playwright 模式,可以在 config/base_config.py 中設置:ENABLE_CDP_MODE = False這種模式還要安裝瀏覽器驅動:uv run playwright install跑通關鍵詞采集打開 config/base_config.py,按照文件裏的中文註釋設置關鍵詞、數據保存方式和採集範圍。建議只填少量、明確授權的測試內容,不要一開始就擴大數量。保存配置後執行:uv run main.py --platform xhs --lt qrcode --type searchxhs 表示小紅書,qrcode 表示二維碼登錄,search 表示從配置文件讀取關鍵詞並採集匹配內容。程序顯示二維碼後,用對應 App 掃碼完成登錄。登錄成功後,終端會繼續輸出運行日誌。確認沒有登錄或依賴錯誤,並在配置的數據保存目標中看到內容與評論記錄,才算最小流程跑通;只看到程序啓動不算完成驗證。改成指定內容採集已經有明確的帖子 ID 時,在 config/base_config.py 填寫對應列表,把命令末尾改為 detail:uv run main.py --platform xhs --lt qrcode --type detail項目默認沒有開啓評論採集。確實需要評論並且具備合法授權時,把配置項改為:ENABLE_GET_COMMENTS = True其他平台的參數以程序幫助為準:uv run main.py --help不要照搬小紅書參數去猜其他平台。先從幫助信息確認平台標識、登錄方式和採集類型,再做小範圍驗證。用 WebUI 管理參數不想一直改配置文件,可以同時啓動 API 和前端開發服務器:# 終端 1uv run uvicorn api.main:app --port 8080 --reload# 終端 2cd webuinpm installnpm run dev瀏覽器訪問 http://localhost:5173/,可以可視化設置平台、登錄方式和採集類型,並查看運行狀態、日誌、數據預覽與導出。MediaCrawler WebUI 界面頁面首次打開會調用 /api/env/check 檢測環境。檢測失敗時,先確認 8080 端口的 API 服務正在運行;“跳過檢測”只能臨時進入界面,不能修復缺失的後端或依賴。想讓 API 服務直接提供 WebUI 靜態資源,需要構建前端:cd webuinpm installnpm run buildcd ..uv run uvicorn api.main:app --port 8080 --reload構建產物會寫入 api/webui/,服務啓動後訪問 http://localhost:8080。幾個容易卡住的地方CDP 模式連接失敗時,檢查 Chrome 版本、遠程調試開關和 127.0.0.1:9222,也要留意運行後出現的確認對話框。標準 Playwright 模式報瀏覽器缺失時,執行 uv run playwright install。這條命令在默認 CDP 模式下不是必需步驟。原生 venv 方案依賴 Python 與 requirements.txt 的兼容性,素材使用 Python 3.11,並明確把該方案標為不推薦。沒有特殊原因時,優先使用 uv sync。採集結果為空時,按登錄狀態、關鍵詞或 ID 配置、平台參數、評論開關和保存方式逐項檢查。任何模式都應先用少量授權數據驗證,確認輸出結構符合預期,再決定是否繼續。

完成

從零開始,教你用Codex搓出屬於你自己的第一個硬件。

用Codex由零開始整硬件:一個小白嘅貓爪製作實錄

完成

開源!68個品牌設計規範文檔(HTML+DESIGN md + Token )

開源品牌設計參考庫 brands-design-md:將 68 個品牌的視覺語言拆成 7 類文件,人睇風格、AI 讀規則。

完成

別再AI焦慮了!所有智能體都是一種軟件,Codex、Claude Code、WorkBuddy 怎麼選?

所有智能體本質上都係軟件,與其追新不如先搭好自己嘅工作流同數據資產

完成

Cloudflare 新工具 Drop:不註冊、不登錄,2步就能部署靜態網站

Cloudflare Drop 係一個唔使註冊、拖入文件夾就有臨時網站嘅工具,認領後仲可以接入成個 Cloudflare 生態。

完成

別讓 AI 把產品做醜了:Vibe Coding必看的 3個審美網站

Vibe Coding 怕整得醜?用呢 3 個免費網站:Recent Design、Mobbin、React Bits,由整體風格到細節動效照住做!

完成

MiniMax H3發佈,還要開源,AI視頻終於有了自己的後期之王。

今天,被Seedance 2.0壓制了整整半年,沉寂了很久的AI視頻模型行業,終於又有了點新的動向了。MiniMax,終於掏出了他們的H3模型。並且,要開源。AI視頻,終於也開始向大模型領域看齊了。過去這半年,AI視頻行業活得很奇怪。視頻Agent應用瘋狂增長,但是模型卻寥寥無幾。最後繞不開的那個名字,依然是Seedance 2.0。它就像那一堵最高的山。以至於過去半年,AI視頻行業最大的懸念,逐漸變成了:到底還有沒有人,能給Seedance 2.0一點壓力?現在,MiniMax終於帶着他們的AI視頻模型來了。我在昨天其實就已經拿到了體驗資格,在做了一些測試之後,我非常坦率的講,在很多的環節上,它確實可以跟Seedance 2.0相媲美,但是還沒有達到所謂的全面超越的地步。但H3找到了一個非常獨特、非常有意思、而且我覺得極其商業的切口,那就是:視覺包裝和後期特效。這個點,MiniMax實在是太強太強了,這塊的長板強到比Seedance 2.0都要強很多。我直接放幾個case你就懂了。H3這個模型非常的獨特。獨特到一時我不知道該用什麼詞去形容它。你可以讓它直接生成一段帶歌詞的動態MV。你也可以給它幾張平面海報,它可以把排版、文字和視覺元素全部動起來,做成一支動態海報。你也可以給它一堆照片,它能理解每張照片裏的內容,自動做成有裝飾、有節奏、有聲音的Vlog。你甚至可以讓它直接生成電影片頭、歌詞VJ、時尚品牌Campaign、遊戲UI、網頁滾動動效和產品發佈片。只要涉及到一切跟視覺包裝相關的工作,它乾的都極佳。如果說,Seedance更偏向與前期,更重影視和特效,那H3我覺得,就更偏向後期,更重廣告與動效。兩者相輔相成,終於補全了整個視頻製作的全流程。網址在此:https://hailuoai.com/在首頁上,你就能看到這次全新的H3了,也是一個原生多模態模型。在純粹的功能上,非常的全面,全能參考啥的也都有。支持視頻圖片音頻等等的各種參考,最多12個。參數上,目前開放的直接是2K,甚至768P的都暫時還沒開放,最多15s。價格上2K的效果,1秒是12貝殼,差不多就是10塊錢一條15秒的2K視頻。動作參考、指定元素替換、換背景、改寫視頻、實拍視頻加特效、綠幕換背景、白模視頻上色、視頻續寫延長、視頻整體參考等等這些常用的功能,也都沒啥問題,而且效果不錯。這次的重點,我們自然還是要回到,視覺包裝上。其實我們會發現在過去半年裏面,AI視頻加速的最多的是AI短劇賽道。而傳統的商業廣告、宣傳片、綜藝等等,AI介入的好像還沒有那麼多。原因特別簡單,過去我們一直在做的AI視頻模型更像是一台很強的虛擬攝影機,它們能夠憑空創造一個世界,然後把這個世界拍下來,記錄下來。但是,攝像機拍完以後,一條真正意義上的視頻,其實才剛剛開始。因為人類最終看到的絕大多數視頻,都不是現實世界原封不動的切片。我們會剪輯,會加字幕,會設計片頭,會製造轉場,會用圖形、文字、UI和特效重新組織信息。這些東西,現實世界裏原本都不存在。它們全部是人類創造出來的視覺語言。這些就是視覺包裝。最典型的就是綜藝裏面經常會加的花字。這種以前AI視頻幾乎沒有辦法去處理,因為很難生成穩定加準確的文字,且很難理解文字與視頻素材和視頻內容之間的關係。但是這一次,MiniMax H3可以搞定這種了。比如一個飛行嘉賓出場,以前我們可能得做很複雜的動畫,然後K很多的幀,搞得還挺麻煩的,現在,一個Prompt。這個效果當然跟頂級綜藝沒有辦法比,也會出現一些奇奇怪怪的數字。但是你可以看到關於人物的、氛圍的、元素的設計,還有一些主體背景跟文字之間的互動,其實都已經做得很不錯了。在品牌語言上也是比較統一的。除了綜藝,還有很多很多需要做視覺包裝的,比如說MV。Prompt:15秒,16:9橫版,一鏡到底。生成一支極具視覺炫技感的實驗MV。主角是一位銀色寸頭、穿純黑長外套的中性歌手。攝影機始終圍繞主角順時針旋轉,人物持續對鏡頭演唱,嘴型和身份穩定。 同一個廢棄攝影棚隨着攝影機旋轉,依次轉化為五種視覺世界:真實膠片、黑白報紙、彩色黏土、透明水下、像素遊戲。每次變化都由主角動作和歌詞觸發,空間連續,不使用硬切。歌詞與文字: “CHANGE THE FRAME” “KEEP THE FACE” “EVERY WORLD IS MINE” 0至3秒:真實膠片攝影棚。主角抬手唱出“CHANGE THE FRAME”,手掌掃過的位置變成黑白報紙網點,文字像報紙標題一樣從牆面展開。 3至6秒:攝影機繼續環繞,報紙世界被主角撕開,空間變成彩色黏土。人物仍保持真人皮膚和真實臉,周圍道具與地面變成手工黏土。“KEEP THE FACE”沿主角身後彎曲出現。 6至9秒:主角跺腳,黏土地面化成透明水面。攝影機與人物同時進入水下,頭髮、衣服和氣泡符合真實水體運動,歌聲保持清晰。 9至12秒:主角拍碎水面,所有水滴變成像素方塊。攝影棚加載成復古三維遊戲世界,人物仍為真人。“EVERY WORLD IS MINE”形成巨大的遊戲關卡入口。 12至15秒:攝影機完成一整圈環繞。所有視覺世界像多層皮膚一樣從空間剝落,回到最初攝影棚。主角站在原位,伸手接住一枚同時包含五種材質的小方塊。 聲音:原創實驗電子樂,五個世界分別擁有膠片、紙張、黏土、水下和像素音色,節奏連續。 禁止切鏡頭、人物換臉、服裝變化、世界突然跳變、額外歌詞、普通蒙版轉場和水下嘴型失控。可以看到生成出來的這個運鏡效果其實非常的棒,而且文字極其準確,歌詞全部都是對上的。除了一些特別小的字,稍微大一點,幾乎都沒崩。視覺包裝做的非常的棒,在轉場和過渡上也非常的和諧。而且大家可以對比一下我的Prompt,H3有個非常強的特點,就是它的語義遵循能力極強,你真的就是說什麼,它就能給你實現出什麼,在做視覺包裝的時候非常有用,因為做視覺包裝很多時候就是極其精確的文字控制。當然,這種語義遵循強的能力也帶來了一些缺點,就是在某些影視級別的需要超強張力的鏡頭上,表現的沒有Seedance效果好。而這個case其實就能感覺到整個視覺包裝的效果會更強一點,做了非常多的素材的包裝和特效。除了MV,還有我們經常會做的logo演繹的視覺包裝。H3做的也非常有意思。比如,我就把我們公司的logo,給扔了進去,讓H3給我做一個logo演繹視頻。你別說,做的還是相當酷炫的。當然,你還可以做電商產品的某一次全新的新品宣傳片。一個AI影視節目的片頭。一個設計大會的主舞台宣傳片。還有很多很多,電商、遊戲、短視頻,甚至還能給Vlog做好玩的動效等等。你不需要再去做複雜的動效,不需要再去手K素材,甚至你都不需要打開剪輯軟件,把你的素材扔到H3裏,然後說出你的需求。一條經過視覺包裝的視頻,就可能已經做好了。AI視頻模型過去最喜歡展示的,往往是最極限的畫面。巨龍、戰爭、跑酷、追車、爆炸、複雜運鏡。這些東西很爽,也很適合證明模型的上限。可真正數量巨大、每天都在被生產、每天都有人願意付錢的視頻,很多都沒有這麼宏大。品牌廣告、電商素材、產品介紹、App功能演示、活動預告、社交媒體短片、遊戲PV、企業宣傳片。它們的生命週期很短,更新頻率很高,經常還要針對不同人羣、不同平台、不同尺寸,做出一大堆版本。這種內容最需要的能力,恰好就是H3擅長的東西。設計師和後期的價值,也會繼續往上游移動。手動拉關鍵幀、做素材、套轉場這類執行工作的價值還會下降。定義方向、建立審美、識別好壞、控制品牌一致性的價值,會越來越高。生產能力越氾濫,判斷力就越值錢。而且大家不要忘了,MiniMax H3,是要開源的。一個開源模型的生命力,往往是從發佈那一天才剛剛開始。後面一定會有人繼續去給它做推理優化,給它去微調特定風格。未來我們可能會看到無數種特化的,在垂直領域繼續發光發熱的H3版本出來。這個世界需要開源。每一個願意開源的,也都是英雄。現在,MiniMax H3,來當那個英雄了。我們也希望,能看到越來越多的AI視頻領域的開源模型。那才是真正的未來。以上,既然看到這裏了,如果覺得不錯,隨手點個贊、在看、轉發三連吧,如果想第一時間收到推送,也可以給我個星標⭐~謝謝你看我的文章,我們,下次再見。>/ 作者:卡茲克>/ 投稿或爆料,請聯繫郵箱:wzglyay@virxact.com

完成

Superpowers vs Mattpocock:兩種不同的編程方式

Superpowers用完整流程管住Agent,mattpocock靠人機對齊留住控制權

完成

0基礎帶你上手 Hermes Agent!【新手教程】

Hermes Agent 新手教學:用一個空白 Agent 打造會自我進化嘅賽博導師,真正成為你 7×24 嘅學習夥伴

完成

分享一個Skill,幫你把電影畫面拆成可複用的視覺系統。

分享一個自製嘅「風格包 Skill」,將電影畫面拆成色卡、風格規則同提示詞,令 AI 生成嘅視覺風格更統一。

完成

Claude Code砍掉80%系統提示詞?實際是Opus 5又補回了72%

Claude Code 提示詞大砍80%後反彈72%?真相係動態平衡嘅上下文工程

完成

一鍵拆解產品:硅谷AI設計師開源Skill,幫你練就Principal PM級產品洞察力

硅谷AI設計師開源Product Teardown Skill,幫你練就Principal PM級產品拆解能力

完成

分享一個打破信息差的 skill,巨好用

用一個 skill 幫 AI「停一停先諗清楚」,避免你永遠行同一條路

完成

AI工具實踐|Codex + ChatCut保姆級視頻剪輯指南:從安裝插件到導出成片

Codex + ChatCut 幫你AI粗剪口播片,但精細化剪輯仲未得——免費積分玩下就好

完成

【譯】Anthropic 砍掉了 Claude 80% 的系統提示詞,模型反而更強了

Anthropic 砍咗 Claude 80% 系統提示詞,模型反而更強|上下文工程新規則

完成

普通人的第一個AI工作流 2:你每天做的這些事,哪些最值得交給AI?

唔好從最重要嘅任務開始,要從重複、步驟固定、低風險嘅任務入手,用六條問題篩選,先易後難先係普通人第一個AI工作流嘅正確入口。

完成

Codex使用心法:14個真實案例搭工作流

用到Codex嘅關鍵唔係抄Skill,而係拆解自己嘅問題流程

完成

HyperFrames + WorkBuddy 生成視頻實戰

用WorkBuddy + HyperFrames對話式操作,唔使剪片軟件就做到30秒AI科普短片。

完成

(最全教程)還有人不會用Work Buddy?

呢篇係Work Buddy完整使用指南,由下載到實戰,教你點樣用呢個AI工具提升工作效率。

完成

這個視頻下載神器,沒有廣告和限速,連 AI 工具都在用

yt-dlp:開源視頻下載神器,無廣告不限速,仲可以交俾 Agent 搞掂

完成

別人一年做10個App,他4年只做了"一杯咖啡"|專訪獨立開發者風華

獨立開發者風華:4年深耕咖啡行業,打造從消費者到烘焙工作室嘅軟件生態

完成

Seedream 5.0 Pro 測評:圖像編輯門檻爆降

Seedream 5.0 Pro 圖像編輯門檻暴跌,指邊度改邊度

完成

跟風裝了12個Skill,兩個月後:4個神器、3個雞肋、5個刪了

裝咗12個Skill兩個月:4個神器、3個雞肋、5個刪咗,真實體驗全公開

完成

GPT-5.6 Sol 幫我做了個小工具:一鍵展示你的人生成就

用GPT-5.6 Sol整咗個人生成就卡工具,濾鏡加成就文案,一張圖講曬你嘅故事

完成

使勁蹬!一口氣讓 GPT 5.6 生成 200 +工具應用

用 Codex 一口氣生成 200+ 工具網站,遠程開發+插件升級係最大亮點

完成

面向 Codex 的原生無限畫布,指哪修改哪

Cowart:一個無限畫布 widget,令 Codex 可以指邊改邊,直觀生成同修改圖片

完成

去AI味的一些skills

去AI味工具終極大盤點:12個開源項目幫你識別並消除AI寫作痕跡,從英文到中文、從文字到設計再到代碼,各有專攻

完成

一文看懂ChatGPT、Codex、Work 的差別

ChatGPT、Codex、Work 三種模式的分別:Chat 畀答案,Work 交成品,Codex 改代碼

完成

GitHub 熱榜上的 1324 個健身動作項目,我用 AI 編程做成了搜索站

用 vibe coding 將 GitHub 健身數據集變成搜索站,AI 真係拉低咗實現門檻

完成

比你想的更簡單!Claude Code 官方的Loop循環設計指導

Claude Code 循環設計其實好簡單,四種套路搞掂,唔好俾啲黑話嚇親

完成

Claude Design 系統提示詞曝光!Anthropic 9 條「審美黑名單」,專治 AI 味設計

Claude Design 系統提示詞開源,Anthropic 用 9 條規則專治 AI 味設計

完成

週末 2 天做了個 AI 表情包工具,付費率 8%,月活 300

AI 表情包工具表情廚房,2 天做出 MVP,付費率 8%,月活 300

完成

50 個知識管理 Skill,幫你打造 AI 生產力系統

作者開源50個知識管理Skill,分享從數據到輸出嘅AI生產力系統

完成

兩萬顆星開源利器,直接克隆一個網站

用AI逆向工程直接克隆網站,5-10分鐘出一個完整Next.js項目

完成

卡茲克推薦的 Skill 不止 12 個,真正值錢的是工作流地圖

Skill選型關鍵在分層分類與安全,唔係裝得多就強

完成

Fable 5已近妖!

Fable 5會自動補齊周邊功能,從簡單裁圖任務生成完整網頁工具,自主性強到「已近妖」。

完成

Claude Code團隊工程師的 Fable 5 的實戰指南

Thariq 指出 AI 編程嘅關鍵係辨識同處理「未知」,透過系統性方法讓 Claude Code 幫你更快發現未知。

完成

從模型到工作流:2026 上半年圖片與視頻模型盤點。

2026上半年圖片與視頻模型盤點:從單點能力競爭轉向生產系統遷移,成本與可控性成關鍵

完成

Anthropic內部人員撰寫!Fable 5使用硬核指南:搞定未知盲區,AI 編程效率直接起飛

想用好Claude Fable 5?先學識發現自己嘅未知數,呢個先係效率起飛嘅關鍵。

完成

當我看到一段提示詞的時候,我在想什麼

學提示詞,要學決策結構,唔係複製一段咒語

完成

智譜Minimax下週迎來解禁,AI預測港股雙雄走向何方?

AI預測智譜解禁影響微、MiniMax壓力較大,關鍵睇股票有冇破發

完成

設計 SKILL 推薦:來自 Vercel 和 Linear 設計工程師的審美判斷

Emil Kowalski 開源三款設計 Skill,幫 AI 提升 UI 動效質感與審美判斷

完成

Obsidian 終於被我玩順了:電腦手機絲滑同步

用 Fast Note Sync 免費實現 Obsidian 電腦手機同步,一鍵設定超簡單