← leoaido.com
EN · 繁中
crv Pro · $29 一次買斷

爬蟲時代已過去 AI 透過影片學習知識的時代來臨了

讓 AI 看懂影片是怎麼拍的——不只看懂拍了什麼

免費版 claude-real-video 的全部功能,加上整套 Pro 分析——運鏡節奏、聲音情緒、跨影片記憶、互動介面、AI 報告——變成任何 LLM 都能推理的資料。

立即購買(Capafy)$29
結帳後立即下載——安裝包加你的授權金鑰。
數位商品,不適用七日猶豫期——購買(含台灣銀行轉帳)即表示同意《購買條款與退費政策》
$29 一次買斷,永久使用,含後續更新。

60 秒像素動畫——AI agent 找到鑰匙、解鎖視覺。記得開聲音。

60 秒示範——真實輸出,素材為 NVIDIA GTC 官方演講精華。時間軸上每個事件都是工具實際偵測的結果。

60 秒真實操作示範

真實安裝、真實執行、真實介面——一鏡到底,沒有剪接美化。

免費版給 AI 關鍵幀跟逐字稿,夠它知道影片「在講什麼」。

Pro 版補上剩下的一切:怎麼拍、怎麼剪、怎麼說、什麼情緒。全部在你電腦上跑完,變成任何 LLM 都讀得懂的純文字。

Pro 加了什麼

運鏡與節奏 --motion

每個鏡頭自動標運鏡:固定、搖鏡、俯仰、推拉、手持。完整鏡頭表:每鏡秒數、每分鐘剪接數、開中尾節奏變化。高動態鏡頭自動抽 0.2 秒連拍,動作讀成過程不用猜。

聲音與情緒 --senses

語音情緒、語氣起伏、聲音事件(笑聲、音效、環境音)逐段標記。人聲配樂自動分離:情緒判讀吃乾淨人聲,配樂另給 BPM 跟能量曲線。MV、電影這種沒人講話的,自動改用畫面色彩光線讀情緒。

互動分析介面 --viewer

分析完多一個網頁檔,雙擊打開:影片、可點跳秒的事件時間軸、逐字稿跟著播放亮起。介面支援英文、繁中、簡中。零安裝零上傳。

一鍵雙報告 --ai-report

用你自己的 API key,直接產出兩份報告:一份講畫面怎麼拍,一份講內容在說什麼。

畫面文字辨識 --ocr

影片裡的字幕、字卡、招牌,全部變成帶時間戳、可引用、可搜尋的文字。聽寫聽錯的人名、數字、術語,由畫面上的原字幕當場糾正——短影音滿屏字卡,每一張都成了資料。中日韓文辨識特別強,全程在你的電腦上跑。

跨影片記憶 crv-pro-ask

Pro 看過的每一支影片,都進到你電腦上同一個可搜尋的索引。用一句話問——哪支影片講過、第幾秒、原句是什麼,中英文都查得到。再問只有 Pro 答得出來的:--camera zoom 找出你看過的所有推鏡片段、--track emotion 找出聲音模型標到情緒的時刻、--rhythm 把整個片庫按剪接密度排名。看過的影片再跑一次 0.04 秒直接指回既有分析,不重跑。一個 SQLite 檔在你機器上,什麼都不上傳。

速度鑑識 --speed-check

逐段檢出影片時間軸被動過的手腳。多重訊號交叉驗證——墊幀指紋、運動軌跡連續性、以人為基準的速度時鐘——逐段標出慢放墊幀、後製加速與縮時拍攝,並附證據等級。設計上誠實到底:只報告證據、永遠不說「這是正常速度」,內建融合規則讓激烈運動和遊戲畫面不被冤枉。上線前經過三輪真人盲測驗收。

看實際介面操作

真實輸出

全部寫進你的 LLM 本來就在讀的 MANIFEST.txt——純文字:

--- motion analysis (crv Pro) ---
editing rhythm: 14 shots | 21.0 cuts/min | avg 2.8s (median 2.1s, range 0.8-9.4s)
cuts by thirds (open/middle/close): 7 / 4 / 3
shots:
  #01  0.00-2.10s  (2.10s) camera: pan-right   motion: high (12.3%W/s) burst: burst_shot01_1..4
  #02  2.10-4.80s  (2.70s) camera: zoom-in     motion: medium (3.1%W/s)
  #03  4.80-9.20s  (4.40s) camera: static      motion: low (0.2%W/s)
  ...

用戶怎麼說

有用戶自己跑 SHA-256 重放驗證我們的逐幀時間戳——用一支真實的 22 分鐘課程影片,60 幀全數通過。公開留言在 GitHub issue #7

GitHub 用戶 HeartTouch 驗證 60/60 幀 SHA-256 完全一致、時間戳誤差最大 0.333 毫秒

適合誰

創作者——研究一支爆紅影片為什麼留得住人
剪輯師——逐鏡拆解一支對標參考片
任何把影片餵給 Claude、ChatGPT、Gemini 或自架開源模型的人——想要關於節奏跟運鏡的真答案

常見問題

來自 Reddit 討論串和買家來信的真實提問,用實測數字回答。

會不會很耗 token?

不會——最重的活從頭到尾碰不到 AI。影片處理全部在你電腦上免費跑完,token 只花在「AI 讀那份小小的結果」:一分鐘的影片濃縮成幾張圖加一份文字檔,用九宮格打包後讀一整支片的成本只剩零頭。一般一次閱讀就是幾美分的量,或根本包含在你本來就付的 Claude/ChatGPT 訂閱裡。

我的影片會被上傳嗎?

不會。影片、畫面、逐字稿、分析全部在你自己的機器上完成,不經過任何伺服器。唯一會離開你電腦的,是你自己事後選擇貼給 AI 的內容。客戶素材、還沒發佈的片,一格都不出門。

需要很強的電腦嗎?

一般筆電就夠,不用顯卡。Mac mini 上一分鐘的影片全功能分析不到兩分鐘跑完,輕量模式更快。macOS、Windows、Linux 都支援。

我不會寫程式,用得了嗎?

用得了。裝好之後打 crv-web,瀏覽器會開一個本機頁面:貼影片連結、按分析、看結果,全程不用碰指令。或裝成 Claude Code 的 skill,在聊天裡貼影片連結就行,剩下 AI 自己處理。

Google 的 AI 不是已經能看影片了嗎?

Gemini 確實能,而且不錯。差別有三個:它要把影片上傳到 Google 伺服器(這裡影片不出你的電腦);它按固定時間抽畫面,crv 只留畫面真正變化的時刻;而且 Gemini 只能在 Gemini 裡用——crv 讓每一個 AI 都讀得懂影片,包括本來完全不收影片檔的 Claude 和 ChatGPT。

分析一支影片要多久?

快速讀法(抽幀+逐字稿):短片大約一分鐘。全功能開好開滿:大約是影片長度的 2 倍起,事件密集的素材可能到 5 倍——一分鐘的 reel 約兩分鐘,一支資訊很密的兩分鐘宣傳片全開實測跑了九分鐘。功能是模組化的,開多少等多少。

可以商用嗎?

可以。引擎和所有內建模型都用可商用授權(Apache-2.0/MIT),每次發版前都會查核一輪。一份授權你的所有機器都能用。

運作方式

運鏡與節奏分析用 ffmpeg + OpenCV,不用下載模型;聲音與情緒感知的模型第一次用時自動下載,之後離線跑。逐字稿引擎是 Whisper turbo(turbo 是 large-v3 的剪枝版,比 large 快很多,品質只有輕微折損)。影片全程在你的電腦處理、原始影片不會上傳;你之後自己選擇貼給雲端 LLM 的畫格或逐字稿,才會傳給該服務。購買後拿到安裝包跟授權金鑰;一份授權,你所有的電腦都能用。

pip installPython 3.10+ffmpeg本機處理授權金鑰

台灣朋友:可直接銀行轉帳

寄信到 cortexos.main@gmail.com(主旨寫「crv Pro 台灣轉帳購買」),我回覆轉帳資訊。完成轉帳並回傳後五碼,數小時內寄出安裝檔與啟用金鑰。NT$790,一次買斷,含中文使用支援(有問題直接用中文問)。

轉帳購買同樣適用《購買條款與退費政策》,匯款即視為同意。

讓你的 AI 講得出:這支影片是怎麼拍的。

$29 付一次,永久使用,含後續更新。

立即購買(Capafy)$29
購買即表示同意《購買條款與退費政策》
購買條款與退費政策 · 基於免費開源的 claude-real-video · 作者 黃志弘 Leo Huang
crv 是 claude-real-video(PyPI 套件名)的簡稱;付費版 crv Pro 在 Capafy 上架的名稱是 llm-real-video Pro(Capafy 顯示的是平台上架版號 v1.0.6,內含 crv Pro 0.8.6)。