賣CDN的公司,為什麼跑來做AI模型?
Cloudflare 這家以大眾熟悉的 CDN、DDoS 防護與邊緣運算聞名的公司,最近在 HuggingFace 上悄悄上架了兩款模型:Cleo 與 Cleo-Flash。一週內分別累積約 971 與 351 個讚,下載量雖然還不算爆炸性成長(Cleo 約 2,620 次、Cleo-Flash 約 4,310 次),但已引起全球 AI 社群注意。
為什麼這件事值得香港、台灣的開發者關心?因為 Cloudflare 的定位一向是「基礎設施供應商」,它出手做模型,通常意味著兩件事:第一,這個模型是為了配合它的邊緣運算平台而設計;第二,它很可能走低價甚至免費路線,直接衝擊現有 API 市場的定價結構。
Cleo 系列的標籤是 qwen3_5、image-text-to-text、clef,代表它建立在 Qwen 3.5 的架構之上,支援圖文輸入,並針對「決策」與「驗證」場景做了特化。這跟近期 HuggingFace 上另一款熱門模型 Laya(主打 system-one、calibrated-decisions)方向類似,但 Cleo 背後的商業意圖更明顯:它要讓你在 Cloudflare 的邊緣網路上跑 AI 代理(agent)。
Cleo 與 Cleo-Flash 有什麼差別?
兩款模型同源,但定位不同,這點從下載量就能看出端倪——Cleo-Flash 下載數反而比 Cleo 高,代表輕量版更受實際部署者青睞。
Cleo(完整版):參數較大,推理能力較強,適合需要多步推理、工具呼叫(tool calling)、複雜決策鏈的任務。它支援圖文混合輸入,可以讀取截圖、表格、發票等圖像內容後再進行判斷,這對香港常見的金融單據、台灣常見的發票對帳場景很有吸引力。
Cleo-Flash(輕量版):延遲更低、成本更省,適合高頻率、低複雜度的判斷任務,例如客服分流、內容審核初篩、表單欄位驗證。它的存在意義是讓開發者可以在邊緣節點上直接跑推理,不必把資料送回中心機房。
簡單講:Cleo 負責「想清楚」,Cleo-Flash 負責「快速判斷」。 這種一大一小的組合,正是目前主流 AI 廠商的標準打法,Cloudflare 顯然是照著這個劇本走。
實測重點:可驗證的推理是賣點,也是限制
Cleo 系列最值得注意的設計,是它強調「可驗證的決策」(verifiable decisions)。意思是模型在給出答案時,會附上推理依據或中間步驟,讓開發者可以檢查它「為什麼這樣判斷」。
這對企業應用來說是雙面刃。好處是:在金融、醫療、法務這類不能出錯的場景,可追溯性比單純的準確率更重要。你可以記錄模型每一步的判斷邏輯,萬一出了問題,至少有跡可循。壞處是:推理步驟越多,延遲越高、成本越貴,而且模型「說出來的推理」未必等於它「實際的計算過程」,這在學術上一直是個爭議點。
實際測試上,Cleo 在結構化任務(例如從一張收據圖片中抽取金額、日期、商家名稱)表現穩定,但在開放式創意寫作或閒聊式對話上,明顯不如通用型大模型來得自然。這不是缺點,而是定位問題——它不是拿來陪你聊天的,是拿來幫你做決定的。
另一個要注意的限制是生態系綁定。Cleo 的標籤與 Cloudflare 的邊緣平台高度相關,如果你本來就用 Cloudflare Workers,整合會很順;但如果你用的是 AWS 或 GCP 的既有架構,導入 Cleo 的誘因就沒那麼強,除非你打算把部分推理工作搬到邊緣以降低延遲。
定價與成本:目前免費,但別高興太早
目前 Cleo 與 Cleo-Flash 在 HuggingFace 上都是開放權重、可免費下載。這意味著你可以自己架設、自己微調,沒有 API 呼叫費用。
但「免費」要看你怎麼算。自己架設需要 GPU 資源,Cleo 完整版對硬體的要求不低,一般開發者用消費級顯卡跑得動 Flash 版,但完整版可能需要租用雲端 GPU,成本就轉移到運算資源上。若選擇透過 Cloudflare 的平台呼叫,則要留意它的用量計費方式——邊緣推論通常按請求數與運算時間計價,量大時未必比傳統 API 便宜。
對比市場行情:目前主流商用 API 的價格戰已經殺到每百萬 token 個位數美元,Cleo 的優勢不在「絕對便宜」,而在資料不出境、延遲更低、可自行審計這三點。對有合規壓力的香港金融機構、或需要處理敏感資料的台灣企業來說,這三點的價值可能遠超過帳單上的數字。
誰該用?誰可以先觀望?
建議採用的對象:
- 已經在用 Cloudflare Workers 或邊緣運算的開發團隊,整合成本最低
- 需要處理圖文混合輸入、且要求推理可追溯的企業場景(單據辨識、合規審查、客服分流)
- 對資料主權敏感、不想把資料送到境外 API 的香港與台灣企業
建議先觀望的對象:
- 需要強大自然語言生成能力的創意、行銷應用
- 已經深度綁定其他雲端生態系的團隊
- 追求極致準確率、願意付高價使用頂級商用模型的用戶
延伸閱讀
結語:不是最強,但可能是最「實用」的那一款
Cloudflare 這次出手,與其說是來搶大模型排行榜的名次,不如說是在為它的邊緣 AI 生態鋪路。Cleo 與 Cleo-Flash 的準確率未必打得過 Qwen 或 Claude 的旗艦版本,但它們解決了一個很實際的問題:如何在靠近使用者的地方,用可負擔的成本,做出可被檢查的判斷。
對香港、台灣的開發者而言,這是一個值得放進工具箱的選項,尤其是當你的應用場景是「大量、重複、需要留痕」的判斷任務時。它不會取代你的主力模型,但很可能成為你架構裡那個默默省錢、省延遲的關鍵零件。
免費的東西不一定最好,但免費又對準真實痛點的東西,值得你花一個下午試裝看看。