top of page

📢 STT 訂閱專區已上線

免費文章會照常更新,一篇都不會少。訂閱是「加強版」——每週深度週評、財報法說的完整判讀、所有長篇深度報告全包。

免費讓你跟上,訂閱讓你看懂、能做判斷。

月訂 NT$199|年訂 NT$2,000(約 NT$167/月)
👉 立即訂閱: vocus.cc/salon/simpletechtrend

2026 OCP APAC Summit | Linque | Jonathan Förste | Fast Optical Circuit Switching in the Scale-Up

  • 8月16日
  • 讀畢需時 9 分鐘
  • 光路交換(Optical Circuit Switching,OCS)在 scale-out 已經被 Google 用真金白銀證明過了,但它十年來都進不了 scale-up。原因很單純:現行 3D MEMS OCS 的切換時間是毫秒到秒級,而 AI collective 通訊的 burst 只有微秒級。開關比事件還慢,就只能當「幾小時換一次線」的配線盤用。

  • Linque 在這場 keynote 端出的答案是矽光子 2D OCS:64 通道、實測重配置時間 15 微秒,目標還要再往下壓。「開關太慢」這一關,等於被先拆掉了。

  • 但真正沒解決的是另一頭:光路一切,對面的收發器要重新鎖定。這件事今天是毫秒等級,必須壓到十奈秒等級才不會變成新的瓶頸——而這要換掉整條 link 的典範,不是把鏡子換成波導就好。講者自己承認「技術上可行,但還沒被實驗驗證,路還很長」。

  • 對台灣供應鏈的意義:fast OCS 若在 scale-up 成立,可插拔模組與交換 ASIC 的「顆數」會被大幅砍掉,但每顆的規格門檻(burst-mode 接收、CPO 整合)會被抬高。這是一次量減、價升、名單重排的結構換血,不是單純的需求增減。

1. 為什麼是現在:頻寬正在往 scale-up 集中

過去兩年 AI 網路的討論重心,明顯從 scale-out 移到了 scale-up。理由不複雜:模型一大,通訊需求就往「那一坨要被當成單一 GPU 用」的網域裡塞。scale-up 網域的定義本來就很極端——記憶體要共享、頻寬要遠高於 scale-out、拓撲要盡量非阻塞、理想上單跳可達,而且最關鍵的是延遲要可預測

這種網域,過去用銅就夠了。問題是銅的距離撐不住。一旦 scale-up 要跨出單一機櫃,就只剩光這條路——這件事我們在 銅纜撐不住 AI 之後:scale-up 光互連的七條路,與各撞一堵牆的兩種活法 有完整拆解。

而光的代價是要先付一筆「上工費」:每條光鏈路都要付 OE/EO 轉換的功耗。更糟的是,一旦 scale-up 變成多層網路,你不只每條 link 要付一次,中間每一層交換都要再付一次。這筆帳在單層還能忍,多層就直接爆掉。

這就是 OCS 之所以在此刻被重新拉出來講的原因:它不轉換訊號,所以它同時砍掉光鏈路數量與交換層數。

2. OCS 的老問題:它省得很漂亮,但快得不是地方

先講清楚現行 OCS 好在哪、卡在哪。

目前的 state of the art 是自由空間 3D OCS:光纖打進自由空間,靠微鏡陣列偏轉,把輸入纖對到輸出纖。這條路的優點是低損耗、高 radix,而且和速率無關——換代升級時交換器可以繼續用。Google 的 Apollo 就是這套的教科書案例:136×136 非阻塞、Palomar 微鏡封裝 176 面鏡(實用 136 面)、整台功耗約 108 W,對照同級電交換器的 3,000 W 以上,功耗差了 96%;Google 自己估算累積省下約 30 億美元,並宣稱吞吐 +30%、功耗 −40%、資本支出 −30%、網路停機時間降到 1/50。

問題是切換時間。鏡子要物理移動,重配置落在毫秒到秒級。所以 Apollo 的用法是「幾小時級的 quasi-static 配線」:依 job 事先規劃拓撲,跑起來之後就不動了,要改就得重新配置一次。講者在 Q&A 講得很直白——今天的 OCS 就是拿來當 SDN 控制下的預先配線工具,不是拿來跟著流量走的。

而 AI collective 的 burst 有多短?依講者給的量級:當 message size 上到 100 MB 以上,通訊 burst 的時間尺度大約落在微秒到毫秒。開關比事件慢兩到三個數量級,這就是 OCS 進不了 scale-up 的全部理由。

3. 四道關卡:fast OCS 不是換一顆開關就好

這場 keynote 最有價值的部分,是把「fast OCS 要進 scale-up」拆成四張互相牽制的清單。這四件事缺一不可,而且業界目前的成熟度差很多:

第一,流量必須結構化且可預測。 因為訊號從頭到尾不轉成電,你根本讀不到它,所有排程都必須事先安排。好消息是分散式 AI 訓練天生就長這樣:compute 階段幾乎不用頻寬,all-reduce 交換梯度時瞬間打滿——而且模型越大、message 越大,burst 越長、空窗也越長,反而更好排。這是 OCS 的運氣,不是設計出來的。

第二,收發器必須與 fast OCS 相容。 光路一換,對面就換了一個接收端,link 要能立刻重建。這是四關裡最硬的一關,下一節單獨講。

第三,控制平面必須精準。 講者的說法很值得抄下來:如果你的切換是用一支 Python 腳本觸發的,那個時序不確定性本身就會變成你的效能下限。而且光速也要算進去——100 公尺光纖約等於 0.5 微秒的飛行時間,SDN 控制器必須內建整個網域的實體佈線模型(哪條線 1 公尺、哪條線 100 公尺)來做補償,否則抖動就是你的下限。在切換時間壓到 100 奈秒到 1 微秒的目標下,控制器精度得推到高奈秒等級。

第四,光開關本身要夠快。 3D 自由空間出局,替代方案是 2D 整合光路:矽光子、矽光子基的整合式 MEMS、III-V 或含放大的架構,以及走波長而非空間的切換方案。這一整類的共通點是天生就快——從微秒等級一路可以下探到奈秒。

4. 15 微秒:矽光子先把「開關」這一關解掉了

Linque 在會上給的實證是自家 64 通道矽光子 OCS,實測重配置時間 15 微秒,並明說目標是再往下壓,才具備部署進 scale-up 的資格。

補一點公司背景:Linque 成立於 2021 年,共同創辦人為 Samarth Vadia(CEO)、Victor Funk(VP R&D)與這場的講者 Jonathan Förste(CTO),基地在歐洲、與德國及台灣皆有合作。首款產品 RISE 定位為全光路交換器,對外揭露的規格是重配置時間 10 微秒等級、超過 100 條光纖與 1,000 個以上電氣 I/O,資金為 450 萬歐元的非稀釋性資金。

規模不大,數字也還是實驗室等級。但方向是對的:把 15 微秒放進「message size 100 MB 以上、burst 落在微秒到毫秒」這個座標系裡看,它第一次落進了可用區間。這是 OCS 在 scale-up 這個題目上,第一次不是靠 roadmap 而是靠實測進場。

要注意的是,2D 整合光路換來速度,付出的是損耗與 radix。3D MEMS 之所以難被取代,正是因為它在這兩項上近乎無敵。Linque 自己也把「損耗——光在晶片上經過多個元件時的訊號衰減累積」列為核心挑戰。64 通道跟 136×136 中間差的不只是數字,是能不能撐起一個真實 scale-up 網域的問題。


5. 真正的瓶頸不是鏡子,是收發器鎖定

現場最好的一個提問,直接戳到這件事的要害:OCS 的延遲來自兩處,一是開關本身的物理動作,二是對面收發器重新鎖定——而這兩者量級相當。矽光子解掉了第一個,第二個怎麼辦?

講者的回答老實得值得記下來:這是比較根本的問題,解法是換掉典範,改用類似光網路裡 burst-mode 接收的做法,讓 link 在幾奈秒到數十奈秒內鎖定,才不會擋路。而今天資料中心用的可插拔模組,link training 到能真的開始傳資料,是毫秒甚至更慢的量級。

技術上我認為可行,但還沒被實驗驗證,路還很長。

這句話應該被放大:fast OCS 目前只有一半有實證。開關那一半有 15 微秒的數據;收發器那一半只有一個技術路徑的宣稱。而且這一半的難度更高,因為它不是某家公司改一顆晶片就好——它要求整個光收發生態把 CDR、DSP、AGC 的鎖定行為重新設計,等於要把資料中心 link 的 startup 流程重寫一次。

順帶一提,這也解釋了為什麼「OCS 與 CPO 是同一件事的兩端」。另一個提問直指:全光 scale-up 意味著每一張 NIC 都要有 scale-up 光介面,那不就強迫走 CPO?講者的回答是肯定的——等 fast OCS 真的到了要用的規模,CPO 那時也已經是主流了。這條時間軸的耦合,我們在 CPO 終於不再是「狼來了」:LightCounting CPO/NPO 大會的六個真實訊號 談過同一件事的另一面。

6. 功耗帳:從 10%、到不可行、再回到打平

這場最有說服力的一頁是功耗對照,邏輯是三段式:

  • 今天的單層銅背板 scale-up:網路功耗大約是 compute 功耗的 10% 或略高。這是目前的基準線。

  • 多層可插拔光的 scale-up:功耗會直接進入講者所說的「prohibitive」區間。他的原話是——在最天真的形式下基本上是不可行的。CPO、NPO 是解方,但無法單靠它們把多層架構救回來。

  • fast OCS + CPO 的 scale-up:把交換層全部換成快速光路交換,並與 CPO 整合,可以在很大的 scale-up 網域裡,做到與高效銅背板相當甚至更低的功耗占比。

這條線的價值不在數字精確度(講者自己也說那是示意圖),而在它把 OCS 從「一個省電的選項」重新定位成「多層 scale-up 唯一可能成立的前提」。同樣的 pJ/bit 邏輯,OIF 替 AI 互連畫了張官方地圖:三張網、一個 pJ/bit 戰場,CPO 是寫好的終局 已經從標準組織那一側算過一次,結論方向一致。


7. 反面論點:這件事有四個地方可能不成立

有立場就得把反面也攤開:

一、它不會取代乙太網交換器。 講者自己第一時間就說「認為 OCS 完全取代每一台乙太網交換器是不切實際的」。fast OCS 是資料平面的旁路,不是控制與例外流量的替代品。任何把 OCS 當成交換 ASIC 終結者的敘事都太超前。

二、它偏向 training,不偏向 inference。 這點也是講者的判斷:training 更可預測、不必回應網域外的流量、可以精準排程,而且 compute 與通訊的同步性造成更強的 burstiness——這些都是 OCS 的養分。inference 反而傾向把 compute 攤平在時間上,剛好抹掉 OCS 需要的結構。AI 資本支出正在往 inference 傾斜,這對 fast OCS 的市場時序不是好消息。

三、SDN 的複雜度被低估了。 要求控制器內建整個網域的實體佈線模型、補償每一條線的飛行時間、還要吃掉硬體與軟體各層的抖動與時間漂移——這不是加個功能,這是一整套新的網路營運模型。部署時要嘛把線長全部建檔,要嘛靠訓練序列去學。這在真實機房裡是很貴的紀律。

四、生態才剛起步。 OCP 的 OCS 子專案 2025 年 7 月成立、同年 8 月在台北的 OCP APAC Summit 公開亮相,由 iPronics 與 Lumentum 共同主導,Google、Microsoft、Coherent、Lumotive、nEye、Oriole Networks、POLATIS(HUBER+SUHNER)參與,目標是開放規格與軟體、並用 gNMI/gNOI/gNSI 與 OpenConfig 這類標準介面跟 SDN 框架整合,白皮書於 2026 年 4 月釋出。方向正確,但一個一年出頭的子專案,離「可採購的互通規格」還有相當距離

8. 總結

這場 keynote 的價值不在 15 微秒這個數字,而在它把 fast OCS 的戰場定位講清楚了:光開關這一關已經被矽光子解掉,接下來全部的難度都集中在收發器與控制平面。誰能把 link 鎖定時間從毫秒壓到數十奈秒,誰就握有 scale-up OCS 的鑰匙——而那不是一家開關公司做得到的事,是整條光收發供應鏈要一起改。

對台灣供應鏈,我的判斷是三件事:

第一,這是「量減、價升」的結構,不是需求增減。 fast OCS 一旦進 scale-up,最直接的效果是砍掉光鏈路數量與交換層數。以模組顆數計價的商業模式會先受傷;但活下來的每一顆,規格門檻會被抬高到 burst-mode 接收與 CPO 整合的等級。做「多」的公司會被壓,做「難」的公司會被拉起來。

第二,這條路把 CPO 的時間表往前綁死了。 全光 scale-up 等於每張 NIC 都要有光介面,而在那個功耗預算下,可插拔沒有位置。CPO 從「值得追蹤」變成「fast OCS 的前置條件」——台廠在 CPO 的封裝、光引擎、FAU、散熱這幾段的投入,等於同時押在兩條線上。相關的玩家盤點可參考 【CPO 拆解 6/6】CPO 各家路線總盤點

第三,真正該盯的訊號只有一個:burst-mode 收發器的第一次實驗驗證。 不是誰又發表了幾微秒的開關,而是誰在真實 link 上把鎖定時間壓進奈秒等級。在那之前,fast OCS 在 scale-up 都還是一張半成品的路線圖——很漂亮,但只有一半有數據。

本文僅供技術與產業趨勢分析,不構成任何投資建議。

相關閱讀



留言

評等為 0(最高為 5 顆星)。
暫無評等

新增評等
bottom of page