VLSI 2026|技術文章分析|華盛頓大學把單波長塑到 320Gb/s:MRM 做相干 QAM,0.69pJ/b 打贏 PAM-4
- 3天前
- 讀畢需時 8 分鐘
華盛頓大學(UW)在 VLSI 2026(議程編號 C20.3)發表一顆單片矽光相干光發射機:用微環調變器(MRM)而不是傳統體積龐大的馬赫-曾德干涉儀(MZI)做 QAM-4 相干調變,四通道各 80Gb/s、在單一波長上跑出 320Gb/s 聚合速率。關鍵數字是 0.69pJ/b 能效,比同製程節點的其他 MRM CPO 方案都低。它的意義在於:不再靠「一直加雷射波長」堆頻寬,而是靠相干 QAM 把每一根波長的資訊密度拉高,直接減少系統要養的雷射線數與光纖數。用 GlobalFoundries(GF)45nm 單片矽光實現,內含片上數位鎖相環(DPLL)時鐘與全時分複用熱調諧控制迴路。
1. 論文背景:UW 團隊、VLSI 2026 C20.3,為何值得看
先講這篇不是什麼。它不是又一顆把速率往上疊的 PAM-4 光引擎,也不是靠密集分波多工(DWDM)多開幾條波長來湊頻寬的傳統路線。它做的是一件在矽光圈裡一直被認為「MRM 做不到」的事:用微環調變器直接做相干 QAM。論文出自華盛頓大學 Sajjad Moazeni 團隊(第一作者 Pengyu Zeng),發表於 2026 IEEE Symposium on VLSI Technology and Circuits,議程編號 C20.3。MRM 因為體積小、能效好,被公認是 DWDM CPO 的主力元件——但 DWDM 的代價是要開一大堆獨立雷射線與光纖,系統複雜度與成本隨波長數線性上升。這篇論文的價值,就是給出另一條不靠「無限加波長」的擴容路。

2. 核心問題:一句話講清楚它在解什麼
用一句話說:與其把波長數量無限往上加,不如用相干 QAM 把單一波長的資訊密度做高;但 MRM 天生幅相耦合,直接做 QAM 很難,這篇用 RAMZI 架構把這個耦合繞開。傳統強度調變直接檢測(IM-DD)一個符號只帶 1 個維度的資訊;相干 QAM 同時用幅度與相位、還分 I/Q 兩路,一個符號帶的資訊多得多,頻譜效率因此大幅提升。問題是 MRM 一調諧共振點,幅度變的同時相位也跟著變,這讓它很難乾淨地畫出 QAM 星座圖。這篇的解法是環輔助馬赫-曾德干涉儀(RAMZI)。
3. 系統概念與晶片架構:Figure 1、Figure 2
Figure 1 展示了相干 CPO(論文簡稱 C2PO)這個新典範,以及 RAMZI 怎麼把 MRM 變成能做 QAM 的相干調變器。每個 RAMZI 用「一對 MRM」,把兩顆微環的共振點透過熱調諧擺到雷射波長的兩側;再用差分驅動電壓,讓兩顆環同時往相反方向移動,輸出一個「相位固定、只有幅度被調變」的訊號——這正好把 MRM 的幅相耦合問題繞掉。接著把兩個 RAMZI(各帶獨立資料)以 90 度相位差合成,就得到一個 offset-QAM 調變器。那個相位偏移是刻意加進且可調的,目的是讓接收端能做免 DSP 的載波相位回復。
Figure 2 展示了整顆發射機(Tx)的晶片架構:四通道共用一個時鐘核心。左半邊是共用的時鐘核心,光學部分用藍色標出;右半邊是單一發射通道的核心架構。四個通道共用同一路光輸入去產生調變資料,並且在這顆設計裡,所有通道共用一根光纖來把本地振盪(LO)雷射轉送到接收端,藉此把光纖數量的額外開銷壓到最低。4 通道、單一光輸入、單根共享 LO 轉送光纖——這幾個「共用」是把系統級光纖與雷射線數壓下來的核心設計選擇。

4. 時鐘與高速電子前端:Figure 3、Figure 4
Figure 3 展示了時鐘核心的方塊圖。時鐘核心由一個 20GHz 數位鎖相環(DPLL)構成,內用 LC 型數位控制振獢器(LC-DCO)與時脈分頻鏈(CLK Div Chain),外部參考時脈是約 625MHz 的 CML 訊號。20GHz 的差分輸出用共平面波導(CPW)傳輸線分配到各通道。每通道數位後端在 1.25GHz 運作(跑 PRBS 與各控制迴路)。把 DPLL 與高速時鐘分配整進單片矽光,代表這是一顆會自己產生與分配時鐘的完整 SoC。

Figure 4 展示了單通道發射機類比前端(AFE)的電路方塊圖。要在 GF 45nm 這個製程上撐到 40 GBaud,團隊客製化了序列化器用的鎖存器(latch)與三態多工器(tri-state MUX),用傳輸閘把 NMOS/PMOS 輸入與前一級的互補輸出接起來。這個結構優化把扇出(fanout)有效降低約 2 倍,等效電容負載跟著下降,明顯拉高鎖存器的資料捕捉速度。通道內先把 20GHz 時鐘轉成四相 10GHz CMOS 時鐘餵給 I/Q 序列化器,最後一級才升回 20GHz,藉此把佈線寄生壓到最低。在成熟、便宜的 45nm 節點硬做出 40 GBaud,靠的是電路級的巧勁而非先進製程。

5. 光學元件與熱調諧控制迴路:Figure 5、Figure 6
Figure 5 展示了 RAMZI 型 QAM 發射機的完整光學元件。MRM 的共振點與 RAMZI 的偏壓點,都靠閉迴路熱相位移器維持;相位移器由可程式化的脈衝密度調變(PDM)控制,並用厚氧化層 NMOS 當加熱器驅動。每個 I/Q RAMZI 配三顆功率感測光電二極體(PD)——兩顆 MRM 各一顆掛在 drop 埠、加上一顆掛在 RAMZI 輸出合波器的第二個光埠。把熱調諧的感測與致動全整進單片,是這類方案能不能真的部署的關鍵。

Figure 6 展示了片上熱調諧電路,也就是這篇的招牌「時分複用熱調諧」。監測 PD 的光電流被時分複用進一個電容式跨阻放大器(CTIA)積分前端,這個前端有大動態範圍,再由一顆 6-bit 逐次逼近(SAR)ADC 數位化。數位迴路掃描加熱器數值,先找到、再把平均光功率鎖到一個預先校準好的目標位準。6-bit SAR ADC、數位後端參考時脈為 20GHz/16 = 1.25GHz。把多路 PD 電流時分複用共用一套 CTIA+ADC,是把熱調諧控制迴路的功耗與面積開銷壓到「minimal」的關鍵手法。

6. 量測結果:Figure 7、Figure 8、Figure 9

Figure 7 展示了這顆 C2PO 發射機的晶粒照片。這是多通道光發射機矽光晶片的實體晶粒照,電子與光子在 GF 45nm 單片矽光上共存,寄生最低。一張晶粒同時容納四通道、共用時鐘核心與四組 RAMZI 光學區——單片整合的密度,是這條路線相對「電光分離、再封裝」方案的結構優勢。

Figure 8 展示了 RAMZI/MRM 熱調諧的量測。上半部是 MRM 的初始校準,用來找到最佳鎖定位準;下半部是刻意掃動輸入雷射波長時,ADC 量到的光功率仍能維持鎖定。為了讓 RAMZI 正常運作,團隊把兩顆 MRM 的共振點固定分開約 100pm,再調 RAMZI 相位移器把觀測到的光調變幅度(OMA)最大化。量測用一顆線寬約 1MHz 的 DFB 雷射、總光功率 16.5 dBm,估計進到每顆 MRM 約 -5.5 dBm。這是「熱調諧真的鎖得住」的實證。

Figure 9 展示了量測到的光眼圖,以及每通道的功耗/面積分解。用商用光接收機與高頻寬取樣示波器量到 I、Q 兩路的光眼圖;右側是每通道的電功耗與面積分解。每個 RAMZI 調變器量到插入損耗(IL)5.0 dB、消光比(ER)7.9 dB,對應歸一化 OMA 0.26,換算成 offset-QAM 的歸一化電場 OMA 為 0.33。整體功耗約 0.69pJ/b @ 40 GBaud——這要歸功於每通道 I/Q 各自跑 NRZ、baud rate 相對 PAM-4 被放鬆,因而更省電。0.69pJ/b 把相干 QAM 和低功耗這兩件過去被認為矛盾的事放到同一顆晶片上。
7. 量測平台與封裝:Figure 10

Figure 10 展示了測試平台與板上封裝的照片。光訊號用一個 8 通道、250um 間距的 V 型槽陣列在晶片上下耦合進出。這對應到前面「所有通道共用單一光輸入、共享一根 LO 轉送光纖」的低光纖數設計。把 chip-on-board 加 V 型槽陣列這種可落地的封裝方式秀出來,代表這不只是晶片級成果,而是往真正裝進系統的方向走。
8. 技術亮點:兩個真正創新的點
第一,用雙 MRM 組成 RAMZI,繞開 MRM 的幅相耦合,做出相干 offset-QAM。過去要做相干調變幾乎只能用面積龐大的 MZI,MRM 因為調幅時相位跟著跑而被排除在外。UW 讓兩顆環往相反方向動、輸出相位固定的純幅度調變,再以 90 度合成兩個 RAMZI,就在 MZI 一小塊的面積裡做出 QAM,還刻意留 offset 讓接收端能免 DSP 回復載波相位。第二,時分複用熱調諧把 MRM 最頭痛的溫度穩定問題用最小開銷收掉。多路監測 PD 的電流時分複用共用一套 CTIA 積分前端加 6-bit SAR ADC,數位迴路自動掃加熱器、鎖定目標光功率,是它能守住 0.69pJ/b 的關鍵。
9. 產業連結:離量產多遠、誰受益
這顆晶片跑在 GF 45nm 單片矽光這個成熟、可量產的平台,用的是 chip-on-board 加標準 V 型槽陣列封裝,不是靠什麼奇特製程——這代表它離「可被產業複製」不算遠,門檻主要在生態系願不願意採相干 CPO 這條路。受益的是想在同樣雷射與光纖預算下擠出更多頻寬的超大規模資料中心:少開雷射線、少拉光纖,直接砍系統成本與複雜度。它同時給出一條清楚的升級路:現在是 QAM-4(每通道 I/Q 各跑 NRZ),未來往 QAM-16 擴,速率再翻,而 RAMZI 與熱調諧的架構不用打掉重練。
總結
這篇論文的定位很清楚:它證明了 MRM 不必永遠困在 IM-DD,而能在成熟矽光製程上做出低功耗的相干 QAM。用 RAMZI 繞開 MRM 幅相耦合、用時分複用熱調諧把溫度穩定的代價攛薄,UW 把「相干」「低功耗」「小面積」「可量產製程」這四件通常互相打架的事,收斂在一顆 0.69pJ/b、單波長 320Gb/s 的晶片上。它不會一夜之間取代 PAM-4 或 DWDM,但給了 CPO 一條「不靠無限加波長也能擴容」的實證路徑。真正要看的下一步,是它能不能順利爬到 QAM-16、以及相干接收端的免 DSP 方案能不能一起長出來。
參考資料
論文標題:A 0.69-pJ/b 4×80-Gb/s MRM-Based Coherent Optical Transmitter with Time-Multiplexed Thermal Tuning。作者:Pengyu Zeng、Marziyeh Rezaei、Daniel Sturm、Asha Rashmi Nayak、Scott Li、Sajjad Moazeni(University of Washington, Seattle, WA, USA)。會議:2026 IEEE Symposium on VLSI Technology and Circuits,議程編號 C20.3,2026。DOI:10.1109/VLSITECHNOLOGYANDCIR65830.2026.11577385。




留言