【
儀表網 研發快訊】工業信息物理系統(Cyber-Physical Systems, CPS)是感知、通信、計算、控制(簡稱 S3C)深度耦合的復雜系統,廣泛支撐智能制造、
工業機器人集群、邊緣智能等核心場景。當前該類系統普遍存在高維狀態空間、非凸優化目標、局部觀測受限等痛點:傳統獨立優化策略難以實現四域全局協同;常規多智能體強化學習(MADRL)缺乏先驗知識引導,探索效率低下,極易收斂至局部最優,難以滿足工業場景低時延、高精度控制需求。
針對上述瓶頸,中國科學院沈陽自動化研究所工業控制網絡與系統研究室科研團隊,提出大語言模型(LLM)增強的多智能體遷移強化學習算法框架 LLMPT-MADRL,充分挖掘大模型語義推理、先驗知識輸出能力,提升多維度協同優化性能。相關成果近期發表于IEEE/CAA Journal of Automatica Sinica。
科研團隊將“感-通-算-控”聯合優化問題建模為部分可觀察馬爾可夫決策過程,設計了包含LLM模塊、MADRL模塊和策略選擇模塊的算法架構。其中,LLM模塊通過提示詞輸出優質指導策略;MADRL模塊采用Actor-Critic結構完成策略優化;策略選擇模塊依靠概率機制動態融合兩類輸出,實現訓練階段策略平滑切換。同時,他們還設計了自適應遷移損失函數,以解決LLM與強化學習網絡規模異構問題,保障知識有效遷移。科研團隊以降低系統時延與控制誤差為目標,對采樣系數、通信帶寬、計算頻率、控制輸入等“感-通-算-控”開展聯合優化仿真,選取MADDPG、MATD3、M
APPO作為對比基線,采用集中訓練、分布式執行模式完成驗證。
研究結果表明,LLMPT-MADR各項指標均優于傳統多智能體算法,相比基線方法綜合獎勵提升16.8%,系統時延降低24.5%,控制誤差減少10.4%。證明了大模型可加速策略學習,抑制策略波動,顯著提升系統穩定性與控制效果。
相關成果以LLM-Enhanced Multi-Agent Transfer Reinforcement Learning for Sensing, Communication, Computing, and Control Co-Optimization in Cyber-Physical Systems為題發表,碩士生張俊遠為論文第一作者,許馳研究員為通訊作者。該研究得到了國家自然科學基金項目、遼寧省科技計劃項目和遼寧省“興遼英才”計劃項目的支持。
所有評論僅代表網友意見,與本站立場無關。