AI 時代的「工程」演變:從 Prompt 到 Loop Engineering

隨著大型語言模型(Large Language Models, LLMs)的爆發,AI 工程師的工作核心已從傳統的寫程式碼,轉向如何精準地與模型「溝通」與「控管」。本文將梳理生成式 AI 發展至今的四大核心工程概念:提示工程(Prompt Engineering)、上下文工程(Context Engineering)、治具/測試工程(Harness Engineering)與迴圈工程(Loop Engineering),分析其出現時間、核心議題與落地應用。

四大 AI 工程核心對照表

工程名稱 出現時間 核心處理的 AI 議題 解決的主要問題

提示工程


(Prompt Engineering, PE)

2020年~2022年 靜態指令與上下文學習(In-Context Learning) 克服 LLM 的不可預測性,提高輸出格式與內容的準確度。

上下文工程


(Context Engineering, CE)

2023年 長文本限制與外部知識整合(RAG / Fine-tuning) 解決幻覺(Hallucination)問題,將企業私有數據精準餵給模型。

治具/測試工程


(Harness Engineering, HE)

2023年末~2024年 系統級評估(Evaluation)與基準測試(Benchmarking) 解決 AI 輸出難以量化、難以進行 regression test(回歸測試)的痛點。

迴圈工程


(Loop Engineering, LE)

2024年~2025年 代理人系統(Agentic Workflow)與人機協同(HITL) 解決單次對話無法完成複雜任務的限制,實現多步驟自我修正。

四大工程深層解析與落地實踐

1. 提示工程 (Prompt Engineering)

在 2020 年 GPT-3 發表後萌芽,並於 2022 年 ChatGPT 問世時成為顯學。其核心在於透過結構化文本引導模型。

  • 文獻引用: 經典研究如魏忠祥等人提出的 Chain-of-Thought Prompting (Wei et al., 2022),證實透過引導模型寫出推理步驟,能大幅提升邏輯推理能力。

  • 落地應用: 現已內建於各大企業的 GitHub CopilotChatGPT Team 系統提示詞(System Prompts)中,用於定義 AI 的角色與回傳格式(如 JSON)。

2. 上下文工程 (Context Engineering)

2023 年隨著 GPT-4 發布及長文本窗口(Context Window)擴大,企業發現單純靠 Prompt 無法解決業務特定問題,因而轉向上下文管理。

  • 文獻引用: Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (Lewis et al., 2020) 為其理論基礎,至 2023 年全面商品化。

  • 落地應用: 廣泛落地於 AWS BedrockAzure OpenAI ServiceRAG (檢索增強生成) 系統。例如企業內部的「智能知識庫」,透過 Vector Database(向量資料庫)動態動態注入相關文檔作為 Context。

3. 治具/測試工程 (Harness Engineering)

2023 年底至 2024 年,當 AI 應用進入正式環境(Production),如何評估模型好壞成為關鍵。Harness 原指硬體測試治具,在此指自動化評估框架。

  • 文獻引用: 參考開源社群推動的 lm-evaluation-harness (EleutherAI) 專案,該專案成為學界與業界評測大模型能力(如 MMLU 基準)的標準工具。

  • 落地應用: 落地於 CI/CD 流程中,如使用 LangSmithPhoenix (Arize)Promptflow (Microsoft)。企業在調整 Prompt 或更換模型時,透過自動化 Test Harness 跑幾百個測資,確保準確率未下降。

4. 迴圈工程 (Loop Engineering)

2024 年至 2025 年的焦點。AI 從「問答模式」轉向「Agent 模式」。Loop 指的是讓 AI 進入「思考-行動-觀察-修正」的封閉迴圈,甚至加入人機協同(Human-in-the-Loop, HITL)。

  • 文獻引用: 借鑑 ReAct: Synergizing Reasoning and Acting in Language Models (Yao et al., 2022) 架構,並在近兩年演變為強大的 Agent 框架。

  • 落地應用: 落地於 LangGraphAutoGPT 以及企業級自動化工作流(如 CrewAI)。例如自動化軟體工程師 Devin,它會在環境中執行 Code、看 Error Log、自我修正(Self-Correction)直到編譯成功才結束任務。

結論

從單純寫 Prompt,到管理 Context,再到建立 Test Harness 與自動化 Loop,這代表了 AI 應用從「玩具」走向「工業級生產線」的必經之路。資深工程師的價值,已不再是找出神奇的咒語,而是如何架構一個穩定、可評測、具備自我修正能力的 AI 系統。

參考來源

  • Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022.

  • Lewis, P., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS 2020.

  • Yao, S., et al. (2022). ReAct: Synergizing Reasoning and Acting in Language Models. ICLR 2023.

  • EleutherAI. (2024). Language Model Evaluation Harness. GitHub Repository.

隨機文章

隨機美圖

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *