隨著大型語言模型(Large Language Models, LLMs)的爆發,AI 工程師的工作核心已從傳統的寫程式碼,轉向如何精準地與模型「溝通」與「控管」。本文將梳理生成式 AI 發展至今的四大核心工程概念:提示工程(Prompt Engineering)、上下文工程(Context Engineering)、治具/測試工程(Harness Engineering)與迴圈工程(Loop Engineering),分析其出現時間、核心議題與落地應用。
四大 AI 工程核心對照表
| 工程名稱 | 出現時間 | 核心處理的 AI 議題 | 解決的主要問題 |
|
提示工程 (Prompt Engineering, PE) |
2020年~2022年 | 靜態指令與上下文學習(In-Context Learning) | 克服 LLM 的不可預測性,提高輸出格式與內容的準確度。 |
|
上下文工程 (Context Engineering, CE) |
2023年 | 長文本限制與外部知識整合(RAG / Fine-tuning) | 解決幻覺(Hallucination)問題,將企業私有數據精準餵給模型。 |
|
治具/測試工程 (Harness Engineering, HE) |
2023年末~2024年 | 系統級評估(Evaluation)與基準測試(Benchmarking) | 解決 AI 輸出難以量化、難以進行 regression test(回歸測試)的痛點。 |
|
迴圈工程 (Loop Engineering, LE) |
2024年~2025年 | 代理人系統(Agentic Workflow)與人機協同(HITL) | 解決單次對話無法完成複雜任務的限制,實現多步驟自我修正。 |
四大工程深層解析與落地實踐
1. 提示工程 (Prompt Engineering)
在 2020 年 GPT-3 發表後萌芽,並於 2022 年 ChatGPT 問世時成為顯學。其核心在於透過結構化文本引導模型。
-
文獻引用: 經典研究如魏忠祥等人提出的 Chain-of-Thought Prompting (Wei et al., 2022),證實透過引導模型寫出推理步驟,能大幅提升邏輯推理能力。
-
落地應用: 現已內建於各大企業的 GitHub Copilot 或 ChatGPT Team 系統提示詞(System Prompts)中,用於定義 AI 的角色與回傳格式(如 JSON)。
2. 上下文工程 (Context Engineering)
2023 年隨著 GPT-4 發布及長文本窗口(Context Window)擴大,企業發現單純靠 Prompt 無法解決業務特定問題,因而轉向上下文管理。
-
文獻引用: Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (Lewis et al., 2020) 為其理論基礎,至 2023 年全面商品化。
-
落地應用: 廣泛落地於 AWS Bedrock 與 Azure OpenAI Service 的 RAG (檢索增強生成) 系統。例如企業內部的「智能知識庫」,透過 Vector Database(向量資料庫)動態動態注入相關文檔作為 Context。
3. 治具/測試工程 (Harness Engineering)
2023 年底至 2024 年,當 AI 應用進入正式環境(Production),如何評估模型好壞成為關鍵。Harness 原指硬體測試治具,在此指自動化評估框架。
-
文獻引用: 參考開源社群推動的 lm-evaluation-harness (EleutherAI) 專案,該專案成為學界與業界評測大模型能力(如 MMLU 基準)的標準工具。
-
落地應用: 落地於 CI/CD 流程中,如使用 LangSmith、Phoenix (Arize) 或 Promptflow (Microsoft)。企業在調整 Prompt 或更換模型時,透過自動化 Test Harness 跑幾百個測資,確保準確率未下降。
4. 迴圈工程 (Loop Engineering)
2024 年至 2025 年的焦點。AI 從「問答模式」轉向「Agent 模式」。Loop 指的是讓 AI 進入「思考-行動-觀察-修正」的封閉迴圈,甚至加入人機協同(Human-in-the-Loop, HITL)。
-
文獻引用: 借鑑 ReAct: Synergizing Reasoning and Acting in Language Models (Yao et al., 2022) 架構,並在近兩年演變為強大的 Agent 框架。
-
落地應用: 落地於 LangGraph、AutoGPT 以及企業級自動化工作流(如 CrewAI)。例如自動化軟體工程師 Devin,它會在環境中執行 Code、看 Error Log、自我修正(Self-Correction)直到編譯成功才結束任務。
結論
從單純寫 Prompt,到管理 Context,再到建立 Test Harness 與自動化 Loop,這代表了 AI 應用從「玩具」走向「工業級生產線」的必經之路。資深工程師的價值,已不再是找出神奇的咒語,而是如何架構一個穩定、可評測、具備自我修正能力的 AI 系統。
參考來源
-
Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022.
-
Lewis, P., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS 2020.
-
Yao, S., et al. (2022). ReAct: Synergizing Reasoning and Acting in Language Models. ICLR 2023.
-
EleutherAI. (2024). Language Model Evaluation Harness. GitHub Repository.
隨機文章
- 放在褲子後口袋的iPhone6 Plus 一天就變彎曲螢幕 (2014-09-25)
- 使用WIRESHARK抓DHCP封包查亂發IP (2016-11-01)
- 多評估了幾家台灣的網路寄存公司 (2015-02-06)
- 搶1111, 搶到遲到了吧 (2015-11-11)
- 10年政綱&不債留子孫~我又笑了 (2012-01-10)








