Skip to content

新兴趋势

随着大型语言模型(Large Language Models, LLMs)以及更广泛的人工智能领域持续快速发展,prompt engineering 在释放其能力并确保其有效和负责任的使用方面发挥着越来越关键的作用。本章探讨了 prompt engineering 的主要新兴趋势,重点介绍了正在塑造我们与 LLMs 交互以及在其基础上进行构建的未来发展。

LLMs 越来越成为多模态的,能够处理和生成跨越各种数据类型的信息,如文本、图像、音频,甚至视频。多模态 LLMs 的 prompt engineering 涉及精心设计能够有效结合这些不同模态的 prompt。例如,提供一张图像并询问基于文本的问题,或者根据文本描述生成图像,甚至根据文本创建视频摘要。

RAG 将 LLM 的响应建立在外部、可验证的知识基础上,正在变得越来越高级。趋势包括更复杂的检索技术(混合搜索、查询重写)、改进的知识库分块和嵌入策略,以及能够处理更复杂查询和从多个检索文档综合信息的 RAG 系统。

一个重要的趋势是 LLM 驱动的代理的开发,它们可以通过与外部工具和 API 交互来推理、规划和执行任务。针对代理的 Prompting 涉及定义目标、可用工具(及其用途描述)以及决策和错误处理策略。像 ReAct (Reason and Act) 这样的框架就体现了这种方法。

除了基本的 zero-shot 和 few-shot prompting 之外,更复杂的技术正在获得关注,以改善推理和任务表现:

  • Chain-of-Thought (CoT) 及其变体(例如 Self-Consistency、Least-to-Most prompting)不断被改进以实现更好的推理。
  • Tree of Thoughts (ToT) 和 Graph of Thoughts (GoT):这些技术允许 LLMs 探索多个推理路径,评估它们,并回溯,从而带来更稳健的问题解决能力。
  • 自我纠正/反思:Prompting LLMs 检查和批评自己的输出,然后进行改进,可以带来更高质量的结果。

对于 LLMs 产生可靠的结构化输出(例如,JSON、XML)以方便与其他软件集成,需求日益增长。许多 LLM API 现在提供专门的“函数调用”(function calling)或“工具使用”(tool use)功能,通过这些功能,prompt 可以定义所需输出的 schema 或 LLM 可以通过生成结构化参数来“调用”的函数。

手动设计最优的 prompt 可能非常耗时。新兴的技术和框架(例如 DSPy、Automatic Prompt Engineer (APE))旨在自动化部分 prompt 发现和优化过程,通常利用 LLMs 本身根据性能指标生成或改进 prompt。

随着 LLM 应用变得越来越复杂,有效地管理 prompt 至关重要。这包括 prompt 的版本控制、不同 prompt 版本的 A/B 测试,以及使用编排框架(如 LangChain 或 LlamaIndex)构建复杂的 LLM 调用链或图以及其他组件。

8. 可解释性和可理解性 (LLMs 的 XAI)

Section titled “8. 可解释性和可理解性 (LLMs 的 XAI)”

理解 LLM 为什么 生成特定响应对于信任和调试至关重要。虽然完全的可理解性仍然是一个挑战,但 prompt engineering 技术可以通过例如指导模型“展示其工作过程”(如 CoT 中所示)或解释其答案来促进可解释性。

正在努力赋予 LLMs 更好的长期记忆能力并实现更个性化的交互。Prompt engineering 在如何将用户配置文件、偏好和历史交互馈送给模型以定制其响应方面发挥着作用。

10. 伦理 AI、安全与负责任的 Prompting

Section titled “10. 伦理 AI、安全与负责任的 Prompting”

这仍然是首要关注点。趋势包括开发更稳健的方法来处理以下方面:

  • 偏见检测与缓解:精心设计 prompt 以避免引出带有偏见的响应,并评估输出的公平性。
  • 安全对齐:设计 prompt 和系统(例如 guardrails、constitutional AI)以防止有害、不当或误导性的输出。
  • 内容审核:使用 prompt 过滤或标记由 LLMs 生成或馈送给 LLMs 的问题内容。
  • 透明度和诚实:Prompting 模型明确说明其局限性或何时它们正在进行推测。

11. Prompt 和 LLM 系统的评估与基准测试

Section titled “11. Prompt 和 LLM 系统的评估与基准测试”

随着 prompt engineering 变得越来越复杂,对其进行严格评估的需求也随之增加。这包括开发更好的指标、基准和测试方法,不仅评估 LLM 输出对于给定 prompt 的质量,还评估整个 LLM 驱动系统的稳健性、效率和安全性。

Prompt engineering 领域是动态的且发展迅速。紧跟这些新兴趋势——从多模态交互和代理式 LLMs 到自动化优化和伦理考量——对于任何希望有效且负责任地利用大型语言模型变革力量的人来说都是至关重要的。

这些进步预示着更强大、更可靠、更具适应性的 LLM 应用,同时也强调了娴熟和深思熟虑的 prompt engineering 日益增长的重要性。