大模型赋能的智能体系统原理与实践

智能体开发新技术 基于大模型开发 西电教授力作
分享 推荐 0 收藏 10 阅读 887
谢雪梅 (作者) 978-7-115-68270-3

关于本书的内容有任何问题,请联系 刘博

1.相较于传统深度学习技术,本书特别强调了大模型在各领域的应用和创新,深入探讨了大模型在理解、推理、生成以及决策中的优势与潜力。通过具体的应用场景展示如何将理论知识应用于实际问题解决,增强了内容的实用性与操作性。
2.本书深入探讨了语言与视觉的多模态交互,强调多模态结构化表达、语义驱动的场景图更新等创新技术,为实现更自然、更智能的人机交互提供了新思路。在具身智能方面,本书详细介绍了具身任务中的人机交互、主动感知与行为决策等前沿技术,提供了一个现代智能体决策框架,推动了具身智能研究的发展。通过这些创新性,本书不仅在理论上有深度的探讨,还在实践中提供了切实可行的方法,特别是通过实验案例的展示,帮助读者掌握前沿技术并应用于实际问题中。
3.突出实践。此书作为实验指导书籍,旨在为读者提供从理论到实践的全面支持,确保他们能够有效地进行AI相关的实验和项目开发。
¥49.80 ¥42.33 (8.5 折)

内容摘要

本书是一本系统阐述人工智能技术,特别是大模型和智能体系统及其实际应用的专业图书。本书通过理论与实践相结合的方式,详细介绍人工智能在计算机视觉、人机交互、具身智能等领域的应用,旨在帮助读者全面理解人工智能技术如何赋能复杂系统,并推动未来科技发展。
本书共7章。第1章回顾人工智能发展历程并展望未来发展趋势。第2章探讨计算机视觉中的物体识别,重点分析大模型在提升识别性能中的作用。第3章解析人物交互事件,并通过案例展示智能体的实际应用。第4章讨论语言与视觉的融合,展示多模态人机交互的实现方法。第5章介绍人体姿态识别及其与语言信息的融合,探讨智能化互动系统的构建。第6章阐述视觉信息的语义编码与图像生成,展示大模型在内容创作与智能推荐中的应用。第7章探讨具身智能的发展,介绍主动感知、人机交互及大模型赋能的具身任务决策。
本书通过丰富的理论与实践案例,为读者提供对人工智能技术的深入解析和应用指导,适合作为高等学校人工智能相关课程的教材,也可供相关研究人员、工程师参考使用,助力其对人工智能技术的理解与实践创新。

目录

第1章 人工智能应用概述 1
1.1 引言 1
1.1.1 人类智能与人工智能 1
1.1.2 人工智能的发展历程 2
1.2 人工智能的应用 4
1.2.1 深度学习时期 4
1.2.2 大模型时期 5
1.2.3 以大模型驱动的智能体时期 7
本章小结 10
第2章 大模型时代的物体识别 11
2.1 人类视觉与机器视觉识物 11
2.1.1 人类视觉的识物机制 11
2.1.2 机器视觉的识物机制 14
2.2 大模型赋能的物体识别 15
2.2.1 大模型的跨模态融合架构 16
2.2.2 大模型的视觉定位方法 19
2.2.3 物体识别的提示词引导 21
2.2.4 物体的属性识别与深层语义挖掘 22
2.3 智能体赋能的物体识别 23
2.3.1 智能体的物体识别任务规划 23
2.3.2 智能体的物体知识库 24
2.3.3 智能体的物体识别工具 26
2.4 智能体识别物体应用案例 29
2.4.1 物体的视觉语义分析 29
2.4.2 语义驱动的外观缺陷识别 31
2.4.3 语义驱动的物体检测 33
2.4.4 语义驱动的物体分割 36
本章小结 39
第3章 人物交互的语义解析与行为理解 41
3.1 人物交互 41
3.1.1 人物交互检测研究现状 41
3.1.2 人物交互语义 43
3.2 人物交互事件理解 44
3.2.1 交互事件场景的层级化表达 45
3.2.2 交互事件的空间推理 48
3.2.3 交互事件的时序推理 49
3.3 智能体驱动的人物交互检测 50
3.3.1 知识库引导的交互事件检测 51
3.3.2 交互事件的语义关键帧 53
3.3.3 人物交互检测智能体的学习与模糊推理 54
3.4 室内场景行为检测应用案例 55
3.4.1 人物交互检测系统的设计与实现 55
3.4.2 实际应用中的人物交互案例分析 59
本章小结 61
第4章 视觉语言语义结构化表达与推理 63
4.1 语言理解与结构化表达 63
4.1.1 语言理解和解析 63
4.1.2 语言的结构化表达 64
4.1.3 语言驱动的多模态交互 66
4.2 视觉感知与结构化表达 67
4.2.1 人类认知与场景理解 67
4.2.2 场景语义基元库构建 69
4.2.3 场景语义层级化表达 69
4.3 视觉语言跨模态交互 70
4.3.1 多模态结构化对齐 71
4.3.2 语义驱动下的场景图更新 72
4.3.3 智能决策与反馈机制 75
4.4 视觉语言多模态交互应用案例 76
4.4.1 智能看护系统:多模态交互的场景监测 76
4.4.2 智慧教学系统:可控慕课交互问答 82
本章小结 89
第5章 多模态人体姿态估计、理解与生成 91
5.1 认识人体姿态 91
5.1.1 人体姿态的本质 92
5.1.2 人体姿态的意义 94
5.2 理解姿态 96
5.2.1 姿态估计:从视觉信息中得到人体姿态 96
5.2.2 行为识别:理解人体的行为 100
5.3 智能体框架下的语言与姿态协同 102
5.3.1 层次化的肢体语言 103
5.3.2 世界知识辅助姿态认知与行为决策 105
5.3.3 智能体的执行:文本到姿态语义重构 111
5.4 大模型姿态应用案例 112
5.4.1 主动行为感知的姿态估计 112
5.4.2 利用结构化文本生成三维人体姿态 118
本章小结 121

第6章 视觉语义编码与生成 123
6.1 视觉语义编码 123
6.1.1 视觉语义编码基础知识 123
6.1.2 视觉语义编码关键步骤 124
6.1.3 视觉语义理解的主要应用 125
6.2 图像生成技术探索之旅 129
6.2.1 图像生成技术发展历程 129
6.2.2 神经网络赋能的无文本图像生成 130
6.2.3 语义驱动的文本图像生成 134
6.3 大模型引领图像生成革命 136
6.3.1 从DALL-E看图像生成大模型 136
6.3.2 探索GPT-4o绘画的奥秘 140
6.4 大模型驱动的图像生成案例 142
6.4.1 语义重构下的图像生成 142
6.4.2 创意PPT背景的智能生成 146
本章小结 148
第7章 具身智能 150
7.1 边走边看:主动探索 150
7.1.1 从人类探索到智能体探索 150
7.1.2 开放环境下的具身智能系统 152
7.2 具身任务中的人机交互 156
7.2.1 人类交流与人机交互 157
7.2.2 具身任务驱动下的自然语言解析 159
7.3 大模型赋能的具身任务决策 161
7.3.1 大模型与知识库的结合 162
7.3.2 智能体决策 163
7.4 主动感知驱动的具身行为 166
7.4.1 主动感知 166
7.4.2 智能体行为认知 167
7.4.3 自适应调节机制 168
7.5 具身智能系统实验 171
7.5.1 意图识别 172
7.5.2 具身决策 174
7.5.3 具身任务执行 175
7.5.4 实验案例 175
本章小结 182
参考文献 184

读者评论

赶紧抢沙发哦!

我要评论

作者介绍

谢雪梅 西安电子科技大学人工智能学院教授、博导。广州市人工智能(场景理解与语义交互)重点实验室主任。教育部“新世纪优秀人才支持计划”。 主要研究项目及领域:计算机视觉、场景理解与视频分析、具身智能国家自然科学基金重点项目:面向弱小目标的机器学习与智能认知方法 科技部重点研发计划:工业领域知识自动构建与推理决策技术及应用国家自然科学基金面上项目:面向大数据的预期形状导向压缩感知成像的重建方法研究 省自然科学基金项目:智能视频监测及人员危害行为预警技术

相关图书

人邮微信
本地服务
教师服务
教师服务
读者服务
读者服务
返回顶部
返回顶部