微软创新项目Project Rumi：多模态AI项目助力理解人类意图

2023年08月07日 20:37:56 来源：站长之家

　　Project Rumi 是微软的一个项目，旨在通过解决大型语言模型(LLM)理解非语言线索和上下文细微差别的局限性，增强 LLM 的能力。

　　该项目将非语言线索融入基于提示的 LLM 交互中，以提高交流的质量。研究人员使用音频和视频模型从数据流中检测实时的非语言线索。使用两个独立的模型分别从用户音频中提取声调和语音的语义信息。研究人员使用视觉转换器对视频进行编码，并从中识别面部表情。下游服务将非语言线索信息融入基于文本的提示中。这种多模态方法旨在增强用户情感和意图的理解，从而将人工智能与人类的互动提升到一个新的水平。

　　未来，研究人员计划改进模型的效率，并添加更多细节，如从标准视频中获取的心率变异性(HRV)和认知和环境感知。这是在下一波与人工智能的交互中增加无言意义和意图的更大努力的一部分。

　　要点:

　　1. Project Rumi 旨在通过增加语言模型对非语言线索和语境细微差别的理解能力，提升大型语言模型的能力。

　　2. 该项目采用多模态方法，通过音频和视频模型检测实时的非语言线索，以提高与语言模型的交互质量。

　　3. 未来的研究计划包括进一步改进模型，并添加心率变异性和环境感知等更多细节，以实现与人工智能的更深层次的交互。

　　文章内容仅供阅读，不构成投资建议，请谨慎对待。投资者据此操作，风险自担。

海报生成中...