2023-09-26 11:41:17 作者:姚立伟
美国人工智能研究公司OpenAI近日宣布其AI聊天机器人工具ChatGPT具有了“看、听、说”能力,意味着这款聊天机器人可以同时接收图像和语音输入并进行语音回复。ChatGPT是OpenAI于2022年11月30日推出的一种新型AI聊天机器人工具,可根据用户的要求快速生成文章、故事、歌词、散文、笑话,甚至代码,并回答各类疑问。 OpenAI表示,将逐步部署以上的语音和图像功能。语音功能可以在iOS和Android平台上推出,用户可以进行语音对话,提供更直观的交互方式。该功能由一个新的文本转语音模型提供支持,能够通过文本和几秒钟的语音样本生成类似人类的音频,与专业配音演员合作,提供5种可供用户自行选择的声音。此外,该功能还能使用开源语音识别系统Whisper,将用户说的话转录成文本。 另一方面,新功能允许用户上传图像与ChatGPT交互,支持上传多张图像。如果要聚焦图像的特定部分,可以使用移动应用中的绘图工具。 这些模型将语言推理能力应用于各种图像,如照片、屏幕截图以及包含文字和图像的文档。OpenAI表示,GPT-4是OpenAI在今年3月14日推出的最新一代大型语言模型。它是一个多模态大型语言模型,支持图像和文本输入,以文本形式输出;扩写能力增强,能处理超过25000个单词的文本;更具创造力,并且能够处理更细微的指令。