中文翻译

摘要: 摘要:

OpenAI展示ChatGPT全新语音和图像处理功能,可通过语音对话和图像上传完成文件填写工作,将AI转变为能看、能听、会思考的个人助手。该功能于2023年9月向Plus和Enterprise用户推出,2024年5月发布GPT-4o,整合实时语音、视觉和文本交互。此功能有望解决医疗、法律、金融等行业的文档处理效率问题,目前仅向付费用户开放。

正文


OpenAI展示ChatGPT全新语音和图像处理功能

现场演示展示了ChatGPT如何通过语音对话和图像上传来填写文件,推动这款AI助手更深入地融入现实工作流程。

编辑团队

添加我们到Google


OpenAI刚刚展示了一项成果,让标准的聊天机器人体验显得过时。在新一轮展示中,该公司展示了ChatGPT如何结合语音对话和图像上传来完成实际文件填写工作,有效地将这款AI转变为更接近个人助手的存在——能够看到、听到并实时处理文档。

从文本框到多模态工作助手

演示重点突出了ChatGPT处理上传文档图像的同时进行语音对话的能力。想象一下,你正在给一位极其耐心、反应超快的助手打电话,这位助手可以查看你的文件、理解其中的要求,并通过自然对话帮助你填写完成。

该公司于2023年9月25日开始向ChatGPT Plus和Enterprise用户推出语音和图像功能。语音模式在推出时通过语音识别和文本转语音技术实现自然对话,最初提供五种合成语音。由GPT-4V等多模态模型驱动的图像处理功能允许用户上传照片,供AI进行分析和解读。

2024年5月13日,OpenAI发布了GPT-4o,将实时语音、视觉和文本交互整合到单一模型中。发布时包含现场演示,展示该模型如何引导用户解决纸上可见的算术问题,并解读复杂文档。

为什么填写表格这件事真正重要

这对专业工作流程的影响意义重大。文档分析、表格填写和行政任务在医疗、法律、金融和教育等行业消耗大量时间。一款能够通过上传图像查看实物文档、理解其结构,并通过语音引导用户完成填写的AI,正在解决真正的生产力瓶颈。

OpenAI的高级语音模式和增强的视觉能力在整个2024年持续扩展,并延续到2025年,但最初仅向付费用户开放。

声明:

本文由编辑团队编辑。欲了解更多关于我们创建和审核内容的信息,请参阅我们的编辑政策。


翻译要点说明:

  • "multimodal workhorse" 译为"多模态工作助手",既保留技术含义又便于理解
  • "productivity bottleneck" 译为"生产力瓶颈",为标准专业术语
  • "paid tiers" 译为"付费用户",避免直译为"付费层级"
  • 时间格式保持原文风格
  • 广告部分"Add us on Google"保留英文,因其是产品名称

来源: Brave/cryptobriefing.com

采集时间: 2026-05-23 20:17:51

AIGPTChatGPTOpenAIGoogle多模态人工智能