苹果新专利曝光:多功能挂绳系统或改变设备携带方式Meta重组AI团队以加速产品开发摩托罗拉44亿美元收购Silvus创第二大并购纪录铂傲推出限量版Beosystem 3000c音响系统,经典与现代技术完美融合亚信科技、郑煤机集团组建合资公司 开创“矿山与装备制造数智运营”新模式拼多多发布2025第一季度财报 营收956.7亿元,同比增长10%“Microsoft 远程桌面”应用明起下架,微软推荐迁移至 Windows App云迹科技港交所申请上市,加速AI服务机器人多元化布局卢伟冰:小米电视放弃对规模数量的过度追求,专注做深技术联想推出新款小新 24 台式一体机:换用AMD 7 H 225、1080P 100Hz摩托罗拉Moto G56手机意外提前上架官网:联发科天玑7060、5200mAh电池全汉推出ATX 3.1 + 80 PLUS白金标准Flex ATX外形尺寸电源快手发布2025年第一季度财报 营收同比增长 10.9%消息称三星电子调整 HBM 团队组织架构,押宝定制化产品iQOO 推出海外版 Neo 10 手机,换装骁龙8s Gen4处理器阳光新能源:设计驱动绿色生活,开创别墅能源新纪元联力推出HYDROSHIFT II LCD CURVED一体式水冷散热器阿里巴巴与SAP达成战略合作 加速企业数字化转型博通推出第三代CPO技术,带宽翻倍至每通道200GbpsDirect3D-S2横空出世!千兆级3D生成提速近10倍,AI建模进入新纪元! 苹果新专利曝光:多功能挂绳系统或改变设备携带方式Meta重组AI团队以加速产品开发摩托罗拉44亿美元收购Silvus创第二大并购纪录铂傲推出限量版Beosystem 3000c音响系统,经典与现代技术完美融合亚信科技、郑煤机集团组建合资公司 开创“矿山与装备制造数智运营”新模式拼多多发布2025第一季度财报 营收956.7亿元,同比增长10%“Microsoft 远程桌面”应用明起下架,微软推荐迁移至 Windows App云迹科技港交所申请上市,加速AI服务机器人多元化布局卢伟冰:小米电视放弃对规模数量的过度追求,专注做深技术联想推出新款小新 24 台式一体机:换用AMD 7 H 225、1080P 100Hz摩托罗拉Moto G56手机意外提前上架官网:联发科天玑7060、5200mAh电池全汉推出ATX 3.1 + 80 PLUS白金标准Flex ATX外形尺寸电源快手发布2025年第一季度财报 营收同比增长 10.9%消息称三星电子调整 HBM 团队组织架构,押宝定制化产品iQOO 推出海外版 Neo 10 手机,换装骁龙8s Gen4处理器阳光新能源:设计驱动绿色生活,开创别墅能源新纪元联力推出HYDROSHIFT II LCD CURVED一体式水冷散热器阿里巴巴与SAP达成战略合作 加速企业数字化转型博通推出第三代CPO技术,带宽翻倍至每通道200GbpsDirect3D-S2横空出世!千兆级3D生成提速近10倍,AI建模进入新纪元!
  • 首页 > 云计算频道 > 大模型

    苹果研究人员提出MAD-Bench基准,克服多模态大语言模型中幻觉和误导性提示

    2024年03月01日 17:02:04   来源:站长之家

      (ChinaZ.com)3月1日 消息:在人工智能领域,多模式大语言模型(MLLMs)在推动进步方面发挥了巨大作用,但它们面临处理误导性信息的挑战,可能导致不正确或产生幻觉的响应。这种脆弱性引发了对MLLM在需要准确解释文本和视觉数据的应用中可靠性的担忧。

      最近的研究探讨了使用MLLMs进行视觉指导调整、引用和基础、图像分割、图像编辑以及图像生成的方法。像GPT-4V和Gemini这样的专有系统的推出进一步推动了MLLM研究。关于MLLM中的幻觉的研究主要集中在通过提示工程和模型增强来缓解问题。MLLM中的各种幻觉包括描述不存在的对象、误解空间关系以及错误计数对象等。这些挑战突显了当前人工智能能力中的重大差距。

      苹果的研究人员提出了MAD-Bench,这是一个经过策划的基准,包含850个图像提示对,用于评估MLLMs在文本提示和图像之间处理一致性的能力。受评估的包括GPT-4V等热门MLLMs以及开源模型如LLaVA-1.5和CogVLM,揭示了MLLMs在处理误导性指令方面的脆弱性。

      数据集包括六类欺骗:对象计数、不存在的对象、对象属性、场景理解、空间关系和视觉混淆。视觉混淆类别使用欺骗性的提示和图像,包括3D绘画、视觉错位摄影和镜面反射。使用GPT-4生成了误导性提示,并使用COCO数据集的地面真实标题手动过滤以确保符合欺骗性标准并与相关图像相关。

      结果显示,GPT-4V在场景理解和视觉混淆类别中的表现更好,准确率超过90%。支持边界框输入和输出的模型在处理不存在的对象时可能更好地服务于基准。此外,GPT-4V对视觉数据有更复杂的理解,不容易受到不准确信息的误导。不正确响应的常见原因包括错误的对象检测、冗余对象识别、对非可见对象的推断以及不一致的推理。研究强调,通过战略性的提示设计,可以增强AI模型对试图误导或混淆它们的尝试的鲁棒性。

      这项研究揭示了MLLMs对误导性提示的脆弱性问题,并提出了一个有望解决这一问题的解决方案,即MAD-Bench基准。该基准提高了模型的准确性,为未来研究开发更可靠、值得信赖的MLLMs铺平了道路。作为一个不断发展的领域,解决这些挑战对于在现实应用中部署MLLMs至关重要。

      文章内容仅供阅读,不构成投资建议,请谨慎对待。投资者据此操作,风险自担。

    即时

    vivo携手首届商学院戈壁友谊赛,以专业影像见证无畏征途

    2025年5月4日,首届商学院戈壁友谊赛于甘肃省酒泉市圆满举办。在这场4天121公里的戈壁征途中,vivo作为战略合作伙伴,为赛事提供手机、智能穿戴设备及定制影像服务,以技术赋能助力参赛选手与观众记录戈壁之上的热血奔赴,共同探索科技进步、商业文明与自然共生的未来路径。

    新闻

    明火炊具市场:三季度健康属性贯穿全类目

    奥维云网(AVC)推总数据显示,2024年1-9月明火炊具线上零售额94.2亿元,同比增加3.1%,其中抖音渠道表现优异,同比有14%的涨幅,传统电商略有下滑,同比降低2.3%。

    企业IT

    重庆创新公积金应用,“区块链+政务服务”显成效

    “以前都要去窗口办,一套流程下来都要半个月了,现在方便多了!”打开“重庆公积金”微信小程序,按照提示流程提交相关材料,仅几秒钟,重庆市民曾某的账户就打进了21600元。

    3C消费

    华硕ProArt创艺27 Pro PA279CRV显示器,高能实力,创

    华硕ProArt创艺27 Pro PA279CRV显示器,凭借其优秀的性能配置和精准的色彩呈现能力,为您的创作工作带来实质性的帮助,双十一期间低至2799元,性价比很高,简直是创作者们的首选。