IT之家 2024年09月13日
谷歌推出 DataGemma:基于可信数据源提高 AI 准确度,减少幻觉
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_guoji1.html

 

谷歌基于谷歌数据共享中的真实数据,推出DataGemma模型新版本,该模型利用两种关键技术提升准确性,减少幻觉现象,研究团队已发表相关论文。

🧐DataGemma模型基于谷歌数据共享的真实世界统计数据,汇集了超2400亿个数据点,这为提升模型准确性提供了坚实基础,确保其输出基于真实可信的信息。

💡DataGemma方法的核心在于检索交错生成(RIG)和检索增强生成(RAG)两种关键技术。RIG通过主动查询可信来源再生成回答,确保回答中穿插实时统计数据的准确性。

📑RAG在生成回答前从数据共享平台检索相关信息,借助长上下文窗口提升回答质量,引入表格和脚注提供更深层次上下文,减少虚构内容出现。

IT之家 9 月 13 日消息,科技媒体 maginative 昨日(9 月 12 日)发布博文,报道谷歌公司基于谷歌数据共享(Data Commons)中的真实世界统计数据,推出了开放权重 Gemma 模型的新版本  DataGemma。

语言模型当前面临的一大难题就是幻觉(Hallucinations),尤其是大语言模型(LLMs)在处理数值或统计数据时,这一问题变得尤为棘手,因此精确性至关重要。

谷歌的 Data Commons 是一个存储库,汇集了来自联合国和疾病控制与预防中心等可信组织收集的超过 2400 亿个数据点。

通过利用这一庞大的统计数据集,基于 Gemini 的 DataGemma 能够显著提升模型准确性,确保其输出基于真实可信的现实世界信息。

DataGemma 方法的核心在于两种关键技术:检索交错生成(RIG)和检索增强生成(RAG)。这两种方法通过在生成过程中将模型基于现实世界数据,从而减少幻觉现象。

IT之家简要介绍两项技术如下:

RIG:

通过主动查询可信来源,再生成回答的方式运作。在接收到提示词之后,DataGemma 会识别查询中的统计数据点,并从数据共享平台获取准确信息。

例如,若被问及“全球可再生能源的使用量是否有所增加?”,该模型会在回答中穿插实时统计数据,确保事实准确性。

RAG:

在生成回答之前,会从数据共享平台检索相关信息,进一步提升了回答的质量。借助其长上下文窗口(由 Gemini 1.5 Pro 实现),DataGemma 确保了回答的全面性,引入了表格和脚注以提供更深层次的上下文,从而减少了虚构内容的出现。

谷歌对 RIG 和 RAG 的研究尚处于初期阶段,但初步成果令人鼓舞。通过将现实世界数据嵌入回复中,DataGemma 模型在处理数值事实和统计查询方面展现出显著提升。研究团队已发表论文详述其方法,强调这些技术如何帮助 LLMs 判断何时依赖外部数据与内部参数。

Fish AI Reader

Fish AI Reader

AI辅助创作,多种专业模板,深度分析,高质量内容生成。从观点提取到深度思考,FishAI为您提供全方位的创作支持。新版本引入自定义参数,让您的创作更加个性化和精准。

FishAI

FishAI

鱼阅,AI 时代的下一个智能信息助手,助你摆脱信息焦虑

联系邮箱 441953276@qq.com

相关标签

DataGemma 谷歌 语言模型 RIG RAG
相关文章