当前位置:首页|资讯|AI大模型|人工智能|大语言模型

高质量数据赋能大模型应用落地,景联文科技提供海量AI大模型数据

作者:景联文数据标注发布时间:2024-04-10

随着人工智能技术的迅猛进步,AI算法持续创新突破,模型的复杂度不断攀升,呈现出爆炸性的增长态势。数据的重要性愈发凸显,已然成为AI大模型竞争的核心要素。

 


Dimensional Research的全球调研报告显示,72%的受访者认为,要确保模型的有效性和可靠性,至少需要使用超过10万条训练数据进行模型训练。96%的受访者在模型训练过程中都遭遇了诸如数据质量不佳、数量不足以及数据标注人员匮乏等难题。

 

景联文科技是大语言模型数据供应商,致力于为不同阶段的模型算法匹配高质量数据资源。

 

世界知识类书籍、期刊、论文及高价值社区文本数据:

l 中文书籍 250W本

l 高质量外文文献期刊 8500W篇

l 英文高质量电子书 200W本

 

教育题库:

l K12教育题库 1800万

l 大学题库 1.1亿,800万带解析

l 英文题库 500W

 

专业知识类期刊、专利、代码:

l 中文数字专利 4000万

l 程序代码(代码注释) 20万

 

专利数据:

l 全球专利基础著录数据 1.3亿

l 全球专利原文数据 1亿

l 全球专利附图数据

l 全球专利法律状态数据

l 全球专利法律状态数据

l 全球专利引文数据

l 全球专利分类索引数据

l 全球专利重点申请人工商关联数据

l 全球生化医药专利深加工数据

l 全球专利全文数据

 

多轮对话:

l 文本多轮对话 1500万

l 中英文剧本(电影、电视剧、剧本杀) 6万

 

音频数据:

l 普通话 65W小时

 

图片生成及隐式/显示推理多模态数据:

l 图文复杂描述 600万

l 图文推理问答对 600万

 

生物数据

l 核酸库 4000W

l 蛋白库 50W

l 蛋白结构库 19W

l 通路库 1000W

l 生信工具

 

药学数据:

l 药物研发数据库 1300万

l 全球上市数据库 80万

l 一致性评价数据库 25万

l 生产检验数据库 40万

l 合理用药 300万

l 多维文献 1亿

l 原料药数据库 1100万

 

化学数据:

l 化合物数据库 1.6亿

l 反应信息数据库 4100万

l 物化性质数据库 1.6亿

l 谱图数据库 20万

l 晶体信息数据库 100万

l 安全信息数据库 180万

l 商品信息数据库 740万

 

材料数据:

l 金属材料数据 20万

l 纳米材料数据 30万

l 相图数据 6万

l 材料性能数据 20万

l 材料腐蚀数据

l 表面处理数据

l 焊接材料数据

 

医疗器械数据:

l 国内政策法规数据 3k条

l 行业标准数据

l 中国医疗器械审评数据 20W条

l 中国医械临床试验数据 5K条

l 全球医械临床试验数据 7W

l 医用耗材中标数据 1400W

l 医用耗材带量采购数据 400W

l 医用设备招投标数据38W

 

同时景联文科技提供大模型训练数据的标注服务,致力于为全球数千家人工智能从业公司和高校科研机构交付海量、高质量的多模态大模型训练数据。

 

景联文科技|数据采集|数据标注|大语言模型训练数据

助力人工智能技术,赋能传统产业智能转型升级

 

文章图文著作权归景联文科技所有,商业转载请联系景联文科技获得授权,非商业转载请注明出处。

 

 

 



Copyright © 2024 aigcdaily.cn  北京智识时代科技有限公司  版权所有  京ICP备2023006237号-1