景联文科技高质量大模型训练数据汇总！

作者：景联文数据标注发布时间：2024-04-09

国内AI大模型大语言模型

3月25日，2024年中国发展高层论坛年会上，国家数据局局长刘烈宏在“释放数据要素价值，助力可持续发展”的演讲中表示，中国10亿参数规模以上的大模型数量已超100个。

当前，国内AI大模型发展仍面临诸多困境。其中，较为突出的就是高质量数据集的匮乏，这极大阻碍了大模型效果提升。特别是专业的行业应用数据集，其获取难度更大，这导致大模型可使用的数据量受到限制，进而对大模型效果形成阻碍。

景联文科技是大语言模型数据供应商，致力于为不同阶段的模型算法匹配高质量数据资源。

世界知识类书籍、期刊、论文及高价值社区文本数据：

l 中文书籍 250W本

l 高质量外文文献期刊 8500W篇

l 英文高质量电子书 200W本

教育题库：

l K12教育题库 1800万

l 大学题库 1.1亿,800万带解析

l 英文题库 500W

专业知识类期刊、专利、代码：

l 中文数字专利 4000万

l 程序代码（代码注释） 20万

多轮对话：

l 文本多轮对话 1500万

l 中英文剧本（电影、电视剧、剧本杀） 6万

音频数据：

l 普通话 65W小时

图片生成及隐式/显示推理多模态数据：

l 图文复杂描述 600万

l 图文推理问答对 600万

生物数据：

l 核酸库 4000W

l 蛋白库 50W

l 蛋白结构库 19W

l 通路库 1000W

l 生信工具

药学数据：

l 药物研发数据库 1300万

l 全球上市数据库 80万

l 一致性评价数据库 25万

l 生产检验数据库 40万

l 合理用药 300万

l 多维文献 1亿

l 原料药数据库 1100万

化学数据：

l 化合物数据库 1.6亿

l 反应信息数据库 4100万

l 物化性质数据库 1.6亿

l 谱图数据库 20万

l 晶体信息数据库 100万

l 安全信息数据库 180万

l 商品信息数据库 740万

材料数据：

l 金属材料数据 20万

l 纳米材料数据 30万

l 相图数据 6万

l 材料性能数据 20万

l 材料腐蚀数据

l 表面处理数据

l 焊接材料数据

专利数据：

l 全球专利基础著录数据 1.3亿

l 全球专利原文数据 1亿

l 全球专利附图数据

l 全球专利法律状态数据

l 全球专利引文数据

l 全球专利分类索引数据

l 全球专利重点申请人工商关联数据

l 全球生化医药专利深加工数据

l 全球专利全文数据

医疗器械数据：

l 国内政策法规数据 3k条

l 行业标准数据

l 中国医疗器械审评数据 20W条

l 中国医械临床试验数据 5K条

l 全球医械临床试验数据 7W

l 医用耗材中标数据 1400W

l 医用耗材带量采购数据 400W

l 医用设备招投标数据38W

同时景联文科技提供大模型训练数据的标注服务，致力于为全球数千家人工智能从业公司和高校科研机构交付海量、高质量的多模态大模型训练数据。

景联文科技｜数据采集｜数据标注｜大语言模型训练数据

助力人工智能技术，赋能传统产业智能转型升级

文章图文著作权归景联文科技所有，商业转载请联系景联文科技获得授权，非商业转载请注明出处。

相关资讯

近期资讯

SIE CEO：PS5硬件质量过硬会有很长的生命周期

西野英明表示，PS5的生命周期延长不会影响新硬件的推出时机，新技术的引入与技术进步紧密相连。索尼希望在现有硬件继续提供娱乐的同时，引入新技术，逐步扩展整个生态系统。关于PS5Pro的筹备，西野英明则认为产品的推出需要平衡技术、价格和时机，索尼始终在考虑何时推出产品最符合市场需求。

游侠网 2024-12-30

央视《焦点访谈》：岚图汽车彰显中国先进智造实力

工厂屋顶上一排排整齐排列的太阳能光伏板，年发电量2000万千瓦时；车间内935台机器人协同作业、如臂使指；AGV智能搬运机器人满载零部件，沿既定轨道驶向装配生产线；总装车间内，每118秒，就有一辆汽车从智能流水线诞生……12月28日晚黄金时段，中央电视台《焦点访谈》栏目特别策划的《信心2024》制造业专题开播，岚图汽车高端智造工厂、岚图...

中新汽车 2024-12-30

用AI之眼探索万物，支付宝上线“探一下”

12月30日，支付宝推出新一代AI视觉搜索产品“探一下”，基于自研的多模态大模型技术，可“用AI之眼探索万物”，提供更快速、有用、趣味的生成式搜索服务。用户遇到感兴趣的事物，就能让AI通过摄像头，识别花草宠物和潮玩、做旅游的随身讲解、查询商品药品详情等，还能趣味解读萌宠照、宝宝照等，晒图不愁配文案。

扬子晚报 2024-12-30

英伟达押注下一个增长点：“人形机器人大脑”Jetson Thor预计明年上半年上市

面对芯片业务日益激烈的竞争，英伟达正在押注机器人技术作为其下一轮增长的主要驱动力。12月29日，《金融时报》报道，英伟达将在2025年进一步加大对机器人技术的投入，在明年上半年推出新一代用于人形机器人的紧凑型计算机JetsonThor。

华尔街见闻 2024-12-30

在轨实施181个项目！报告首次发布→

据中国载人航天工程办公室消息，12月30日，在即将迎来中国空间站全面建成两周年之际，该办公室首次公开发布《中国空间站科学研究与应用进展报告》（2024年）（以下简称《报告》）。

光明网 2024-12-30

用友：20个“关键词”解码2024大型企业数智化

2024年是大型企业数智化转型的加速之年，我们见证了大型企业数智化转型的跨越式发展!AI、大数据、云计算快速发展，成为企业数智化核心技术，众多领先企业积极探索技术与应用的融合，持续提升运营效率与决策精准度。

中国财富网 2024-12-30

Magic7 RSR保时捷亮相，荣耀宣布全面升级大王影像

近日，荣耀Magic7RSR保时捷设计及影像技术发布会上，荣耀正式宣布Magic7系列将全面升级“大王影像”，以人性化的摄影体验为核心目标，重塑摄影体验新境界。全新端侧AIRAW大模型技术，让手机可以充分释放传感器极限解析力，重点提升12x-30x焦段中高倍望远拍摄的照片画质。

三湘都市报 2024-12-30

二次元风拉满！华硕ROG STRIX Z890-H GAMING WIFI S主板图赏

快科技12月30日消息，华硕近日推出了ROGSTRIXZ890-HGAMINGWIFIS主板。现在这款新品已经来到我们评测室，下面为大家带来图赏。华硕ROGSTRIXZ890-HGAMINGWIFIS主板拥有强悍的供电解决方案。主板正面及背面多处融入RO姬身影，还有相关主题配件，二次元风拉满。

驱动之家 2024-12-30

科创解码｜对话张波：新材料助力绿水青山，“绿氢”来了

地球上70%是水，水里是氢和氧，这样看来氢的含量非常多。怎么把这个成本降下来？张波说，如果用了更低价格的绿电产出来的氢气，比如一度电降到两毛钱以内，一公斤氢气10块钱都不到，那交通成本的价格也会降下来，氢能燃料电池汽车也有望更加普及、走向社会。

东方网 2024-12-30

微星发布全新显示器型号MPG-325CQRXF 支持AI Vision

这款产品配备了一块31.5英寸的RapidVA曲面屏，其曲率为1000R，分辨率达到2560x1440，并且支持刷新率在48至280Hz之间。响应时间达到0.5msGTG，最大亮度可达350cd/m2，峰值亮度可达到400cd/m2。

中关村在线 2024-12-30

景联文科技高质量大模型训练数据汇总！

推荐体验

相关资讯

高质量训练数据助力大语言模型摆脱数据困境 | 景联文科技

景联文科技提供高质量医疗健康AI大模型数据

景联文科技：以高质量数据赋能文生图大模型

高质量数据赋能大模型应用落地，景联文科技提供海量AI大模型数据

景联文科技：为AI大模型提供高质海量训练数据

近期资讯

SIE CEO：PS5硬件质量过硬会有很长的生命周期

央视《焦点访谈》：岚图汽车彰显中国先进智造实力

用AI之眼探索万物，支付宝上线“探一下”

英伟达押注下一个增长点：“人形机器人大脑”Jetson Thor预计明年上半年上市

在轨实施181个项目！报告首次发布→

用友：20个“关键词”解码2024大型企业数智化

Magic7 RSR保时捷亮相，荣耀宣布全面升级大王影像

二次元风拉满！华硕ROG STRIX Z890-H GAMING WIFI S主板图赏

科创解码｜对话张波：新材料助力绿水青山，“绿氢”来了

微星发布全新显示器型号MPG-325CQRXF 支持AI Vision

推荐体验

AIGC重要产品

AI对话：类ChatGPT产品体验

好用的AI绘画工具

火热的AIGC产品

AIGC近期要闻

大公司发布的大模型产品都有哪些？

政府对AIGC的扶持政策

AIGC对就业的影响：我们会失业吗？

AIGC产业影响

AIGC对内容创作的影响

AIGC对绘画设计领域的影响

AIGC对各行各业的影响