社区学习工具库休闲

简体中文

首页 > 科技周边 > 人工智能 > 移除ImageNet标签错误，模型排名发生大变化

移除ImageNet标签错误，模型排名发生大变化

WBOY

发布： 2023-04-12 17:46:11

转载

1159 人浏览过

此前，ImageNet 因为存在标签错误的问题而成为热门话题，这个数字说出来你可能会大吃一惊，至少有十万个标签是存在问题的。那些基于错误标签做的研究，很可能要推翻重来一遍。

由此看来管理数据集质量还是很重要的。

很多人会使用 ImageNet 数据集作为 benchmark，不过基于 ImageNet 预训练的模型，最终结果可能会因为数据质量而变化。

本文中，来自 Adansons 公司的工程师 Kenichi Higuchi 对《 Are we done with ImageNet? 》一文中的 ImageNet 数据集进行重新研究，在去除错误标签数据后，重新评估 torchvision 上发布的模型。

从 ImageNet 中删除错误数据并重新评估模型

本文将 ImageNet 中的标签错误分为三类，如下所示。

(1) 标注错误的数据

(2) 对应多个标签的数据

(3) 不属于任何标签的数据

总结来看，错误数据大约有 14000 多个，考虑评估数据的数量为 50000，可以看出错误数据占比极高。下图是一些有代表性的错误数据。

方法

在不重新训练模型的情况下，该研究通过只排除标注错误的数据，也就是上述（1）类错误数据，以及从评估数据中排除所有错误数据，也就是 (1)-(3) 错误数据，来重新检查模型的准确率。

为了删除错误数据，需要使用一个描述标签错误信息的元数据文件。在这个元数据文件中，如果包含 (1)-(3) 类错误，信息将在「correction」属性中描述。

该研究使用一款名为 Adansons Base 的工具，Adansons Base 通过将数据集链接到元数据来过滤数据。这里测试了 10 个模型，如下所示。

10 个用于测试的图像分类模型

结果

结果如下表所示（数值是以 % 为单位的精度，括号中的数字是排名）

10 个分类模型的结果

以 All Eval 数据为基线，排除错误数据类型(1)，准确率平均提高 3.122 分；排除所有错误数据 (1)～(3) ，准确率平均提高 11.743 分。

和预想的一样，排除错误数据，准确率全面提高，这一点毫无疑问，因为与干净数据相比，存在错误数据很容易出错。

当在不排除错误数据的情况下进行评估，以及错误数据(1)~(3) 都被排除时，模型的准确率排名发生了变化。

本文中，错误数据 (1) 有 3670 个，占全部 50000 条数据的 7.34%，移除后准确率平均提高了 3.22 点左右。当移除错误数据后，数据规模发生了变化，单纯的比较准确率可能存在偏差。

结论

尽管并未特别强调，但是在做评估训练时，使用准确标记的数据很重要。

在比较模型之间的准确率时，以前的研究可能得出错误的结论。所以应该先对数据进行评估，但这真的可以用来评估模型的性能吗？

许多使用深度学习的模型往往不屑于对数据进行反思，而是渴望通过模型的表现性能来提高准确性和其他评估指标，即使是评价数据中包含错误数据，也没进行准确的处理。

当创建自有的数据集时，比如在业务中应用 AI 时，创建高质量的数据集直接关系到提高 AI 的准确率和可靠性。本文的实验结果表明，仅仅提高数据质量就可以将准确率提高约 10 个百分点，这表明在开发 AI 系统时不仅要改进模型，还要改善数据集。

然而，保证数据集的质量并不容易。虽然增加元数据的数量以正确评估 AI 模型和数据的质量很重要，但管理起来可能很麻烦，尤其是对于非结构化数据。

以上是移除ImageNet标签错误，模型排名发生大变化的详细内容。更多信息请关注PHP中文网其他相关文章！

相关标签：

ai 模型

来源：51cto.com

上一篇：人工智能提升零售体验的五种方式下一篇：LLaMA模型惨遭泄漏，Meta版ChatGPT被迫「开源」！GitHub斩获8k星，评测大量出炉

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

作者最新文章

什么是 NullPointerException，如何修复它？

2024-10-22 09:46:29
从新手到程序员：您的旅程从 C 基础知识开始

2024-10-13 13:53:41
使用PHP解锁网络开发：初学者指南

2024-10-12 12:15:51
揭秘 C：为新程序员提供一条清晰简单的道路

2024-10-11 22:47:31
释放您的编码潜力：绝对初学者的 C 编程

2024-10-11 19:36:51
释放你内心的程序员：C 绝对初学者

2024-10-11 15:50:41
使用 C 自动化您的生活：适合初学者的脚本和工具

2024-10-11 15:07:41
PHP 变得简单：Web 开发的第一步

2024-10-11 14:21:21
使用 Python 构建任何东西：释放创造力的初学者指南

2024-10-11 12:59:11
编码的关键：为初学者释放 Python 的力量

2024-10-11 12:17:31

最新问题

在多个路由中声明的workerpool是否仍然可以保持其cpu使用率而不关心阈值我希望找到一个带有workerpool的node.js系统来处理CPU密集型任务，但是对于多条路由中的cpu使用情况，我有些困惑。一个场景是这样的：route1.js:constw...

来自于 2024-04-06 19:54:23

0

1

444

使用MySQL SQL查询计算另一张表中字段的总和我有一个这样的模式：具有属性“user_id”和“username”的用户表以及具有属性“customer_id”（user_id的FK）和“finalPrice”的订单表数据库架...

来自于 2024-04-06 19:39:29

0

1

441

无法从网站获取输入元素所以我试图从Twitter获取一个输入元素，但当我运行它时，它不断在节点终端中给我一个这样的错误，结果，由此代码创建的浏览器窗口将自行关闭，因为它找不到正确的输入选择器。如何获取正...

来自于 2024-04-06 18:59:57

0

1

442

在模板中使用在方法中定义的变量这是我第一次使用Vue（v2而不是v3），并且我一直在尝试在模板内使用变量（在方法内定义）。我的简化代码：<template><divclass="co...

来自于 2024-04-06 18:10:25

0

2

513

使用SCSS生成默认值和CSS变量我正在实现网站样式。出于遗留支持的原因，我需要支持IE11，至少一段时间。出于工作流程和我的理智原因，我想尽可能使用css变量。我已经研究过这个解决方案，它会生成一些有效的东西，但...

来自于 2024-04-06 17:46:54

0

1

355

相关专题

更多>

热门推荐

热门教程

更多>

相关教程

热门推荐

最新课程

最新ThinkPHP 5.1全球首发视频教程(60天成就PHP大牛线上培训班课)

1421626
php入门教程之一周学会PHP

4265901
JAVA 初级入门视频教程

2518371
小甲鱼零基础入门学习Python视频教程

506473
PHP 零基础入门教程

861564

最新下载

更多>

网站特效

网站源码

网站素材

前端模板