0
  • 聊天消息
  • 系统消息
  • 评论与回复
登录后你可以
  • 下载海量资料
  • 学习在线课程
  • 观看技术视频
  • 写文章/发帖/加入社区
会员中心
创作中心

完善资料让更多小伙伴认识你,还能领取20积分哦,立即完善>

3天内不再提示

细粒度图像识别深度学习开源工具库Hawkeye解析

新机器视觉 来源:机器之心 作者:机器之心 2022-11-06 20:26 次阅读
加入交流群
微信小助手二维码

扫码添加小助手

加入工程师交流群

细粒度图像识别是视觉感知学习的重要研究课题,在智能新经济和工业互联网等方面具有巨大应用价值,且在诸多现实场景已有广泛应用…… 鉴于当前领域内尚缺乏该方面的深度学习开源工具库,南京理工大学魏秀参教授团队用时近一年时间,开发、打磨、完成了 Hawkeye——细粒度图像识别深度学习开源工具库,供相关领域研究人员和工程师参考使用。本文是对 Hawkeye 的详细介绍。

目录

1. 什么是 Hawkeye 库

2. Hawkeye 支持的模型及方法

3. 安装 Hawkeye

4. 使用 Hawkeye 训练模型

1. 什么是 Hawkeye 库

Hawkeye 是一个基于 PyTorch 的细粒度图像识别深度学习工具库,专为相关领域研究人员和工程师设计。目前,Hawkeye 包含多种代表性范式的细粒度识别方法,包括 “基于深度滤波器”、“基于注意力机制”、“基于高阶特征交互”、“基于特殊损失函数”、“基于网络数据” 以及其他方法。

Hawkeye 项目代码风格良好,结构清晰易读,可拓展性较强。对于刚接触细粒度图像识别领域的相关人员而言,Hawkeye 较易上手,便于其理解细粒度图像识别的主要流程和代表性方法,同时也方便在本工具库上快速实现自己的算法。此外,我们还给出了库中各模型的训练示例代码,自研方法也可按照示例快速适配并添加至 Hawkeye 中。

Hawkeye 开源库链接:https://github.com/Hawkeye-FineGrained/Hawkeye

2. Hawkeye 支持的模型及方法

Hawkeye 目前支持细粒度图像识别中主要学习范式的共 16 个模型与方法,具体如下:

基于深度滤波器

S3N (ICCV 2019)

Interp-Parts (CVPR 2020)

ProtoTree (CVPR 2021)

基于注意力机制

OSME+MAMC (ECCV 2018)

MGE-CNN (ICCV 2019)

APCNN (IEEE TIP 2021)

基于高阶特征交互

BCNN (ICCV 2015)

CBCNN (CVPR 2016)

Fast MPN-COV (CVPR 2018)

基于特殊损失函数

Pairwise Confusion (ECCV 2018)

API-Net (AAAI 2020)

CIN (AAAI 2020)

基于网络数据

Peer-Learning (ICCV 2021)

其他方法

NTS-Net (ECCV 2018)

CrossX (ICCV 2019)

DCL (CVPR 2019)

3. 安装 Hawkeye

安装依赖

使用 conda 或者 pip 安装相关依赖:

Python 3.8

PyTorch 1.11.0 or higher

torchvison 0.12.0 or higher

numpy

yacs

tqdm

克隆仓库:

git clone https://github.com/Hawkeye-FineGrained/Hawkeye.git

cd Hawkeye

准备数据集

首先,下载一个数据集(以 CUB200 为例):

cd Hawkeye/data

wget https://data.caltech.edu/records/65de6-vp158/files/CUB_200_2011.tgz

mkdir bird && tar -xvf CUB_200_2011.tgz -C bird/

我们提供了上述 8 个数据集的 meta-data 文件,能够匹配库中的 FGDataset 方便地加载训练集和测试集,训练集和测试集为各个数据集官方提供的划分。使用不同数据集时,只需在实验的 config 文件中修改 dataset 配置即可,方便切换。

在实验的 config 文件中修改 dataset 配置,示例如下:

dataset:

name: cub

root_dir: data/bird/CUB_200_2011/images

meta_dir: metadata/cub

4. 使用 Hawkeye 训练模型

对于 Hawkeye 支持的每个方法,我们均提供了单独的训练模板和配置文件。例如训练 APINet 只需一条命令:

python Examples/APINet.py --config configs/APINet.yaml

实验的参数都在相应的 yaml 文件中,可读性高、便于修改,如:

experiment:
name: API_res101 2        # 实验名称
  log_dir: results/APINet   # 实验日志、结果等的输出目录
  seed: 42                  # 可以选择固定的随机数种子
#  resume: results/APINet/API_res101 2/checkpoint_epoch_19.pth    # 可以从训练中断的 checkpoint 中恢复训练
dataset:
  name: cub          # 使用 CUB200 数据集
  root_dir: data/bird/CUB_200_2011/images   # 数据集中图像放置的路径
  meta_dir: metadata/cub                  # CUB200 的 metadata 路径
  n_classes: 10         # 类别数,APINet 需要的数据集
  n_samples: 4          # 每个类别的样本数
  batch_size: 24        # 测试时的批样本数
  num_workers: 4      # Dataloader 加载数据集的线程数
  transformer:        # 数据增强的参数配置
    image_size: 224      # 图像输入模型的尺寸 224x224
    resize_size: 256    # 图像增强前缩放的尺寸 256x256
model:
  name: APINet        # 使用 APINet 模型,见 `model/methods/APINet.py`
  num_classes: 200      # 类别数目
#  load: results/APINet/API_res101 1/best_model.pth     # 可以加载训练过的模型参数
train:
  cuda: [4]          # 使用的 GPU 设备 ID 列表,[] 时使用 CPU
  epoch: 100        # 训练的 epoch 数量
  save_frequence: 10    # 自动保存模型的频率
#  val_first: False      # 可选是否在训练前进行一次模型精度的测试
  optimizer:
    name: Adam        # 使用 Adam 优化器
    lr: 0.0001        # 学习率为 0.0001
    weight_decay: 0.00000002
  scheduler:
    # 本例使用自定义组合的 scheduler,由 warmup 和余弦退火学习率组合而成,见 `Examples/APINet.py`
    name: ''
    T_max: 100        # scheduler 的总迭代次数
    warmup_epochs: 8    # warmup 的 epoch 数
    lr_warmup_decay: 0.01  # warmup 衰减的比例
  criterion:
    name: APINetLoss    # APINet 使用的损失函数,见 `model/loss/APINet_loss.py`

实验的主程序 Examples/APINet.py 中的训练器 APINetTrainer 继承自 Trainer,不需要再写复杂的训练流程、logger、模型保存、配置加载等代码,只用按需修改部分模块即可。我们也提供了训练阶段的多个 hook 钩子,可以满足一些方法特别的实现方式。

日志文件、模型权重文件、训练使用的训练代码以及当时的配置文件都会保存在实验输出目录 log_dir 中,备份配置和训练代码便于日后对不同实验进行对比。

审核编辑:郭婷

声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表电子发烧友网立场。文章及其配图仅供工程师学习之用,如有内容侵权或者其他违规问题,请联系本站处理。 举报投诉
  • 代码
    +关注

    关注

    30

    文章

    4986

    浏览量

    74642
  • 深度学习
    +关注

    关注

    73

    文章

    5614

    浏览量

    124876

原文标题:基于PyTorch、易上手,细粒度图像识别深度学习工具库Hawkeye开源

文章出处:【微信号:vision263com,微信公众号:新机器视觉】欢迎添加关注!文章转载请注明出处。

收藏 人收藏
加入交流群
微信小助手二维码

扫码添加小助手

加入工程师交流群

    评论

    相关推荐
    热点推荐

    RetinaNet深度学习模型突破航空图像目标检测难题

    深度学习模型交出了亮眼的答卷——它让One-stage检测器超越了传统Two-stage方法的精度,成为了航空图像分析领域的重要工具
    的头像 发表于 05-15 09:23 2321次阅读
    RetinaNet<b class='flag-5'>深度</b><b class='flag-5'>学习</b>模型突破航空<b class='flag-5'>图像</b>目标检测难题

    做企业级数据权限管理,工具应该怎么选?为什么 NineData 值得作为核心选型参考

    企业数据权限治理需要专业工具而非零散方案。NineData作为数据平台型工具,围绕权限生命周期设计,提供细粒度权限控制、审批流程、期限管
    的头像 发表于 03-23 14:18 776次阅读
    做企业级数据<b class='flag-5'>库</b>权限管理,<b class='flag-5'>工具</b>应该怎么选?为什么 NineData 值得作为核心选型参考

    如何让ResNet50图像识别模型在光计算硬件上飞快运行

    你可能每天都在用图像识别:手机相册自动归类、刷脸支付、甚至智能相机的宠物模式。但你有没有想过,这些“一眼认出”的本领,是怎么教出来的?
    的头像 发表于 03-09 14:21 483次阅读

    安防监控系统如何实现AI智能识别

    不可替代的价值。 一、智能感知:从“像素”到“语义”的跨越 目标精准检测与分类 系统实时识别画面中的人、车、物等目标,并细粒度区分(如人员/车辆/动物、轿车/货车/非机动车)。在周界防护场景中,自动过滤飞鸟、落叶等干扰源
    的头像 发表于 02-02 13:39 446次阅读

    海康威视矾花图像识别智能系统推动水质处理精细化管控

    为了解决这个痛点,海康威视推出矾花图像识别智能系统——为水处理提质增效,告别单一“肉眼判断”时代。
    的头像 发表于 01-10 16:08 2820次阅读

    深度解析淘宝拍立淘按图搜索API接口与JSON数据示例参考

    引言 淘宝拍立淘是淘宝推出的一项基于图像识别的搜索功能,用户可以通过上传图片来搜索相似商品。淘宝开放平台提供了拍立淘按图搜索API接口,帮助开发者实现图像搜索功能。本文将深度解析淘宝拍
    的头像 发表于 11-06 13:43 516次阅读

    大规模专家并行模型在TensorRT-LLM的设计

    DeepSeek-V3 / R1 等模型采用大规模细粒度混合专家模型 (MoE) 架构,大幅提升了开源模型的质量。Llama 4 和 Qwen3 等新发布的开源模型的设计原则也采用了类似的大规模
    的头像 发表于 09-06 15:21 1606次阅读
    大规模专家并行模型在TensorRT-LLM的设计

    精准定位性能瓶颈:深入解析 PaddleOCR v3.2 全新 Benchmark 功能

    v3.2 给出了一个非常实用的解决方案——全新的 细粒度 Benchmark 功能。它不仅能测量端到端的整体速度,还能拆解到每个模块、每个关键方法的耗时,帮你一眼锁定性能瓶颈。结果支持控制台直观展示,也能导出为 CSV 方便后续可视化和分析。有了这个工具,性能
    的头像 发表于 09-05 16:02 1563次阅读
    精准定位性能瓶颈:深入<b class='flag-5'>解析</b> PaddleOCR v3.2 全新 Benchmark 功能

    基于米尔MYC-YM90X安路飞龙DR1开发板仪表图像识别系统开发

    预处理和特征提取等功能进行 FPGA 硬件设计,生成比特流文件;在 FD 环境中开发 ARM 侧的应用程序,实现系统整体控制与图像识别算法的高层执行。 2.2.2 驱动与支持 官方提供了丰富
    发表于 08-17 21:29

    华怡丰推出ISC-B/C系列图像识别传感器

    在工业自动化领域,精准、高效的视觉检测是提升生产效率的关键。华怡丰全新推出的ISC-B/C系列图像识别传感器集高精度定位、测量算法与先进图像处理技术于一体,为各类工业场景提供稳定、可靠的解决方案!
    的头像 发表于 08-15 11:36 2168次阅读
    华怡丰推出ISC-B/C系列<b class='flag-5'>图像识别</b>传感器

    Commvault Cloud平台如何应对勒索软件攻击

    在之前的文章中,我们探讨了可能影响AD小规模中断的因素,例如意外删除对象等,以及为何快速、细粒度的恢复至关重要。
    的头像 发表于 07-29 15:07 990次阅读

    火车车号图像识别系统如何应对不同光照条件下的识别问题?

    在铁路运输管理中,准确识别火车车号是实现自动化车辆管理的关键环节。然而,实际应用场景中复杂多变的光照条件给车号识别带来了巨大挑战。现代火车车号图像识别系统通过多项技术创新,有效解决了这一难题。 多
    的头像 发表于 07-15 11:37 1040次阅读
    火车车号<b class='flag-5'>图像识别</b>系统如何应对不同光照条件下的<b class='flag-5'>识别</b>问题?

    深度学习遇上嵌入式资源困境,特征空间如何破局?

    近年来,随着人工智能(AI)技术的迅猛发展,深度学习(Deep Learning)成为最热门的研究领域之一。在语音识别图像识别、自然语言处理等领域,
    发表于 07-14 14:50 1357次阅读
    当<b class='flag-5'>深度</b><b class='flag-5'>学习</b>遇上嵌入式资源困境,特征空间如何破局?

    【高云GW5AT-LV60 开发套件试用体验】基于开发板进行深度学习实践,并尽量实现皮肤病理图片的识别

    收到开发板已经有一段时间了,最初申请的时候写的是希望能够实现基于fpga的图像识别相关的项目,最初对这个还是有些模糊的,不过这几天折腾下来,似乎有点思路了,但是毕竟基础还是有点薄弱,所以废话不多
    发表于 06-11 22:35