Oxford Robotics Institute | Robots
研究内容
Patch注意力软骨分割网络
研究团队针对膝关节磁共振图像软骨分割中,深度卷积神经网络尽管在精度提升上展现出潜力,但面对不规则形状的小样本时常常力不从心,容易遗漏软骨等重要特征的问题,提出了一种新型分割网络;该网络引入Patch注意力模块(含基于补丁的通道注意力和块内注意力子块,用以增强小目标检测)和特征聚合模块(融合编码器同层与解码器前一层特征),并在SKI-10和OAI两个公开数据集上评估,取得了令人满意的软骨分割性能。
分层多模态布局分析网络
研究团队针对文档布局分析中现有方法或单独依赖计算机视觉或自然语言处理,或未能充分融合两种模态的互补优势来丰富特征信息并增强目标检测的问题,提出了一种分层多模态网络(HiM,hierarchical multimodal)。该网络通过引入跨粒度的互补语义和非局部上下文依赖聚合代表性特征,并为不同模态适配了视觉和文本的注意力机制,随后将多模态特征自适应整合到特征金字塔网络中,并对PubLayNet数据集进行适配改造,包括插入半结构化元素和扩展标注。团队在Article Regions、PubLayNet和DocBank三个基准上开展大量实验,验证了HiM的有效性和适应性。
边界感知混合分割网络
针对3D医学图像中器官组织对比度低、边界模糊,且现有方法聚焦2D边界增强而缺乏三维边界保留,团队提出具有边界感知的混合网络。该网络采用编解码结构,在编码器中嵌入边界提取模块生成边界图监督特征,并设计边界保留模块,通过空间互补与通道注意力融合边界信息。在三个数据集上,该网络在ASSD指标上显著改进,验证了其三维边界保留。
PDF文档结构信息提取系统
随着移动阅读终端种类的多样化,如手机、电子阅读器、GPS等,电子文档在不同移动设备平台上的自适应显示,要求文档内容根据屏幕进行流式化重排和自适应调整,从而保证舒适的阅读体验。为满足移动阅读可读性需求,保证文档内容显示方式的重新调整,其关键在于获得原文档的物理逻辑结构和顺序信息。此外,电子文档结构化信息提取直接影响着信息检索、文本挖掘、搜索引擎、机器翻译、信息存储和管理等应用领域的发展和进步。 综上所述,研究团队研发了“PDF文档结构信息提取系统”。该系统能够提取结构化PDF文档中的文本、图片、图表、公式信息。
视网膜眼底图像血管分割
视网膜血管分割是计算机辅助诊断眼科疾病的关键任务。不同于传统方法手工设计复杂的特征,深度学习通过卷积获取了表征性更强的特征。然而,当前的方法大都忽视了多个特征之间的内在联系,这是有问题的。为了探索非局部上下文依赖关系,我们提出了一种基于图的卷积特征聚合网络(GCFAN),用于同时分割视网膜血管和增强图像非血管区域,它依靠图来传播和聚合跨层次特征的信息。最后,结合我们的算法构建物联网框架,对不同地点的各种眼底相机图像进行分析,并在PC和手机上同时显示结果,方便医生诊断。
基于视觉和文本的多模态文档图像目标检测
由于文档图像的布局复杂、目标对象尺寸分布不均匀,现有的检测算法很少考虑多模态信息和全局依赖关系,因此,提出了基于视觉和文本的多模态文档图像目标检测方法。首先探索多模态特征的融合策略,为利用文本特征,将图像中文本序列信息转换为二维表征,在文本特征和视觉特征初次融合之后,将其输入到骨干网络提取多尺度特征,并在提取过程中多次融入文本特征,实现多模态特征的深度融合;其次为保证小物体和大物体的检测精度,设计了一个金字塔网络,该网络的横向连接将上采样的特征图与自下而上生成的特征图在通道上连接,实现高层语义信息和低层特征信息的传播。
膝关节软骨分割
三维医学图像分割是计算机辅助诊断中的一个关键而又具有挑战性的任务。在医学图像分割中,组织与其周围环境的对比度较低会导致边界模糊。毫无疑问,边界先验信息对于图像分割至关重要。模糊的边界信息会造成分割结果的误差偏大,为了解决这一问题,研究团队从边界信息入手,将边界信息量化,使其参与到网络的学习中去。采用了医学图像分割领域常见的transformer架构,融入强大的特征学习能力和正向信息,使得研究团队提出的网络在不同数据集上的各项指标都要由于其他经典模型。
基于混合注意力机制的文档对象版面分析
文档图像通常包含各种页面组件和复杂的逻辑结构,这使得文档布局成为一项具有挑战性的任务。大多数基于深度学习的文档布局分析方法都采用卷积神经网络作为特征提取网络。本文提出了一种混合空间通道注意网络(HSCA-Net),通过引入注意机制来挖掘文档页面中更显著的特征,从而提高特征提取能力。HSCA-Net网络由空间注意模块(SAM)、通道注意模块(CAM)和设计好的横向注意连接组成。CAM通过强调选择性信息来自适应调整信道特征响应,这取决于每个信道特征的贡献。SAM引导卷积神经网络关注信息性内容,并在页面对象之间捕获全局上下文信息。横向注意连接将SAM和CAM合并为多尺度特征金字塔网络,从而保留原始特征信息。
基于视觉变换器的级联多阶层医学影像配准方法
由在基于深度学习的图像配准中,图像中具有复杂解剖结构的形变区域是影响网络配准精度的重要因素,然而现有方法很难关注到图像的复杂解剖区域。同时,卷积神经网络的感受野受其卷积核大小的限制,难以学习空间位置距离较远的体素之间的关系,使其难以处理较大区域形变问题。针对以上两个问题,本文提出了一种基于视觉变换器(Transformer)的级联多阶层配准网络模型,并配备了一种基于均方误差的困难形变感知机。困难形变感知机使用滑动窗口和浮动窗口技术在配准图像中进行检索,得到每个体素的困难形变系数,识别出配准效果最差的区域。
基于空间信息和视觉信息的文档目标检测器
由于布局复杂性和对象多样性,文档对象检测是一项具有挑战性的任务。大多数现有方法主要关注视觉信息,而忽略了文档对象之间具有代表性的内在空间相关关系。为了捕获结构信息和上下文依赖性,研究团队提出了一种基于空间相关关系和视觉的新型文档对象检测器。它由三部分组成:视觉特征提取网络、关系特征聚合网络和结果细化网络。视觉特征提取网络通过采用特征增强路径来增强层级特征金字塔之间的信息传播。然后,关系特征聚合网络结合了图构建模块和图学习模块。图构建模块根据区域建议的几何属性计算空间信息以编码关系信息,而图学习模块堆叠图卷积网络(GCN)层以在全局范围内聚合关系信息。