Few-shot classification of 3D point clouds aims to classify data with limited training samples. Existing methods project point clouds into 2D depth images for leveraging mature 2D models, but large point spacing causes discontinuous and granular projections, leading to information loss. Additionally, hard samples induced by ambiguous visual features significantly degrade classification accuracy. To address these issues, we propose two key innovations: 1. Prompt-Augmented Projection (PAP): A module that adaptively optimizes geometric encoding and shading via prior knowledge from pretrained 2D models, enhancing textures and contours in projections. 2. Hierarchical Semantic-Guided Attention (HSEGA): A mechanism integrating tree-structured semantic hierarchy (e.g., WordNet) to resolve visual confusion by aligning coarse-to-fine semantics with visual prototypes. Experiments on ModelNet40-FS and ShapeNet55-FS show that our method achieves 75.33% accuracy in 5-way 1-shot tasks, surpassing baselines (SEGA-PP) by 3.56% with statistical significance (p < 0.01). This work provides a robust solution for 3D recognition in data-scarce scenarios like robotics and AR/VR.

错误:搜索内容不能为空,请输入英文关键词
错误:关键词超出字数限制,请精简
高级检索

Hierarchical Semantic-Guided Attention with Prompt-Augmented Vision Prototypes for 3D Point Cloud Few-Shot Learning

  • Ke Wang,
  • Wei Xia,
  • Wenguang Gan,
  • Xinpan Yuan

摘要

Few-shot classification of 3D point clouds aims to classify data with limited training samples. Existing methods project point clouds into 2D depth images for leveraging mature 2D models, but large point spacing causes discontinuous and granular projections, leading to information loss. Additionally, hard samples induced by ambiguous visual features significantly degrade classification accuracy. To address these issues, we propose two key innovations: 1. Prompt-Augmented Projection (PAP): A module that adaptively optimizes geometric encoding and shading via prior knowledge from pretrained 2D models, enhancing textures and contours in projections. 2. Hierarchical Semantic-Guided Attention (HSEGA): A mechanism integrating tree-structured semantic hierarchy (e.g., WordNet) to resolve visual confusion by aligning coarse-to-fine semantics with visual prototypes. Experiments on ModelNet40-FS and ShapeNet55-FS show that our method achieves 75.33% accuracy in 5-way 1-shot tasks, surpassing baselines (SEGA-PP) by 3.56% with statistical significance (p < 0.01). This work provides a robust solution for 3D recognition in data-scarce scenarios like robotics and AR/VR.