Adversarial visual perturbations reduce success rates of end-to-end policies for debridement and suturing by an average of 61% in physical experiments on three policy architectures.
hub
arXiv preprint arXiv:2511.19046 (2025)
11 Pith papers cite this work. Polarity classification is still indexing.
hub tools
citation-role summary
citation-polarity summary
years
2026 11verdicts
UNVERDICTED 11roles
method 1polarities
use method 1representative citing papers
EchoPilot delivers state-of-the-art training-free ultrasound video segmentation from a single point prompt by introducing scale-space semantic prompting via S.E.E.D. and reliability-gated memory updates.
MedSIGHT unifies medical image comprehension and segmentation in Med-LVLMs via a Region Perceiver module and region codebook, trained progressively on 72K pairs to reach SOTA on both tasks across modalities.
GLeVE introduces graph-guided lesion grounding with anatomical verification and octree refinement to improve text-to-lesion alignment in 3D CT volumes.
Existing visual attribution methods often fail to identify the visual evidence used by LVLMs in chest X-ray reasoning, while MedFocus using unbalanced optimal transport and targeted interventions substantially outperforms them across multiple models and settings.
SABER integrates LLM semantics into brain networks via global self-attention and multi-scale hypergraphs with decision-level alignment, claiming SOTA performance, stability, and interpretability on ABIDE and ADHD-200.
PGE-SAM adds a Prompt Guidance Generator, multi-scale feature interaction, and foreground reconstruction loss to SAM for better interactive segmentation on degraded images, plus a new DM-Seg benchmark.
CM-TTA adapts SAM3 for medical segmentation at test time via semantic consistency-based augmentation selection and dual long-short prompt memory for stable pseudo-label generation.
Proposes bidirectional token-wise KL regularizer and visual-contrastive grounding objective to create fine-grained on-policy preference pairs for medical LVLMs by minimally editing model outputs.
MedSynapse-V proposes a latent memory evolution framework with meta-query prior retrieval, causal counterfactual refinement via RL, and intrinsic memory transition to improve diagnostic accuracy over chain-of-thought baselines in medical VLMs.
DINO-Med3D progressively adapts DINOv3 for 3D medical segmentation via multi-slice embedding, segmentation proxy, 3D adapters, and parallel detail recovery, outperforming baselines on five public datasets.
citing papers explorer
-
Adversarial Attacks on Learned Policies for Surgical Robotic Tasks
Adversarial visual perturbations reduce success rates of end-to-end policies for debridement and suturing by an average of 61% in physical experiments on three policy architectures.
-
EchoPilot: Training-Free Ultrasound Video Segmentation via Scale-Space Semantic Prompting and Reliability-Gated Memory
EchoPilot delivers state-of-the-art training-free ultrasound video segmentation from a single point prompt by introducing scale-space semantic prompting via S.E.E.D. and reliability-gated memory updates.
-
MedSIGHT: Towards Grounded Visual Comprehension in Medical Large Vision-Language Models
MedSIGHT unifies medical image comprehension and segmentation in Med-LVLMs via a Region Perceiver module and region codebook, trained progressively on 72K pairs to reach SOTA on both tasks across modalities.
-
GLeVE: Graph-Guided Lesion Grounding with Proposal Verification in 3D CT
GLeVE introduces graph-guided lesion grounding with anatomical verification and octree refinement to improve text-to-lesion alignment in 3D CT volumes.
-
Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models
Existing visual attribution methods often fail to identify the visual evidence used by LVLMs in chest X-ray reasoning, while MedFocus using unbalanced optimal transport and targeted interventions substantially outperforms them across multiple models and settings.
-
SABER: A Semantic-Aligned Brain Network Analysis Framework via Multi-scale Hypergraphs
SABER integrates LLM semantics into brain networks via global self-attention and multi-scale hypergraphs with decision-level alignment, claiming SOTA performance, stability, and interpretability on ABIDE and ADHD-200.
-
PGE-SAM: Prompt-Guided Feature Enhancement for Interactive Segmentation under Degradation
PGE-SAM adds a Prompt Guidance Generator, multi-scale feature interaction, and foreground reconstruction loss to SAM for better interactive segmentation on degraded images, plus a new DM-Seg benchmark.
-
Concept Alignment Contrast and Long-Short Prompt Memory for Test-Time Adaptation of SAM3 in Medical Image Segmentation
CM-TTA adapts SAM3 for medical segmentation at test time via semantic consistency-based augmentation selection and dual long-short prompt memory for stable pseudo-label generation.
-
Analyzing and Improving Fine-grained Preference Optimization in Medical LVLMs
Proposes bidirectional token-wise KL regularizer and visual-contrastive grounding objective to create fine-grained on-policy preference pairs for medical LVLMs by minimally editing model outputs.
-
MedSynapse-V: Bridging Visual Perception and Clinical Intuition via Latent Memory Evolution
MedSynapse-V proposes a latent memory evolution framework with meta-query prior retrieval, causal counterfactual refinement via RL, and intrinsic memory transition to improve diagnostic accuracy over chain-of-thought baselines in medical VLMs.
-
DINO-Med3D: Bridging Dimension and Domain Gaps in Volumetric Segmentation via Progressive Adaptation
DINO-Med3D progressively adapts DINOv3 for 3D medical segmentation via multi-slice embedding, segmentation proxy, 3D adapters, and parallel detail recovery, outperforming baselines on five public datasets.