Pith. sign in

Paper Citation Record · LEDGER

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning

As of 7 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2506.19469.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.19469 v1

Coverage vector

measured 44 of 44 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T23:12:12.857120Z

measured 45 of 45 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-10T01:20:57.490329Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-11T13:36:09.441352Z

Reference resolution

44 of 44 outbound references displayed

  • verified exact1
  • verified fuzzy12
  • unresolved31
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation bd697da2-b79a-442a-b65f-f0e3d050d967 · outbound

This paper cites Concepts and trends in autonomy for robot-assisted surgery,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Concepts and trends in autonomy for robot-assisted surgery,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:14.173621Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:11.340298Z digest=sha256:8888797533dacbe13ae28caba5ca90ff666e68efaacc29e6311ebaf664dae3c7

Observation cfd39512-8508-47db-8ef8-20a0cb87cf53 · outbound

This paper cites Video-instrument synergistic network for referring video instrument segmentation in robotic surgery,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Video-instrument synergistic network for referring video instrument segmentation in robotic surgery,

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:11.376982Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:11.376982Z digest=sha256:d5e409b52d959d7c2ac92f76bb113cb96e4348d3ee15e03a748f93120b4d91b7

Observation ab67220b-0ff0-411a-9e3a-34e603e06a02 · outbound

This paper cites Surgical scene understanding in the era of foundation ai models: A comprehensive review,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Surgical scene understanding in the era of foundation ai models: A comprehensive review,

Reference 3

Resolution
verified exact
raw_fallback, observed 2026-08-06T23:12:13.764243Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:11.489433Z digest=sha256:6ec534dd59470475d1ecc7e95537f07344db396b70a52e1af623210b5e7821b5

Observation 6e8a677e-16a2-4d2f-a440-12d07a17961a · outbound

This paper cites Dynamic interactive relation capturing via scene graph learning for robotic surgical report generation,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Dynamic interactive relation capturing via scene graph learning for robotic surgical report generation,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:14.134619Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:11.593164Z digest=sha256:04e2123165e6d253cd905e5f5235000e50db9fffcc2e96172a1aa5c2faf2220a

Observation e760edad-c1b7-4f84-80bd-7371f65f92d5 · outbound

This paper cites Surgical-vqla: Trans- former with gated vision-language embedding for visual question localized-answering in robotic surgery,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Surgical-vqla: Trans- former with gated vision-language embedding for visual question localized-answering in robotic surgery,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:14.104660Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:11.688527Z digest=sha256:26db2d713e0468f7bec6444df36d4013c86830b4b8db00d0b7257db1e5e30e81

Observation b681fea7-dda6-461b-8703-b9b884e2920c · outbound

This paper cites Cat-vil: co-attention gated vision- language embedding for visual question localized-answering in robotic surgery,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Cat-vil: co-attention gated vision- language embedding for visual question localized-answering in robotic surgery,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:14.076170Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:11.782589Z digest=sha256:ce261253447eae34ed148021566d73b227ddd9c783aa84f889fc96b2291539ce

Observation d6747373-95e1-489d-b022-668002a275f4 · outbound

This paper cites Enhancing visual reasoning with llm-powered knowledge graphs for visual question localized-answering in robotic surgery,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Enhancing visual reasoning with llm-powered knowledge graphs for visual question localized-answering in robotic surgery,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:14.043677Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:11.844089Z digest=sha256:e205d82eb042468c5ccabfd0d6337e25fb6e563d330079dbd5c71aaa1aa591b9

Observation 29dac86e-9eab-47d5-898c-2b4ae9589523 · outbound

This paper cites GPT-4 Technical Report.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning GPT-4 Technical Report

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:11.980924Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:11.980924Z digest=sha256:5e03b1b530b54defd5c21599f64425c25d53b9a6e19863a44d68c126f264b061

Observation 784c6ea1-a4cb-4e60-acf0-64322a506138 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning LLaMA: Open and Efficient Foundation Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.114296Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.114296Z digest=sha256:aea7ca045cbfd6443221e9e81afa6080b23846ccb197c427e583a7a6535e8b53

Observation 911b0418-63a3-4064-8520-d5ed2a09d0d5 · outbound

This paper cites LLM-Assisted Multi-Teacher Continual Learning for Visual Question Answering in Robotic Surgery.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning LLM-Assisted Multi-Teacher Continual Learning for Visual Question Answering in Robotic Surgery

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.276314Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.276314Z digest=sha256:b0ca9ec222cf4ff23cc463fc53e676d538f589d5c3933071743764c3c974be2a

Observation 7742205c-8c04-4a3b-b966-e500c0e12a92 · outbound

This paper cites Qwen Technical Report.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Qwen Technical Report

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.352837Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.352837Z digest=sha256:7cbe41197f5a5b06da7abc330f3f2dfc067708b5a562ca69fad7e8ce304a0a68

Observation 4eca0bd3-3398-41b4-a2a1-434f4c374f34 · outbound

This paper cites Otter: A multi-modal model with in-context instruction tun- ing,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Otter: A multi-modal model with in-context instruction tun- ing,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:14.017830Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:12.483938Z digest=sha256:e0f7e8da36efbe11d9a85939d3ca1c86f2e5059ca183e3465d99b44e609ff51d

Observation 7d6a7c04-3975-4b2c-8d0f-bf7970b85d68 · outbound

This paper cites Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.503145Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.503145Z digest=sha256:39d33e29b375783e97e881351a17c7c31b7ecbe78c6d8c1b2ccdb5cb422a0d69

Observation 5cf0f6de-075d-481a-aa46-24909667bbcb · outbound

This paper cites EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.627569Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.627569Z digest=sha256:720ff6413390a37e58ead73a1a9f2aeb6d833c45cb811dc5a24ed0b4a7bdea63

Observation 163e1094-d61a-4214-b2e8-7daf56552e77 · outbound

This paper cites A Survey on Hallucination in Large Vision-Language Models.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning A Survey on Hallucination in Large Vision-Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.655869Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.655869Z digest=sha256:ad714593a6e8ec3b5e00a33020d59af22e165daadd369696e0bd4b3f792588a7

Observation 95a736b1-c5fa-41f9-a2f3-36bc164ccf8e · outbound

This paper cites OpenAI o1 System Card.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning OpenAI o1 System Card

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.661327Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.661327Z digest=sha256:2251fd7933a96e97a3b4241b2ef35fcc2c5b3a519bf8321e226272ff9a6d1f51

Observation edabc439-2543-4743-b1a0-17d8b09e2f00 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.668699Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.668699Z digest=sha256:fd49c12b33d4ad47eeca2a98b6baf47008bc5ab191bc5bccbb80276ea7d1f141

Observation 9984e66c-a7c6-402c-8922-84dea3f6083e · outbound

This paper cites Scaling of Search and Learning: A Roadmap to Reproduce o1 from Reinforcement Learning Perspective.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Scaling of Search and Learning: A Roadmap to Reproduce o1 from Reinforcement Learning Perspective

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.674901Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.674901Z digest=sha256:c7321c39a72fb0b8ebc38b09f419476d337220d56a1934992a3452cd4f6b11e3

Observation ecbf9516-801e-4646-90d2-b0560d9acc53 · outbound

This paper cites Automatic Chain of Thought Prompting in Large Language Models.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Automatic Chain of Thought Prompting in Large Language Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.682873Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.682873Z digest=sha256:9133b64cb408bc202355eb2d757663e8c5a787a9ab3d65bd68fc02481ef7083a

Observation 6a9393af-ed01-4f5b-b4d7-83a19c9309e6 · outbound

This paper cites LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.688769Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.688769Z digest=sha256:046a7d72c6fb8862d12d302a8c48e8b0ab640e44d33eb9c5d136023d6bfadfd7

Observation 11926f27-4162-4895-8f2b-c855a4d22f50 · outbound

This paper cites Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.695884Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.695884Z digest=sha256:5c0f61d53f419785128f198b7e5fac0dc1b0654ddcd93ec7b1958092c14c6b04

Observation 14e73cbf-1563-4072-b7dd-1fb2720c3fb2 · outbound

This paper cites Video-R1: Reinforcing Video Reasoning in MLLMs.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Video-R1: Reinforcing Video Reasoning in MLLMs

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.708747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.708747Z digest=sha256:312432665c258dd0156aa668759559dc6cc34dcd7324c141b3d4b56322715e5c

Observation 1378fa37-0922-4fe9-bf05-d13e38584077 · outbound

This paper cites Med-r1: Reinforcement learning for generalizable medical reasoning in vision-language models,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Med-r1: Reinforcement learning for generalizable medical reasoning in vision-language models,

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.715293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.715293Z digest=sha256:21b897597c870de28bef4e4ffdbabbee388e5d2c9e0f453b7d59f467c10c9a6d

Observation 427df6e0-825a-431b-9410-84e29b6a4a42 · outbound

This paper cites HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.721082Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.721082Z digest=sha256:a4440b3ad9e9f0bdcdb33406d0ec285fe8b7b8d9495695b08460acf3908458d5

Observation cc933ffa-6545-4645-ae21-a3a1bff3e0ed · outbound

This paper cites How Abilities in Large Language Models are Affected by Supervised Fine-tuning Data Composition.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning How Abilities in Large Language Models are Affected by Supervised Fine-tuning Data Composition

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.727040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.727040Z digest=sha256:6bfeeb2d6c9f2374d41ffa315ac8cc10b79667acaf659f490b03373317937427

Observation 9a515ed5-d779-42ea-908a-6b772492f5c1 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.732788Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.732788Z digest=sha256:3e99701590b401316726ad66879c51b9c2702e577736a706bbf1de8298897012

Observation 9a80e5d9-411f-4fdd-8c1a-0c49d5ae2f18 · outbound

This paper cites Aligning Large Multimodal Models with Factually Augmented RLHF.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Aligning Large Multimodal Models with Factually Augmented RLHF

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.739097Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.739097Z digest=sha256:eadd73f2c8fbddd0c41c3f13fc9c3d84b1a4f0d58f9106af7c2f0d40b9b978c0

Observation c5d0ac4f-3bda-4696-bd88-3e959df2a637 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Direct preference optimization: Your language model is secretly a reward model,

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.745011Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.745011Z digest=sha256:2b6154f5e4533c61e754165add6cc88634c34b5beda97fb76fef816b6e690fc9

Observation 1cb6f7bd-1dfe-4715-881b-fbe525c78b9a · outbound

This paper cites SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.750753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.750753Z digest=sha256:a87a5e8a69b46b114967a3eb4ab952bd69eda6a3a3f514a30e0696020bfe2d39

Observation 364724d7-0984-4df3-9e81-5a3c1ade3d92 · outbound

This paper cites Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.756251Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.756251Z digest=sha256:4dfd50e127f5b3c3ab6e3ee3785374af6a820575def2b75e32bd3c39b97bcd7a

Observation 05c073c1-fc3b-49ff-bc03-159e8a3a529f · outbound

This paper cites Langloc: Language-driven localization via formatted spatial description genera- tion,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Langloc: Language-driven localization via formatted spatial description genera- tion,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:13.980112Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:12.761595Z digest=sha256:ee10396955f064b4cc410219c536852448222497b4ac6056a11c7aa9fc9bd6e7

Observation f5101bf7-41c8-4e75-9dd1-4178d6f09b16 · outbound

This paper cites Qwen2.5-VL Technical Report.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Qwen2.5-VL Technical Report

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.768154Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.768154Z digest=sha256:f6c8492226706a1789e1c8203eacb6374a7c9cc30e447300af298db83dbf3e59

Observation 4352587b-6c54-497e-849a-5a90884d80bb · outbound

This paper cites Surgical-vqa: Visual question answering in surgical scenes using transformer,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Surgical-vqa: Visual question answering in surgical scenes using transformer,

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:13.922312Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:12.779282Z digest=sha256:90d56280a797051c44f903ef9f9688dcf298261182a375ad550325e0689e3c94

Observation dbc56a84-e3da-4f42-b0f6-cc6eef8646df · outbound

This paper cites Beyond bilinear: Generalized multimodal factorized high-order pooling for visual question answering,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Beyond bilinear: Generalized multimodal factorized high-order pooling for visual question answering,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:13.895806Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:12.784644Z digest=sha256:7dd3487bd2e15e29b8274315de703be580d54574fdf48e2d66956c83463cd392

Observation 7c35949f-2a47-494d-85cf-98290fc3d337 · outbound

This paper cites Block: Bilinear superdiagonal fusion for visual question answering and visual relation- ship detection,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Block: Bilinear superdiagonal fusion for visual question answering and visual relation- ship detection,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:13.872822Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:12.791470Z digest=sha256:08519be8616f64d2006d6d555895a3ae8e97d5221f8b29730859ab2879c11f27

Observation fb416d27-3a48-4e2d-ac3e-5d2fd8e00d98 · outbound

This paper cites Mutan: Multi- modal tucker fusion for visual question answering,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Mutan: Multi- modal tucker fusion for visual question answering,

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:13.854178Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:12.798619Z digest=sha256:91dcac6e2ec4e48c1c4d967e3e472ed2c76ff640a9d6111d9425ad4f951f5e7a

Observation 64124cf8-9188-46a3-8933-19be1b1d7bec · outbound

This paper cites Surgicalgpt: end- to-end language-vision gpt for visual question answering in surgery,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Surgicalgpt: end- to-end language-vision gpt for visual question answering in surgery,

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:13.832918Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T23:12:12.807977Z digest=sha256:3998bd4d081579c32352f5d4fbc76f6bed12e363c6e9f678804debd162f0ae20

Observation 464c2954-80a4-47f8-b714-e862ca54a132 · outbound

This paper cites 2018 Robotic Scene Segmentation Challenge.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning 2018 Robotic Scene Segmentation Challenge

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.816231Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.816231Z digest=sha256:1270661076f818c2db225d37589eb3bb603a8bc620e76e721437a5d00602eec8

Observation 30b3032c-54da-4f24-9c6c-e35bcac52831 · outbound

This paper cites 2017 Robotic Instrument Segmentation Challenge.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning 2017 Robotic Instrument Segmentation Challenge

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.826059Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.826059Z digest=sha256:b833518856930c7fe864f40bc2e4c6c757dd64f25a54b431a5c11a23b2e6296d

Observation ada20978-0cb4-447c-8932-df36c11596fe · outbound

This paper cites A review on evaluation metrics for data classification evaluations,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning A review on evaluation metrics for data classification evaluations,

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.832743Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.832743Z digest=sha256:72704acafbbbaa933bc08b30907e7b6a513600beb2019ab05cfd2bf336197e8d

Observation 6470ce9e-7fcf-41e3-a7e1-6d99c2e56055 · outbound

This paper cites Generalized intersection over union: A metric and a loss for bounding box regression,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Generalized intersection over union: A metric and a loss for bounding box regression,

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.838951Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.838951Z digest=sha256:a5c941507ccdfbb53785b298374ea14ffd42a9be257deb5eec8906754b6baed5

Observation ad8bc998-1407-4e1c-b31a-b1a81205c427 · outbound

This paper cites Visual instruction tuning,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Visual instruction tuning,

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.845636Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.845636Z digest=sha256:1991d3d7367fb666ddb2e93b4697595368e3d7af5e0b30a7e0e86f8a7d4689fd

Observation 94b649a3-3737-4dbc-8bd3-1c8d53c93269 · outbound

This paper cites Llava-med: Training a large language-and-vision assistant for biomedicine in one day,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Llava-med: Training a large language-and-vision assistant for biomedicine in one day,

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.850954Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.850954Z digest=sha256:6a66dcd765661f354c2a1a8a3262fa8a0853149bf93620eff9a47d9b391729f0

Observation c18551c6-e599-4abc-8a1d-48fd6edc248a · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.857120Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.857120Z digest=sha256:724893b5075785935788bb33aa36c1c283d21b5af5d77b1ff841700ef1296b2f

Pith citing papers

Observation a0d79053-ef30-4d96-8b51-effcfd95991b · inbound

SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark cites this paper.

SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-11T13:36:09.445468Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-10T01:20:57.490329Z digest=sha256:764a2569e1f61f28f0a73b547cef09eb5ba54353e581577ca0e0c40ef330a063