Pith. sign in

Paper Citation Record · LEDGER

Surgical-VQLA: Transformer with Gated Vision-Language Embedding for Visual Question Localized-Answering in Robotic Surgery

As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2305.11692.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2305.11692 v1

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 8 of 8 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 8 of 8 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-10T18:24:41.734990Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-03T17:48:46.263849Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation ff01f311-dbd4-416c-8804-2f73fed88aa2 · inbound

EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery cites this paper.

EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery Surgical-VQLA: Transformer with Gated Vision-Language Embedding for Visual Question Localized-Answering in Robotic Surgery

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-10T18:24:41.734990Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:24:41.734990Z digest=sha256:2da6ed75371b9faea96bca8585f2443a190b85499eac3c81c55767a3b7c8aecf

Observation 3574d474-53d3-4979-ac34-b97bf56bfcae · inbound

EndoARSS: Adapting Spatially-Aware Foundation Model for Efficient Activity Recognition and Semantic Segmentation in Endoscopic Surgery cites this paper.

EndoARSS: Adapting Spatially-Aware Foundation Model for Efficient Activity Recognition and Semantic Segmentation in Endoscopic Surgery Surgical-VQLA: Transformer with Gated Vision-Language Embedding for Visual Question Localized-Answering in Robotic Surgery

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T05:52:28.128971Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:52:28.128971Z digest=sha256:133886b89f79a4aecc42217931f41e51ea10cfcdbacd85e7fadd501b1bb39984

Observation 3aa73fa8-b9c7-403f-a689-dee21888bc8c · inbound

SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark cites this paper.

SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark Surgical-VQLA: Transformer with Gated Vision-Language Embedding for Visual Question Localized-Answering in Robotic Surgery

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-05-11T13:36:09.494282Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-10T01:20:57.490329Z digest=sha256:b4d890e604efc2ecc2bafe4531c073e969abe4af29ed482b84e0410d95c35156

Observation 2b8b8067-7fa9-4e0a-a732-f8ef9e1bc3b2 · inbound

X-PCR: A Benchmark for Cross-modality Progressive Clinical Reasoning in Ophthalmic Diagnosis cites this paper.

X-PCR: A Benchmark for Cross-modality Progressive Clinical Reasoning in Ophthalmic Diagnosis Surgical-VQLA: Transformer with Gated Vision-Language Embedding for Visual Question Localized-Answering in Robotic Surgery

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-10T01:04:49.670628Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-10T01:04:07.511600Z digest=sha256:c379d7e1fd55f3cfecff5a5a4aa1feeb0e0e5391e1567c10389398d687ce1fb8

Observation 3649a13c-5a83-4530-bc1d-513aa96707e9 · inbound

SurgCheck: Do Vision-Language Models Really Look at Images in Surgical VQA? cites this paper.

SurgCheck: Do Vision-Language Models Really Look at Images in Surgical VQA? Surgical-VQLA: Transformer with Gated Vision-Language Embedding for Visual Question Localized-Answering in Robotic Surgery

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-05-11T16:21:06.942503Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-09T17:27:57.384336Z digest=sha256:0d5a5105664491ba1677a5ee29dee82718f3252412e7d53d14ae3086353cbf38

Observation 8a336bc0-01ac-4b7a-8ca4-98b63fcc70aa · inbound

RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering cites this paper.

RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering Surgical-VQLA: Transformer with Gated Vision-Language Embedding for Visual Question Localized-Answering in Robotic Surgery

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-05-25T05:25:23.510911Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-25T05:22:44.481868Z digest=sha256:501b1cdddf9d0e9371d47096a337ddcb33357155bb27e4985f9340f396e9fdeb

Observation bb23c071-82a7-43cc-b2c5-8c95a6e2ffab · inbound

Training LLMs with Reinforcement Learning over Digital Twin Representations for Reasoning-Intensive Surgical VideoQA cites this paper.

Training LLMs with Reinforcement Learning over Digital Twin Representations for Reasoning-Intensive Surgical VideoQA Surgical-VQLA: Transformer with Gated Vision-Language Embedding for Visual Question Localized-Answering in Robotic Surgery

Reference 1

Resolution
verified exact
arxiv_id, observed 2026-07-03T17:48:46.265478Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-06-27T03:40:26.565029Z digest=sha256:c19780618bf9f988dde3f8c7749910b7ef715b3c3c7e991a6c0983d13e4dd5ac

Observation 4a238e02-9e01-4793-aaa8-43fe7f2c179d · inbound

Towards Grounded GI Endoscopy VQA via Multi-Task Learning on Small VLMs cites this paper.

Towards Grounded GI Endoscopy VQA via Multi-Task Learning on Small VLMs Surgical-VQLA: Transformer with Gated Vision-Language Embedding for Visual Question Localized-Answering in Robotic Surgery

Reference 25

Resolution
unresolved
no resolver link, observed 2026-07-30T11:39:01.979348Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T11:39:01.979348Z digest=sha256:4f9c4aef89d054061b8d345824b09546b711f3160c3570369f4e987c0feb929d