{"as_of":"2026-08-07T22:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ec0a51e52ce2f98dd45e6d2026e5c692d7a2716e8f9751804df7d320cf0cbd90","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:01:41.017116Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.06232/citation-record","integrity":"/paper/2506.06232/integrity","json":"/paper/2506.06232/citation-record.json","paper":"/paper/2506.06232"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:01:42.096922Z","title":"Czempiel, M","venue":null,"work_id":"7f7b8804-c8ee-42cd-b350-47099f03347d","year":2020},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:40.781723Z"},"links":{"citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:b6c691bf0d041823d5ad447211ce93e2c0113a79a656877019a29de1557ada24","observation_id":"1ca26ed5-5aae-4719-8641-0f3311ba4dd7","resolution":{"observed_at":"2026-08-07T06:01:42.109452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:01:42.064259Z","title":"Yamlahi, T","venue":null,"work_id":"3b8d37f6-94cc-4e7b-a808-795464b11d86","year":2023},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:40.789737Z"},"links":{"citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:1d82925f052814578bfb2869a6ba99c54fe60c78aa999ae81d1bc087c09cd276","observation_id":"834c7b66-b21e-4042-8fb0-8244dd16a8ab","resolution":{"observed_at":"2026-08-07T06:01:42.073782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10891","last_updated":"2024-04-07T06:52:21Z","snapshot_observed_at":"2026-08-01T22:50:12.319180Z","submitted_at":"2024-01-19T18:59:52Z","title":"Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10891","snapshot_observed_at":"2026-08-07T06:01:40.799960Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:40.799960Z"},"links":{"cited_paper":"/paper/2401.10891","citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:ba3fc0a0c38337dd4b0ac7645c113b24c5a5d819e11350a1a5c35010f6c1b47b","observation_id":"ec5623ee-2697-4d0a-9f03-2508a90841b1","resolution":{"observed_at":"2026-08-07T06:01:40.799960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-07-06T15:12:37.953383Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-07T06:01:40.811423Z","title":"Kirillov, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:40.811423Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:542b63504d1996001718e31d031fcb8b30d516b2d64812ecbc88a8770a52f0f2","observation_id":"995d6d0c-7fa4-416c-9f9a-960bbb276a1c","resolution":{"observed_at":"2026-08-07T06:01:40.811423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07931","last_updated":"2025-03-11T12:57:43Z","snapshot_observed_at":"2026-08-06T05:55:21.187619Z","submitted_at":"2024-08-15T04:59:12Z","title":"Surgical SAM 2: Real-time Segment Anything in Surgical Video by Efficient Frame Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07931","snapshot_observed_at":"2026-08-07T06:01:40.821259Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:40.821259Z"},"links":{"cited_paper":"/paper/2408.07931","citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:0dce323ba3e061f5d4f4f3eb89fffb119ca87117da94d1ffbf37a34ceaedf92e","observation_id":"a22fdc4b-c2a9-4fbb-86f2-ac1058f66381","resolution":{"observed_at":"2026-08-07T06:01:40.821259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.00525","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:01:41.672130Z","title":null,"venue":null,"work_id":"8a8b19d2-d3f9-41ef-859b-e52f717719de","year":2024},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:40.828320Z"},"links":{"citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:72951417e364ddf77d23435d099b94a357dd4a9014e45f6d476a04e40a61e48f","observation_id":"7fb5124e-50fd-4c73-ae2d-bcdd1713e5a8","resolution":{"observed_at":"2026-08-07T06:01:41.693085Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:01:42.031070Z","title":null,"venue":null,"work_id":"17f9dcaa-e0c5-4d93-9619-b8daecd3cf5d","year":2024},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:40.841726Z"},"links":{"citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:989d5802536df81759822f37f48bfda4352e1936387515750be32fcdfe833ccf","observation_id":"3272a767-fbbb-4438-a217-a4cf59934f05","resolution":{"observed_at":"2026-08-07T06:01:42.039685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04732","last_updated":"2024-09-11T23:12:53Z","snapshot_observed_at":"2026-07-06T19:11:53.766902Z","submitted_at":"2024-09-07T06:33:12Z","title":"VidLPRO: A $\\underline{Vid}$eo-$\\underline{L}$anguage $\\underline{P}$re-training Framework for $\\underline{Ro}$botic and Laparoscopic Surgery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04732","snapshot_observed_at":"2026-08-07T06:01:40.854985Z","title":"Honarmand, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:40.854985Z"},"links":{"cited_paper":"/paper/2409.04732","citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:ed07f7dea0bcdf09c634d60d99db999fdd1dc9f1c226f7ebae1acf92eb556324","observation_id":"fa5dfb38-def3-473e-8931-d4994e655c26","resolution":{"observed_at":"2026-08-07T06:01:40.854985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-07T06:01:40.874635Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:40.874635Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:ecf6556d5e0c2182e7f7d61a0506d18967c47e273e7d725c05387db72d316013","observation_id":"73ac3da9-42d6-4537-9d6f-860b60e4b9ba","resolution":{"observed_at":"2026-08-07T06:01:40.874635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15563","last_updated":"2025-02-21T16:24:10Z","snapshot_observed_at":"2026-08-07T17:58:07.971664Z","submitted_at":"2025-02-21T16:24:10Z","title":"Bridging vision language model (VLM) evaluation gaps with a framework for scalable and cost-effective benchmark generation","version":1},"cited_work":{"arxiv_id":"2502.15563","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.15563","snapshot_observed_at":"2026-08-07T06:01:41.486343Z","title":"Bridging vision language model (VLM) evaluation gaps with a framework for scalable and cost-effective benchmark generation","venue":"cs.CV","work_id":"b568a1f1-96f1-4105-85b3-6f7c133767c0","year":2025},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:40.884579Z"},"links":{"cited_paper":"/paper/2502.15563","citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:5786739dd511d9cdf62bcdad4501cdac6ccc5f943fe8a58cc68631a7f2bb58a8","observation_id":"73f50197-5c0a-467a-86b8-fcb825cc339b","resolution":{"observed_at":"2026-08-07T06:01:41.495440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-07T06:01:40.893107Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:40.893107Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:2c8d6da20ce2bd45d35b08e0d8ac3aa49c2db757e71b27ccb4d7df14c075dbe4","observation_id":"e7176091-eeb6-4474-827e-d896fbe6dec6","resolution":{"observed_at":"2026-08-07T06:01:40.893107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-07T06:01:40.901934Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:40.901934Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:2ad1a6ad4dbf34ff3330e019b392b6ba05dab105f4ede05c2840b1cbdd90fd07","observation_id":"2d189f2b-a1f3-4e59-a6ec-335fb4838dc6","resolution":{"observed_at":"2026-08-07T06:01:40.901934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-07T06:01:40.910317Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:40.910317Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:e3bb1b3353c9bc35a078ffa08aac0f14837e9391a0f73d8072452bb1a49cd4ff","observation_id":"07cc04ad-a7a3-43d3-b28e-d2d6df63f747","resolution":{"observed_at":"2026-08-07T06:01:40.910317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41597-021-00882-2","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:01:42.000442Z","title":"Maier-Hein, M","venue":null,"work_id":"ee52b694-dc1b-4fec-a87a-121e6d5861ea","year":2021},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:40.918117Z"},"links":{"citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:2399728557e74fcfa9097b3cb402f20dccea0f2f5a9b5abb72bcd7e2c0ce79d0","observation_id":"1450493b-8a05-469b-ad41-cb09613d2247","resolution":{"observed_at":"2026-08-07T06:01:42.009368Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:01:41.964222Z","title":null,"venue":null,"work_id":"1105854f-ea98-42a0-a1ef-26616b594e69","year":2024},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:40.935612Z"},"links":{"citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:2e96c010767e5bf925a20472803f2ae3ae111eef9d943839e809ed717f6e6d63","observation_id":"a3dc95d1-c380-4249-8786-63462564bf3a","resolution":{"observed_at":"2026-08-07T06:01:41.970928Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:01:41.935417Z","title":null,"venue":null,"work_id":"b3861248-ca2e-44be-a793-b9c6fd746b41","year":2016},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:40.960150Z"},"links":{"citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:2cbf106186c9eb36ae878337dd1dbe98b1719578b794e333827fd04b5dcaa024","observation_id":"c1b49f04-b31e-4710-9c24-e25d882de839","resolution":{"observed_at":"2026-08-07T06:01:41.942958Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12429","last_updated":"2024-10-25T17:28:43Z","snapshot_observed_at":"2026-07-06T17:05:31.586924Z","submitted_at":"2023-12-19T18:56:44Z","title":"The Endoscapes Dataset for Surgical Scene Segmentation, Object Detection, and Critical View of Safety Assessment: Official Splits and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12429","snapshot_observed_at":"2026-08-07T06:01:40.968221Z","title":"Murali, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:40.968221Z"},"links":{"cited_paper":"/paper/2312.12429","citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:3c4639ec1bb937c42a7880a877a2bf5156e285415b013769206cd053465b21f9","observation_id":"319b16a7-4d70-4833-8b3b-0303ddd696d6","resolution":{"observed_at":"2026-08-07T06:01:40.968221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:01:40.982318Z","title":"Gautam, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:40.982318Z"},"links":{"citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:9c8f9b97b436fa4c8f6da4500c17f0505c4bf96d530969b0a8fa13454b2fd9d3","observation_id":"f93fd5fb-b60d-464e-a55f-8de8f0dbe950","resolution":{"observed_at":"2026-08-07T06:01:40.982318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T06:01:40.989310Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:40.989310Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:26f803e69b22aa75f466d778722c84c086e3bdb09034a44902429acbffda6b84","observation_id":"31091282-8b37-4cdf-9ed2-542b709e2519","resolution":{"observed_at":"2026-08-07T06:01:40.989310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16261","last_updated":"2024-11-07T15:35:52Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:58:20Z","title":"Mini-InternVL: A Flexible-Transfer Pocket Multimodal Model with 5% Parameters and 90% Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16261","snapshot_observed_at":"2026-08-07T06:01:41.004736Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:41.004736Z"},"links":{"cited_paper":"/paper/2410.16261","citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:d0c8e2aa5ab1b9f5b9ffb8b11b414d004703eebbfd13c6002afd8beee64a7393","observation_id":"fd55f037-e5a8-499c-80cb-7ce337155cc7","resolution":{"observed_at":"2026-08-07T06:01:41.004736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:01:41.896377Z","title":"Godau, L","venue":null,"work_id":"6eb44f1e-6730-46cf-977f-70e3c2c2d23b","year":2021},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:41.017116Z"},"links":{"citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:42af9b80edd386269c7b8a4cfce22209344c80b5f1ef0fc8699f699ed65c5c9e","observation_id":"e262dcf8-ca8d-48c6-b394-1666109cff89","resolution":{"observed_at":"2026-08-07T06:01:41.904021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:01:40.951582Z","title":"URL https://doi.org/10.1007/s11548-024-03141-y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study","version":2},"reference_index":1417,"source":"pdf_text","source_observed_at":"2026-08-07T06:01:40.951582Z"},"links":{"citing_paper":"/paper/2506.06232"},"observation_digest":"sha256:c84721a87e507c2b837fdfe04de953dd647c5197c5b1f702f8b371850c25c21e","observation_id":"ba7e69c1-7a21-4706-bf1d-7051023c9849","resolution":{"observed_at":"2026-08-07T06:01:40.951582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06232","last_updated":"2025-07-08T07:40:27Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:55:50.745730Z","submitted_at":"2025-06-06T16:53:12Z","title":"Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":3,"verified_fuzzy":3},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2506.06232."}