{"as_of":"2026-08-09T03:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:90b1156d5d1135119e803dfb3df8ddcb3609d688db0f49a2ebfeae9ca3470b23","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:16:28.215749Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04676/citation-record","integrity":"/paper/2608.04676/integrity","json":"/paper/2608.04676/citation-record.json","paper":"/paper/2608.04676"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.752889Z","title":"Surgical data science for next-generation interventions,","venue":null,"work_id":"7bb50265-faac-4014-be67-d52e26d462e5","year":null},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:25.213092Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:fbfb3715f340dcf8a27685a489eb1d932140846e955529be35411fd35cf33db6","observation_id":"e2be2d6c-d7d2-404d-9540-e7edff2f0449","resolution":{"observed_at":"2026-08-06T19:16:28.755157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.745828Z","title":"Endonet: a deep architecture for recognition tasks on laparoscopic videos,","venue":null,"work_id":"e1dc66f0-869c-45ad-a818-cdbdfe1cb056","year":2016},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:25.340012Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:d3a3c6f55720a1ab08add7375b701c44a05c98d241af216e616fafa5e9fb11ab","observation_id":"7545cd78-8138-4c02-bcdd-4d06f27ac506","resolution":{"observed_at":"2026-08-06T19:16:28.748142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.738238Z","title":"Tecno: Surgical phase recognition with multi-stage temporal convolutional networks,","venue":null,"work_id":"ccbc766f-fecc-4b0d-9248-9717cb1eee33","year":2020},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:25.413795Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:d428e83c5b73975c326d05c4c2008a1ffc3923933df6ac04d66370dd05ec6056","observation_id":"34d8358b-ff26-48b5-99a3-0b761d0e8e69","resolution":{"observed_at":"2026-08-06T19:16:28.740863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.731812Z","title":"Video-based surgical skill assessment using 3d convolutional neural networks,","venue":null,"work_id":"7acb4476-6c8e-4981-bc50-4f01f4fabc30","year":2019},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:25.500056Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:800b15076e329fa50acbc967c5161918ddd2d834eb52bb3aad857b3e5a4f6101","observation_id":"4bcd1036-cd5b-4497-90c0-de491d1f4751","resolution":{"observed_at":"2026-08-06T19:16:28.734102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.724850Z","title":"CholecTriplet2021: A benchmark challenge for surgical action triplet recognition,","venue":null,"work_id":"69827740-15e8-424a-985b-daa259105711","year":2023},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:25.596898Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:4edcfa141c868a59ad7a0d5610ca81575ba67b93c1b1e7d9ca04f9eea563deed","observation_id":"e9b20194-0d7c-422f-bfa3-ffda191bbed4","resolution":{"observed_at":"2026-08-06T19:16:28.727323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:25.673883Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:25.673883Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:0d27e83db59716be4cae924ace1f9f35f49c1496ec589271bcc9ee33eafb8ba3","observation_id":"e38d567c-3cda-48ff-ad78-710b39afe4f8","resolution":{"observed_at":"2026-08-06T19:16:25.673883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.714438Z","title":"Video-llama: An instruction-tuned audio- visual language model for video understanding,","venue":null,"work_id":"6fd730c4-1e1a-481b-89e3-40ce33b2e2e3","year":2023},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:25.735796Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:9f751b5841a3adf1b028da4487ed2e88dbed84c528447a8d0a0ab6cbba4f9f2c","observation_id":"dccb5b83-a69b-4fd6-9169-ba64bda48ed0","resolution":{"observed_at":"2026-08-06T19:16:28.716805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07981","last_updated":"2024-08-15T07:00:20Z","snapshot_observed_at":"2026-07-06T19:00:57.743738Z","submitted_at":"2024-08-15T07:00:20Z","title":"LLaVA-Surg: Towards Multimodal Surgical Assistant via Structured Surgical Video Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07981","snapshot_observed_at":"2026-08-06T19:16:25.817758Z","title":"Llava-surg: towards multimodal surgical assistant via structured surgical video learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:25.817758Z"},"links":{"cited_paper":"/paper/2408.07981","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:92be584b64dc22efa672edc42161424cb55622d58a81d360e1201451746130de","observation_id":"52df1f1f-d3bb-4de4-a904-d81aeb361ad1","resolution":{"observed_at":"2026-08-06T19:16:25.817758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T19:16:25.906461Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:25.906461Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:7d3238e2d353a27469daa2626685c564f91fe4f067e490c89ca4c1d23548f841","observation_id":"ce833c7e-a201-4594-9eb8-9a9393cc7180","resolution":{"observed_at":"2026-08-06T19:16:25.906461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T19:16:25.987066Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:25.987066Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:45bd748dac4c63e8f0ed7d81a1ccc0313b11d92300e2877ae98ce7675741f1b7","observation_id":"86ace567-1834-4723-bbac-37c8e287b10a","resolution":{"observed_at":"2026-08-06T19:16:25.987066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.707718Z","title":"CLIP4Clip: An empirical study of clip for end to end video clip retrieval and captioning,","venue":null,"work_id":"5a48590d-8800-45f2-a075-3bfc66a7715d","year":2022},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:26.082165Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:2175ea989d217e0b548f02463bcf9e6187b37cc8ac312a43fa8499fafd022b77","observation_id":"55965cee-6a75-4819-8797-15e394289e62","resolution":{"observed_at":"2026-08-06T19:16:28.710596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.701784Z","title":"Videoclip: Contrastive pre-training for zero-shot video- text understanding,","venue":null,"work_id":"944b3bce-6b75-48b0-9be3-01af2666b8cc","year":2021},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:26.174873Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:e6ce7ace6d847f71c0b4e8a9c1354aecc5e4f8467c40e54fc1a05b3d971b36a5","observation_id":"f364efd4-dcda-48d1-8052-9d3a7cf9da90","resolution":{"observed_at":"2026-08-06T19:16:28.703886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.695398Z","title":"Learning multi-modal representations by watching hundreds of surgical video lectures,","venue":null,"work_id":"541a25a3-2746-4b91-b512-23524535673c","year":2025},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:26.263924Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:8c69db73306b3690f24f1294ec59211208de1b4ba9b44473eb3f4280cb586dee","observation_id":"678e7b22-dbdc-460f-8151-0502bae81eb3","resolution":{"observed_at":"2026-08-06T19:16:28.697979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.689598Z","title":"Vlog: Video-language models by generative retrieval of narration vocabulary,","venue":null,"work_id":"569e5faa-6834-447f-969b-57672b1dcf45","year":2025},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:26.354455Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:e2e7bf78b590c8f672b9b0b718f4eb9de4b722aeb453e53a4d9ff14b6edbae56","observation_id":"a5add67c-aa92-4f90-b6b1-92399f7b439c","resolution":{"observed_at":"2026-08-06T19:16:28.691703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.04720","last_updated":"2026-01-19T09:03:26Z","snapshot_observed_at":"2026-07-06T22:41:05.793337Z","submitted_at":"2026-01-08T08:36:06Z","title":"Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.04720","snapshot_observed_at":"2026-08-06T19:16:26.440798Z","title":"Qwen3-vl-embedding and qwen3-vl-reranker: A unified framework for state-of-the-art multimodal retrieval and ranking,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:26.440798Z"},"links":{"cited_paper":"/paper/2601.04720","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:766a00c08b3832c2cbcb1cfb3e123b4ec3e7744eceb06a24b967ca72d710f71f","observation_id":"83c22e0a-81b8-4341-9a7e-9e8bcc2eafb4","resolution":{"observed_at":"2026-08-06T19:16:26.440798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.683304Z","title":"Hecvl: Hierarchical video-language pretraining for zero-shot surgical phase recognition,","venue":null,"work_id":"ad4b1f8d-3eec-4fe0-847b-3517dd0fe6aa","year":2024},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:26.504571Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:7b99ba6d9ae28f1ecda907bd1312e1f21336ebe98899e319d88f7f95877b27da","observation_id":"e6c5cad7-8718-40ae-b23f-c71074574ddf","resolution":{"observed_at":"2026-08-06T19:16:28.685821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.676772Z","title":"VidLPRO: A video- language pre-training framework for robotic and laparoscopic surgery,","venue":null,"work_id":"bbb78d77-9d44-4cdd-b6b5-4aa90975c5fb","year":2024},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:26.506875Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:d14f10174b7d75f96197cd7baef052c432d2ea3585c3e0172990fe3aca250db8","observation_id":"30338680-b9a3-40d9-afa3-4e1b04ab7f25","resolution":{"observed_at":"2026-08-06T19:16:28.679173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.670480Z","title":"Ophclip: Hierarchical retrieval-augmented learning for ophthalmic surgical video-language pretraining,","venue":null,"work_id":"f6e92549-ef81-4d6c-ba9a-6f102650f345","year":2025},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:26.591016Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:f5c78cb54327aefb7099412eeade8cc4fa4aee1fd45c6fe32d520ab026754afa","observation_id":"f241a707-0f1d-4b9d-9872-464bee5cd332","resolution":{"observed_at":"2026-08-06T19:16:28.672963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.664235Z","title":"Procedure-aware surgical video-language pretraining with hierarchical knowledge aug- mentation,","venue":null,"work_id":"254a6761-e222-470c-aedc-76879bfbf912","year":2024},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:26.797955Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:04e19f5680f29efbeb778c2fa089b1efff815615bfb0f828d7b8b8e54cf36e70","observation_id":"b0841ad2-a419-4b53-b770-5e06c230fb1f","resolution":{"observed_at":"2026-08-06T19:16:28.666604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.24539","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.551418Z","title":"CliPPER: Contextual video-language pretraining on long-form intraoperative surgical proce- dures for event recognition,","venue":null,"work_id":"dee75a7a-29ce-4a29-bf1b-de17ab411b5d","year":2026},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:26.937748Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:8d6c305b48be8da2782e9e11a94281b4fbb285a71be82762f791666c6bbece61","observation_id":"cc429aa6-3d98-4253-925e-74242c1fe57c","resolution":{"observed_at":"2026-08-06T19:16:28.556184Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.658001Z","title":"SurgicalGPT: end- to-end language-vision gpt for visual question answering in surgery,","venue":null,"work_id":"b1200e6b-eac6-4dce-88f6-3d806063b761","year":2023},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:27.038306Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:22bd023c6a6b80bb199e26fac004f846fd4de2ab657c7ef8c992278dab71476e","observation_id":"b8139039-f99a-4380-bff2-cec957b4f141","resolution":{"observed_at":"2026-08-06T19:16:28.660351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19305","last_updated":"2024-08-06T21:07:17Z","snapshot_observed_at":"2026-07-06T18:52:51.827101Z","submitted_at":"2024-07-27T17:27:05Z","title":"GP-VLS: A general-purpose vision language model for surgery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19305","snapshot_observed_at":"2026-08-06T19:16:27.129903Z","title":"Gp-vls: A general-purpose vision language model for surgery,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:27.129903Z"},"links":{"cited_paper":"/paper/2407.19305","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:9fa6752ecd2ed410597c3b23b1b6eed7b95e213957a525f978185b01354e621d","observation_id":"e4fb52d0-fdf1-4ebc-a638-fdb81087c740","resolution":{"observed_at":"2026-08-06T19:16:27.129903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10937","last_updated":"2024-11-17T02:23:45Z","snapshot_observed_at":"2026-07-06T19:51:28.494860Z","submitted_at":"2024-11-17T02:23:45Z","title":"Memory-Augmented Multimodal LLMs for Surgical VQA via Self-Contained Inquiry","version":1},"cited_work":{"arxiv_id":"2411.10937","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.10937","snapshot_observed_at":"2026-08-06T19:16:28.472795Z","title":"Memory-Augmented Multimodal LLMs for Surgical VQA via Self-Contained Inquiry","venue":"cs.CV","work_id":"3676b2f2-3b59-450e-b730-c8e0531d68e0","year":2024},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:27.265067Z"},"links":{"cited_paper":"/paper/2411.10937","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:748b7805fdf4df664421c902eb0f12be2925282f6e704df19d3d3cdae9c1640f","observation_id":"bd189acf-cf1d-4fdb-ab37-cc9b89e35f58","resolution":{"observed_at":"2026-08-06T19:16:28.475802Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.651271Z","title":"EndoChat: Grounded multimodal large language model for endoscopic surgery,","venue":null,"work_id":"862a08b9-2b11-4f29-978e-89590bfb434d","year":2026},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:27.337137Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:f4c667e735378f6727d66220f0d2747f6c6949d24f97f79ce68dfdd55afed4fd","observation_id":"25cad293-13f7-4f4a-929a-d4e4fedb56c3","resolution":{"observed_at":"2026-08-06T19:16:28.653506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10948","last_updated":"2025-03-16T02:23:30Z","snapshot_observed_at":"2026-08-03T12:44:11.709304Z","submitted_at":"2024-03-22T08:38:27Z","title":"Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10948","snapshot_observed_at":"2026-08-06T19:16:27.414832Z","title":"Surgical-lvlm: Learning to adapt large vision-language model for grounded visual question answering in robotic surgery,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:27.414832Z"},"links":{"cited_paper":"/paper/2405.10948","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:3361dd65473423f42050b88cf1bac237bb315ad336b91ca74da84518409781fe","observation_id":"97e91f6d-a28e-40df-940a-9e7de7b00205","resolution":{"observed_at":"2026-08-06T19:16:27.414832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:27.535919Z","title":"Surgvidlm: Towards multi-grained surgical video under- standing with large language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:27.535919Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:bd2f319417efc7aaf2ca58f69e660c2ae8ce5ecbb81860d23ed04ae5a5478925","observation_id":"68526609-2a4f-4096-95e0-a7b957c3d626","resolution":{"observed_at":"2026-08-06T19:16:27.535919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02555","snapshot_observed_at":"2026-08-06T19:16:27.620334Z","title":"SurgVLM: A large vision-language model and sys- tematic evaluation benchmark for surgical intelligence,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:27.620334Z"},"links":{"cited_paper":"/paper/2506.02555","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:de9a64f6c18e77ff450ecd74ea4f2ceabbefc58b06041bf71a0aa44fee3088bf","observation_id":"4b4d878f-5b6e-40f6-9069-78358e2fbd1e","resolution":{"observed_at":"2026-08-06T19:16:27.620334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v40i8.37593","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.234732Z","title":"Surgpub-video: A comprehensive surgical video framework for enhanced surgical intelligence in vision-language model,","venue":null,"work_id":"50ba88ae-91b5-491e-bdbc-e5e685973f2c","year":2026},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:27.723320Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:861d78cfb943acfd7a9b6dc534c98795e69372624e6fcf28c30416664aa6974b","observation_id":"f7204c1d-c779-4cc2-ba9c-a5cf20e0314b","resolution":{"observed_at":"2026-08-06T19:16:28.239550Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:27.831023Z","title":"Sureon: A benchmark and vision-language-model for surgical reasoning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:27.831023Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:6a6a65464f3ad0393dac91fd6e82f9dde1272bb060e2f7699635ad32ea43a6b5","observation_id":"cd8fd1d4-7706-4e4f-a773-c260d65f8dee","resolution":{"observed_at":"2026-08-06T19:16:27.831023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.12430","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.343808Z","title":"Surg-r1: A hierarchical reasoning foundation model for scalable and interpretable surgical decision support with multi-center clinical validation,","venue":null,"work_id":"01cea894-8a78-48cc-83cc-1e60df1ac093","year":2026},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:27.941624Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:208012f614b358c6bf7639c8fa35cd54dd3557f1be1215b60172525c2d8a9d38","observation_id":"136d9212-341b-42ae-b7e9-e6d1426ddd5f","resolution":{"observed_at":"2026-08-06T19:16:28.347473Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.644724Z","title":"SurgLaVi: Large-scale hierarchical dataset for surgical vision- language representation learning,","venue":null,"work_id":"669f9a7d-e0af-407f-957c-eb52a5ba390d","year":2026},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.056780Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:6e31766416b182b65fbeccb8e660b6d84f3d6275529fc29fea4047e5b983502e","observation_id":"717923d7-f2fd-49db-bd05-ee8ae58b03c5","resolution":{"observed_at":"2026-08-06T19:16:28.646970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T19:16:28.136172Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.136172Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:375b2d690aae4ffe5fda190ae4d5304b7ff5c8197365ad834315876c41420618","observation_id":"64f43822-adb9-414e-b736-cf31fc894656","resolution":{"observed_at":"2026-08-06T19:16:28.136172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-06T19:16:28.181923Z","title":"Qwen3-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.181923Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:727b5e11c8c49975c093446b3763f232f06fbcb8fd932b11f7239504ee9d76f4","observation_id":"67698e45-8dc5-44e4-973a-7a4c64569730","resolution":{"observed_at":"2026-08-06T19:16:28.181923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.637105Z","title":"Autolaparo: A new dataset of integrated multi-tasks for image-guided surgical automation in laparoscopic hysterectomy,","venue":null,"work_id":"643e4498-73f3-4027-abfb-cbe70a9f80b0","year":2022},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.185229Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:88bd687e0242ad6eb1d3b2e4445941fa1a7107dcb3f23a5f77fc67418baa628b","observation_id":"93967ebe-14a0-4614-8b5a-0ed0f80be464","resolution":{"observed_at":"2026-08-06T19:16:28.639969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.630219Z","title":"Challenges in multi-centric generalization: phase and step recognition in roux-en-y gastric bypass surgery,","venue":null,"work_id":"9d38f1e1-a1ec-49f9-b296-17527464cb52","year":2024},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.191132Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:d7a32642a2b987779ff89bf6260837f406fdc88b75db8aa524acadbb0c545cf2","observation_id":"b1e46ec6-ce0e-4deb-8194-09af8456b6d3","resolution":{"observed_at":"2026-08-06T19:16:28.632595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.623736Z","title":"Comparative validation of machine learning al- gorithms for surgical workflow and skill analysis with the heichole benchmark,","venue":null,"work_id":"f68b04b1-a7ed-4b47-a68f-1cab7cfd2d35","year":2023},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.193433Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:6debe185c32e159b5da3ea341d70518f2281668f4012aba408a4c9161d2c9b5d","observation_id":"b79c36b0-48c3-4a08-9932-71a9f342d03b","resolution":{"observed_at":"2026-08-06T19:16:28.626158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.616664Z","title":"Pixel-wise recognition for holistic surgical scene understanding,","venue":null,"work_id":"59cfa2e8-bda9-4ef1-bbbf-bb8d6424d44d","year":2025},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.196016Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:dd4c053a7641e8609c71da418d73251eb8cc8adaa9d7268ed9e15880bbe84a6d","observation_id":"ff984555-5f78-400d-a0d0-7e9e5c778893","resolution":{"observed_at":"2026-08-06T19:16:28.619111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00496","last_updated":"2024-01-23T23:30:57Z","snapshot_observed_at":"2026-08-02T18:08:38.646548Z","submitted_at":"2023-12-31T13:32:18Z","title":"SAR-RARP50: Segmentation of surgical instrumentation and Action Recognition on Robot-Assisted Radical Prostatectomy Challenge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00496","snapshot_observed_at":"2026-08-06T19:16:28.199513Z","title":"Sar-rarp50: Segmentation of surgical instrumen- tation and action recognition on robot-assisted radical prostatectomy challenge,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.199513Z"},"links":{"cited_paper":"/paper/2401.00496","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:db366ce3531094e514c53d0cb86b2a3d8c5b699c7667cfc436a883dec00f9026","observation_id":"6ca237a7-78f1-44cf-87e6-c3b3f1f344f6","resolution":{"observed_at":"2026-08-06T19:16:28.199513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.609876Z","title":"Rendezvous: Attention mechanisms for the recogni- tion of surgical action triplets in endoscopic videos,","venue":null,"work_id":"7682e325-7fd6-4a55-b96a-35e0019e718f","year":2022},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.202488Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:7d6070d93e6415962e0cf3055bd4cf0a208cd8bfd55e909ab9959f52bf55305e","observation_id":"27cdd0c9-01f6-4873-9ec9-7783751a0f4c","resolution":{"observed_at":"2026-08-06T19:16:28.612150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.603248Z","title":"CIDEr: Consensus-based image description evaluation,","venue":null,"work_id":"ff115048-0a96-451a-aabe-48d8eaf5df52","year":2015},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.205281Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:ef6aa7a72d7c62756eb524590d1e04d4ccbce96f68c16b0710058650322b9de8","observation_id":"46544c62-d490-4df8-884a-4f613dd23d3b","resolution":{"observed_at":"2026-08-06T19:16:28.605647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.207980Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.207980Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:b93394823b7d97e22bc94fd4d9493b0f3d20813fd021b5f51ce2df4d94f67d3c","observation_id":"d4c3ef60-b9a1-4573-9b85-b53e87324f25","resolution":{"observed_at":"2026-08-06T19:16:28.207980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.592150Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":"e36b7180-1207-4485-ac4d-44734162b38a","year":2022},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.210797Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:0e471654b162a2d033293e9832a4f9a287174384449d0d2de464af54f4befa35","observation_id":"937cf28d-4ff9-4f05-b553-b478803defb8","resolution":{"observed_at":"2026-08-06T19:16:28.594685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:28.585128Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"5570765f-a304-49d4-9a1c-8a2c6a603992","year":2021},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.213522Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:e636c6c84124342deb7770d153a6df9b37a1498a03ad287563d6dcd3258baf4e","observation_id":"44fe6688-14bf-4106-b5b3-fb87ab1e301e","resolution":{"observed_at":"2026-08-06T19:16:28.587582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05201","last_updated":"2026-04-06T19:50:20Z","snapshot_observed_at":"2026-08-07T23:53:34.814339Z","submitted_at":"2025-07-07T17:01:44Z","title":"MedGemma Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05201","snapshot_observed_at":"2026-08-06T19:16:28.215749Z","title":"Medgemma technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:28.215749Z"},"links":{"cited_paper":"/paper/2507.05201","citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:21b3c49698800543696330746d1f0b0be9272b50743b2e5fd3ad7f12ca18499a","observation_id":"23f2984b-7346-4bdc-92e2-3373a7839a26","resolution":{"observed_at":"2026-08-06T19:16:28.215749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:16:25.272918Z","title":"Available: http://dx.doi.org/10.1038/s41551-017-0132-7","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:25.272918Z"},"links":{"citing_paper":"/paper/2608.04676"},"observation_digest":"sha256:9a49fea941d34fb6240cb06a314ac084bcc6a41a4e1fbf3eee13ad122767d454","observation_id":"c93ee9ae-d304-4127-81a1-1d8aa01e140e","resolution":{"observed_at":"2026-08-06T19:16:25.272918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.04676","last_updated":"2026-08-05T10:39:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T23:12:16.113122Z","submitted_at":"2026-08-05T10:39:19Z","title":"SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":4,"verified_fuzzy":25},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2608.04676."}