{"as_of":"2026-08-17T02:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b111f22e037144bf921de151b3d26992c81236785bf856b8a251d85223a9e64","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:46:04.028487Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T10:21:12.782864Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:10:07.463536Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"cited_work":{"arxiv_id":"2509.00357","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00357","snapshot_observed_at":"2026-07-04T20:10:07.463536Z","title":"Surgllm: A versatile large multimodal model with spatial fo- cus and temporal awareness for surgical video understand- ing","venue":null,"work_id":"0320b11d-be18-43bf-a9c1-8016aaab2166","year":2025},"citing_paper":{"arxiv_id":"2512.06581","last_updated":"2026-04-08T16:04:11Z","snapshot_observed_at":"2026-08-11T05:59:32.589284Z","submitted_at":"2025-12-06T22:27:59Z","title":"MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understanding","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T00:14:56.268778Z"},"links":{"cited_paper":"/paper/2509.00357","citing_paper":"/paper/2512.06581"},"observation_digest":"sha256:ad740960ed5e3b7c9ef25542566970dd412160586c000e03261a7862e09af5e1","observation_id":"4fcec152-4b85-40bc-99d7-cbf60b52f4d3","resolution":{"observed_at":"2026-05-17T00:18:43.977247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"cited_work":{"arxiv_id":"2509.00357","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00357","snapshot_observed_at":"2026-07-04T20:10:07.463536Z","title":"Surgllm: A versatile large multimodal model with spatial fo- cus and temporal awareness for surgical video understand- ing","venue":null,"work_id":"0320b11d-be18-43bf-a9c1-8016aaab2166","year":2025},"citing_paper":{"arxiv_id":"2604.20319","last_updated":"2026-04-22T08:18:21Z","snapshot_observed_at":"2026-08-15T22:03:05.535068Z","submitted_at":"2026-04-22T08:18:21Z","title":"SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T01:20:57.490329Z"},"links":{"cited_paper":"/paper/2509.00357","citing_paper":"/paper/2604.20319"},"observation_digest":"sha256:c9ecab3ab2f6f50baf1a8f9017d4d366469901a7dbe541d1dea5f98918457a96","observation_id":"97c66da6-743e-4d0f-b477-44569c64ee0b","resolution":{"observed_at":"2026-05-11T13:36:09.434932Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"cited_work":{"arxiv_id":"2509.00357","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00357","snapshot_observed_at":"2026-07-04T20:10:07.463536Z","title":"Surgllm: A versatile large multimodal model with spatial fo- cus and temporal awareness for surgical video understand- ing","venue":null,"work_id":"0320b11d-be18-43bf-a9c1-8016aaab2166","year":2025},"citing_paper":{"arxiv_id":"2606.11740","last_updated":"2026-06-10T07:16:27Z","snapshot_observed_at":"2026-08-02T02:17:16.809620Z","submitted_at":"2026-06-10T07:16:27Z","title":"UniReason-Med: A Shared Grounded Reasoning Interface for 2D-to-3D Transfer in Medical VQA","version":1},"reference_index":248,"source":"arxiv_source","source_observed_at":"2026-06-27T10:21:12.782864Z"},"links":{"cited_paper":"/paper/2509.00357","citing_paper":"/paper/2606.11740"},"observation_digest":"sha256:80f37fb372bdaf0b6d06f1c9f733ffcd095e4de1960d07cf80003e69bde63de1","observation_id":"b1dab9e5-d336-44c8-98f1-a63653adaa4b","resolution":{"observed_at":"2026-07-03T09:47:59.603325Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"cited_work":{"arxiv_id":"2509.00357","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00357","snapshot_observed_at":"2026-07-04T20:10:07.463536Z","title":"Surgllm: A versatile large multimodal model with spatial fo- cus and temporal awareness for surgical video understand- ing","venue":null,"work_id":"0320b11d-be18-43bf-a9c1-8016aaab2166","year":2025},"citing_paper":{"arxiv_id":"2606.25905","last_updated":"2026-06-24T14:53:56Z","snapshot_observed_at":"2026-07-07T00:00:17.090702Z","submitted_at":"2026-06-24T14:53:56Z","title":"SurgAtlas: A Large-Scale Surgical Video-Language Dataset with 2,391 Hours of Open and Minimally Invasive Surgery","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-25T20:39:21.354834Z"},"links":{"cited_paper":"/paper/2509.00357","citing_paper":"/paper/2606.25905"},"observation_digest":"sha256:e6f75e73636208754c34600383ca272c0d77a9808fbbb6d179f26f4d8fa2b23b","observation_id":"7d9cea1c-015e-4945-ab25-83aec58138ec","resolution":{"observed_at":"2026-07-04T20:10:07.467361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.00357/citation-record","integrity":"/paper/2509.00357/integrity","json":"/paper/2509.00357/citation-record.json","paper":"/paper/2509.00357"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:13.266481Z","title":"Surgical data science for next-generation interventions","venue":null,"work_id":"bf673852-4291-49ab-af3a-08693b183243","year":2017},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T13:45:58.139982Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:4f4ddbe582891e4eaa10b21ad0dab16d5ae7ee05ff457d6a5920e37e2550857c","observation_id":"bde208ee-86c7-4388-a550-b61c6ba2e331","resolution":{"observed_at":"2026-08-05T13:46:13.330799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:13.108780Z","title":"Artificial intelligence and automation in endoscopy and surgery","venue":null,"work_id":"cbfb4092-1c55-4b20-9899-6eaf66c7da0a","year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T13:45:58.199478Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:ba94ccee1116846e711f4210e578b15a421bc7a3e2e343cb60f158fe91fcd107","observation_id":"ae0d3318-e2b2-4121-b90f-f757de90ca42","resolution":{"observed_at":"2026-08-05T13:46:13.187001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:12.948458Z","title":"Concepts and trends in autonomy for robot-assisted surgery","venue":null,"work_id":"67dea6a9-4369-4bf7-ae48-126653269900","year":2022},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T13:45:58.295057Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:e7bf6892543be40713c8f691db0202646ccd94131d926a39b76fcb72450a61a7","observation_id":"3f1c7eac-69fb-4e4f-b71f-cb533b1b9ac7","resolution":{"observed_at":"2026-08-05T13:46:13.031985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:12.831513Z","title":"Robot-assisted minimally invasive surgery—surgical robotics in the data age","venue":null,"work_id":"f007121a-867f-4bfe-acf5-513943fbb0f9","year":2022},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T13:45:58.416135Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:64265505b31ea71bf46484002a2e49964c94df536192f57ce58bc76f63244e7b","observation_id":"8b8f47be-717e-4fe4-b5d9-db7906b72547","resolution":{"observed_at":"2026-08-05T13:46:12.901896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:12.642160Z","title":"Unified detection and tracking of instru- ments during retinal microsurgery","venue":null,"work_id":"f04744fc-e043-4bb8-a30e-dfc86d68ba06","year":2012},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T13:45:58.522659Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:c6b447a68883feaa55b2c2d5d327fedfb583686b4177ada7c3845f58cea101da","observation_id":"e91378e9-b936-4047-afb8-b3f1e5c61044","resolution":{"observed_at":"2026-08-05T13:46:12.678271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:12.383457Z","title":"Probabilistic tracking of affine-invariant anisotropic regions","venue":null,"work_id":"8bc0da5d-2de9-43a3-9a70-9156c2b1978e","year":2012},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T13:45:58.607109Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:54b6c316aef15c391859bdcaaa46f4052ac82e124a3044985b220f9da4737f95","observation_id":"0e22f557-60ea-4dee-87d2-3517b55614dd","resolution":{"observed_at":"2026-08-05T13:46:12.492618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:12.221020Z","title":"See- through vision with unsupervised scene occlusion reconstruction","venue":null,"work_id":"722bb1ed-8b80-4393-9f79-aab01ce0ec58","year":2021},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T13:45:58.696281Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:b246a825cadda83fc6b5e8807cb1f018fb55e20f93b5a82c853603c1eb106bb1","observation_id":"80aaa4c3-e956-47ec-b774-9303c85a8c79","resolution":{"observed_at":"2026-08-05T13:46:12.301453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:12.037108Z","title":"Surgicalsam: Efficient class promptable surgical instrument segmentation","venue":null,"work_id":"747b18fd-9573-494c-bb94-a8415836439d","year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T13:45:58.776280Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:fd16e8c13f192c4f992c9be00886e392fb58acb382f2a4a02f69057080f04931","observation_id":"315594cd-f70c-4b7d-965a-94edb03070bd","resolution":{"observed_at":"2026-08-05T13:46:12.122406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:11.866586Z","title":"Asi-seg: Audio- driven surgical instrument segmentation with surgeon intention understanding","venue":null,"work_id":"ebf2dc83-939f-4621-b538-70d61eca182d","year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T13:45:58.866106Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:c3b92004d4919af12b169be99cfc2df306e86ce53eb094554b599182be1d9768","observation_id":"a8f8718d-01e2-428d-95cf-5b5e5620fe12","resolution":{"observed_at":"2026-08-05T13:46:11.949550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:11.500493Z","title":"Temporal memory relation network for workflow recognition from surgical video","venue":null,"work_id":"28774806-61a3-4242-bc0c-4e3b07869a3f","year":1911},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T13:45:59.084621Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:12bfcb2fb2de849e702fae38cf1b3b3432d1bc45316a7503143e29980ad2ae0e","observation_id":"efb765ad-503e-4e8a-af3c-4a81d828817b","resolution":{"observed_at":"2026-08-05T13:46:11.590975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:11.360331Z","title":"Surgplan: Surgical phase localization network for phase recognition","venue":null,"work_id":"66a7f1a1-8760-43f8-91da-e10f342cf19f","year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T13:45:59.179444Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:b8d23b1b94d85206b816e3afbd5fe2cbc428f656fb0fc78c7c4eb54a5cb6d3b8","observation_id":"15b93f16-1c2d-4cdd-86b1-32ccd3ad0811","resolution":{"observed_at":"2026-08-05T13:46:11.432385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:11.211652Z","title":"Soh, and Yousuf M","venue":null,"work_id":"7480ceb9-817b-425a-8562-746e1615c53c","year":2015},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T13:45:59.279211Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:e8beb040e0e613286a3c364b3cf66d312c831534f71fddff4409e3f37d4d7b63","observation_id":"9944a501-ac37-4bc2-8ffb-f8ef3832f71a","resolution":{"observed_at":"2026-08-05T13:46:11.267979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:11.089475Z","title":"Video-based surgical skill assessment using 3d convolutional neural networks","venue":null,"work_id":"1c61b9a1-b2e2-44d9-8e78-db82db3a0b11","year":2019},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T13:45:59.418640Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:6f8313df497e4e16e8a5a330c8f67940e42174361153a5cb119cd9f3788d9770","observation_id":"a1483415-ee70-4693-b1d2-baabda3a70b1","resolution":{"observed_at":"2026-08-05T13:46:11.151975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:10.916414Z","title":"Towards unified surgical skill assessment","venue":null,"work_id":"a030ffef-18f5-4227-9cef-30a1370ea640","year":2021},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T13:45:59.495508Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:ee6ab7c5dcec70681ab2ab98b128c1db1775daa3e9639d3bcdc10704d5ebe2b8","observation_id":"7992a462-39d6-4106-9d1a-d8af4acbbe5c","resolution":{"observed_at":"2026-08-05T13:46:11.005376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:10.803081Z","title":"Rethinking surgical captioning: End-to-end window-based mlp transformer using patches","venue":null,"work_id":"1913530f-041d-4c6b-98f4-89d1e69a82eb","year":2022},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T13:45:59.582395Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:db1a29482d40f126783c36af3f9ef53f8b738b75524740e1fe0e2d601c13fdf0","observation_id":"2f0bcd88-9f21-48ef-a572-78e10842f6a0","resolution":{"observed_at":"2026-08-05T13:46:10.857806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:10.653644Z","title":"Surgical video captioning with mutual-modal concept alignment","venue":null,"work_id":"443bd0df-2e1f-4f72-b38c-d6d11066a3c8","year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T13:45:59.659814Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:3ab6b28210c5a398c258e6d067917dbf5378f0f74d170b5632897ea4105f3f63","observation_id":"5570769a-5867-4709-96e3-6acd868ba715","resolution":{"observed_at":"2026-08-05T13:46:10.725275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:10.517154Z","title":"Surgicalgpt: end-to-end language-vision gpt for visual question answering in surgery","venue":null,"work_id":"fe9ffb89-5999-4659-a838-ddc7d3d22135","year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T13:45:59.746768Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:ac9a52ac4fd39dd4223c89f5ab212219a83838183202459cea1af1ffa21b30c4","observation_id":"22ba0eaa-faa6-414d-b617-0704b2dc6cd5","resolution":{"observed_at":"2026-08-05T13:46:10.580357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:10.378593Z","title":"Surgical-vqla++: Adversarial contrastive learning for calibrated robust visual question-localized answering in robotic surgery","venue":null,"work_id":"7fd5f65d-cf99-4048-ac3f-22ae12f787ee","year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T13:45:59.822635Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:287bbb14cf992303dad930362433430aefc3d9b74911f860f1730dc8c8481767","observation_id":"809360b6-e2d7-46f3-abcc-3d80cdfd3442","resolution":{"observed_at":"2026-08-05T13:46:10.460455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:45:59.904943Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T13:45:59.904943Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:87d6f9e3fa3049b39c749e406f859c78ed4d60175e4d7b968f54fce167f2b371","observation_id":"0dd851f8-7234-4fe3-a5cb-81983fdf3456","resolution":{"observed_at":"2026-08-05T13:45:59.904943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:10.224103Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"e286e7d8-ae89-4b40-b0c1-4e4f67aad9ef","year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:00.022846Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:512b483fbf502bc5712fb3d02e1e4a06714bcc91f56b6024345ef6b72d377f43","observation_id":"a18eefa9-0c52-45e0-a14e-5d12ebbd1104","resolution":{"observed_at":"2026-08-05T13:46:10.286641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:10.129053Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"85b7adf7-0788-43c4-a8ab-14b380f54ea9","year":2022},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:00.154107Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:b58cfd2e38ece5cf19b27cb025afcc6c77caa48a3fe28122d2d6b71521485cb0","observation_id":"86bc1824-7d15-474a-b930-36739d2dced1","resolution":{"observed_at":"2026-08-05T13:46:10.176055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T13:46:00.218409Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:00.218409Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:19f42d12ae5d9781058e11e9c8569374d34b3617001fa15ee7a80a14ec372f14","observation_id":"c46af9b9-f3e3-489f-a3fd-21c5ef62b6b6","resolution":{"observed_at":"2026-08-05T13:46:00.218409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:10.017888Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"4f6f925c-886e-4e66-a69b-75b81d7efae4","year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:00.296188Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:dce10212a465a7ad269a7068e8fb2cd4efb2625e5e9a5909d6990f672d16a066","observation_id":"44bc9517-71c8-42be-89d3-987c1f93db7b","resolution":{"observed_at":"2026-08-05T13:46:10.058800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T13:46:00.396009Z","title":"Mixtral of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:00.396009Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:b8276554c7d11975596a41c90d730041a96749f3493323be9793fe081939e8f2","observation_id":"73f53d68-f623-46ee-bed6-9afecd53afd8","resolution":{"observed_at":"2026-08-05T13:46:00.396009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T13:46:00.481201Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:00.481201Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:eddf711443e8ae3868717289e868bc48ece6fd66745550ca61a66132c144cb21","observation_id":"42792db4-5636-488e-bcea-36614d3ea000","resolution":{"observed_at":"2026-08-05T13:46:00.481201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:09.904561Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"d00712e3-c52e-4302-9767-dc540cb519da","year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:00.554931Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:98725b2deaa1b9e630b6ab3474456149b022a892297ef395e51001d3fe43497e","observation_id":"da421f6c-360b-4fe3-a731-84faf7065e23","resolution":{"observed_at":"2026-08-05T13:46:09.948390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:09.761451Z","title":"Visual instruction tuning","venue":null,"work_id":"14808c0f-0e3a-4453-acf9-d5ecfafb34fb","year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:00.617943Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:49fc4662e455b964aa5adc9183f413b1c17787936a2ce3756fd4027206766706","observation_id":"1c2454e0-f1ec-483e-8e68-69a3b5d2f99e","resolution":{"observed_at":"2026-08-05T13:46:09.826787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-15T07:01:36.213052Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-05T13:46:00.695279Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:00.695279Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:b06f54180db7883f5eff14209e43f08ad5946b6b95fc0d9b60a2ab88598a064d","observation_id":"7c7f718d-981c-467c-9bf8-88c6cc4c6245","resolution":{"observed_at":"2026-08-05T13:46:00.695279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:09.641485Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":"16d339e1-6397-48b0-9c75-ce32fe402ffe","year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:00.751676Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:230bea23021d0875682a433b1a8bad4d98c64c1c392182742a5594d479897628","observation_id":"1d98a974-2c6e-4fd6-8dd8-2422c60060a2","resolution":{"observed_at":"2026-08-05T13:46:09.697320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:09.481085Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"33e3cb5b-39bb-447b-90cb-a05a7e4fc8c9","year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:00.806873Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:71738aff27f66b9c6ecf480898cc1e373b44625758ab2fa6595c20d4410b5721","observation_id":"810b85be-4bb3-4e56-a24b-2afc94f49337","resolution":{"observed_at":"2026-08-05T13:46:09.534337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-05T13:46:00.880890Z","title":"Video-llama: An instruction- tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:00.880890Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:24b8292665626a4306ba995af7cc51b9838703655f22c7410b547f0b52d76097","observation_id":"59b154f5-511d-4bca-bd4c-d6dad0b902d3","resolution":{"observed_at":"2026-08-05T13:46:00.880890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T13:46:00.965412Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:00.965412Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:55b62e9dabe328c7abdf59715284198704eb31349e72f731fbc36c9003c6e9e3","observation_id":"2d5ca37d-e2c9-4f82-b49b-ee40ac9bcf63","resolution":{"observed_at":"2026-08-05T13:46:00.965412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T13:46:01.035784Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:01.035784Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:0d1c8af333c5d93fecc53bfdbaac689f3e5ecfa67026313ec9109ae423b96df7","observation_id":"14cba6e0-9872-43a6-9cb5-923690cb683a","resolution":{"observed_at":"2026-08-05T13:46:01.035784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-16T14:39:31.347488Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-05T13:46:01.099735Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:01.099735Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:7585677ba3a86d6432ece66037d3baf801713975998e98874a1631aa0190d392","observation_id":"f98a0e98-a01c-4b5a-a1a9-de828b50673f","resolution":{"observed_at":"2026-08-05T13:46:01.099735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:09.356080Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"4b274223-895b-4c1a-9122-9ebecee9c0a6","year":null},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:01.160788Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:0b23cbba243970f53aa4b7d33c4c5419baf991c21bb0e275303612be03949662","observation_id":"51e14792-e6d1-410a-a1ee-13c32832f1e9","resolution":{"observed_at":"2026-08-05T13:46:09.424921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:09.216197Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"fb839a0a-180c-4427-bcab-9f3c77ea2102","year":2022},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:01.217442Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:b608845c808a43009d916a513f46096d7f7a54b02122dfad927016abf6fb10e8","observation_id":"ebad81fb-6081-4582-977b-3e25b0c8cbf1","resolution":{"observed_at":"2026-08-05T13:46:09.271724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:09.078574Z","title":"Surgplan: Surgical phase localization network for phase recognition","venue":null,"work_id":"8b0cce94-f593-4902-a8c1-e9d291bc6412","year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:01.274963Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:4125b734fda79e9a4798554e24048f70b75852232c304298e304c319245fe788","observation_id":"95c795aa-d680-469f-aef2-9aeed25bc0f3","resolution":{"observed_at":"2026-08-05T13:46:09.161305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:08.939800Z","title":"Surgical temporal action-aware network with sequence regularization for phase recognition","venue":null,"work_id":"5a3a4a7b-d052-4e83-8012-5492da481e83","year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:01.353339Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:fbcb87b5df49cc3b875cd7aad758f05b11047d630a41fe9b02ff1f8da88401ff","observation_id":"c7707a72-41f5-4136-8b22-b836d67be0e9","resolution":{"observed_at":"2026-08-05T13:46:09.015191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:08.829294Z","title":"Team-based surgical scheduling for improved patient access in a high-volume, tertiary head and neck cancer center","venue":null,"work_id":"aa4767fd-3f92-4c64-b79a-0fcbafb24c35","year":2022},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:01.413065Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:0338c5bdd02a34da137a3cbcecd7ecc90538b21e4e31925b315b6be98525ae3a","observation_id":"b2380400-8772-4fa4-85ab-3df92d74ee12","resolution":{"observed_at":"2026-08-05T13:46:08.887936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:08.722368Z","title":"The loud surgeon behind the console: understanding team activities during robot- assisted surgery","venue":null,"work_id":"520a020c-70aa-4b3f-8e10-e8e9a3daf326","year":2016},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:01.473184Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:b095b28a961eace35b5c4c97a323713e065d7b7b6daf7ec79c9a8ad301e1f695","observation_id":"59e9dd8e-b751-45e2-a21d-22ca09edf9be","resolution":{"observed_at":"2026-08-05T13:46:08.758300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T13:46:01.537622Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:01.537622Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:4a17c754cc41e01de525ffcb6217c97d365a313ea2d0a38a4523634cb3703f2f","observation_id":"42adbfc4-cee6-4148-924c-fb69c2c67615","resolution":{"observed_at":"2026-08-05T13:46:01.537622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:08.577795Z","title":"Surgical data science: Emerging trends and future pathways","venue":null,"work_id":"aef105fb-f09b-441f-88c1-755b07906f1b","year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:01.622691Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:f130250be2478b687a947ceee9b3ee409f8e4307eb85a4a3cf4ab6ee0272d807","observation_id":"c2064393-3ed0-4520-bfaf-f83da2a33142","resolution":{"observed_at":"2026-08-05T13:46:08.626916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:08.443554Z","title":"Artificial intelligence in surgery: the future is now","venue":null,"work_id":"a5114c0f-0645-4d6a-8ca1-b1db71e21358","year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:01.688637Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:fbf998df911744a65f3c3fcac59caf7414baf1c3a0ec218d6c2d77612fc2225c","observation_id":"894e2191-f7a9-4c60-92c0-86d30a1a9db9","resolution":{"observed_at":"2026-08-05T13:46:08.511424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08272","last_updated":"2024-05-14T02:05:36Z","snapshot_observed_at":"2026-08-16T13:52:58.112781Z","submitted_at":"2024-05-14T02:05:36Z","title":"VS-Assistant: Versatile Surgery Assistant on the Demand of Surgeons","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08272","snapshot_observed_at":"2026-08-05T13:46:01.724573Z","title":"Vs-assistant: versatile surgery assistant on the demand of surgeons","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:01.724573Z"},"links":{"cited_paper":"/paper/2405.08272","citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:d24cd3dcafec5bcde34cbff60190e3570ae54e1f115132a5dc8fdb1b518c799f","observation_id":"4fd9c79d-c408-4995-9e1d-df078cfb01fb","resolution":{"observed_at":"2026-08-05T13:46:01.724573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:11.675885Z","title":"Endonet: a deep architecture for recognition tasks on laparoscopic videos","venue":null,"work_id":"ba7c0e1e-e003-43dc-aae0-1f4391b55ee8","year":2016},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:01.805754Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:ec5387a39c96725a72c356a9c37046f5158268bd2d9741ad0279c94f8c65e987","observation_id":"f62c3537-221e-40a3-baa9-7925ad45beb0","resolution":{"observed_at":"2026-08-05T13:46:11.768251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:08.287400Z","title":"Rendezvous: Attention mechanisms for the recogni- tion of surgical action triplets in endoscopic videos","venue":null,"work_id":"f38d8068-255a-488b-aa50-71e80eae3149","year":2022},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:01.872828Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:3db85d08389e80e9e4798ab12bce78d216db1f6254a5995cc78b8fcb243cbcb5","observation_id":"2684c4b0-6519-4c83-942e-f6681c42ccc7","resolution":{"observed_at":"2026-08-05T13:46:08.348420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:08.101822Z","title":"2017 robotic instrument segmentation challenge","venue":null,"work_id":"69fa0ada-1b06-4b8a-8567-52466b867532","year":2017},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:01.951719Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:9a2bce692da66c2f4c13a54140233411c706b309c0ed7c60d94433293646e1e9","observation_id":"3428f381-5539-41c5-b939-68601374702a","resolution":{"observed_at":"2026-08-05T13:46:08.185574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:07.942398Z","title":"2018 robotic scene segmentation challenge","venue":null,"work_id":"c86cab00-ff9f-4dd5-9371-ebfb6b5bab03","year":2018},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:02.045083Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:f982f11dbecdb35753b355983ea21c39f05e69eb3f041a165f7a28b52751dc8a","observation_id":"aa68c832-2df1-42d4-9b31-32be44fbbe42","resolution":{"observed_at":"2026-08-05T13:46:08.002853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:07.772305Z","title":"Surgical-vqa: Visual question answering in surgical scenes using transformer","venue":null,"work_id":"cbf183ee-9e8b-4e15-9a27-e51ad13d624b","year":2022},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:02.128179Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:1e4a4f809038c47764e25bf8a74e7c3134a30cfdaceef51f293355176747943e","observation_id":"9abe3cdb-ffdf-48c6-83c2-d6d19b364799","resolution":{"observed_at":"2026-08-05T13:46:07.840383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:07.592490Z","title":"Advancing surgical vqa with scene graph knowledge","venue":null,"work_id":"5176c5f2-b919-47a8-b9fc-332fbd19ee41","year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:02.183616Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:805d3cbdc856b7868ab7b5349c9d5a5dd9868a8fd340930e0745e563a9ca9049","observation_id":"37e2442b-ba85-4641-95a7-b9087e1c004b","resolution":{"observed_at":"2026-08-05T13:46:07.707927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:07.385214Z","title":"Surgical activity triplet recognition via triplet disentanglement","venue":null,"work_id":"ee657c19-b53c-42af-8dcf-199ca3646619","year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:02.270060Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:60883e44f3e6499d6d0948c39d70649538a7eea230b941a0b35bd7dcdc3e89b4","observation_id":"834f64f9-1934-47d0-bcbc-d881793151d9","resolution":{"observed_at":"2026-08-05T13:46:07.491061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:07.228172Z","title":"Rich feature hierarchies for accurate object detection and semantic segmentation","venue":null,"work_id":"1c08fdfc-9908-4461-b612-a8851c5f1026","year":2014},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:02.304698Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:1e6019b530f660b970fcedd8b9771be5e267f9896674bfd2782b5afbd5172130","observation_id":"b31fb006-a5dc-4be4-9d7a-9d5a96b01617","resolution":{"observed_at":"2026-08-05T13:46:07.301838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:07.090211Z","title":"Fast r-cnn","venue":null,"work_id":"c6d78d03-bfe7-430c-bb75-d20528145e6c","year":2015},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:02.329084Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:4ff65c5850839ef5341b88fb36525e6a2726d091cb52d3d97101a1eb8cdba915","observation_id":"0fe3dc8d-7369-4ad1-a924-1711b2a160ba","resolution":{"observed_at":"2026-08-05T13:46:07.157458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:06.944358Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":"a3ca3b2d-5032-45a1-9199-76aa6b093aa5","year":2015},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:02.351250Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:b36c461ed9258a647e050fa0ebf036080ca1fcf68e58a9937a35ec440ab8e474","observation_id":"bac1df32-80df-41bc-8783-b6147ce0efd7","resolution":{"observed_at":"2026-08-05T13:46:07.002067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:02.387592Z","title":"You only look once: Unified, real-time object detection","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:02.387592Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:d2ab375e9da2d7f190cce3e337ac8ca58680eaca724f2b878c6782f95358502d","observation_id":"77adb1ef-6837-4eae-a0da-2fb0124905df","resolution":{"observed_at":"2026-08-05T13:46:02.387592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:06.761755Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"838c5191-d281-4c78-a2e8-036f67c891fe","year":2021},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:02.478450Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:937f59ff2d634dac349e74c76edfaf7d25c43d19e59f526fd590cdc49a6c1e7b","observation_id":"2addbd44-98e4-46ff-a1a2-4423eda3fd57","resolution":{"observed_at":"2026-08-05T13:46:06.828045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:06.615734Z","title":"nnu-net: a self-configuring method for deep learning- based biomedical image segmentation","venue":null,"work_id":"81c593b4-0330-4c8a-aa76-ba6c0a14e561","year":2021},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:02.545792Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:c603f9d8f2d328d810ad919c44f5e213ebffa4fc7dda3b834b66272d650903fa","observation_id":"93c00aa5-e7d2-45a0-b13c-1494f59e70ab","resolution":{"observed_at":"2026-08-05T13:46:06.672101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.07219","last_updated":"2021-12-14T08:11:02Z","snapshot_observed_at":"2026-08-16T17:34:51.763782Z","submitted_at":"2021-12-14T08:11:02Z","title":"A real-time spatiotemporal AI model analyzes skill in open surgical videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.07219","snapshot_observed_at":"2026-08-05T13:46:02.644311Z","title":"A real-time spatiotemporal ai model analyzes skill in open surgical videos","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:02.644311Z"},"links":{"cited_paper":"/paper/2112.07219","citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:909252b64aebe76862aa3101c6e990ec94b935224e081c574db95c3d242a0f94","observation_id":"adfd7401-7eaa-4fa5-bc04-a987fe9763b0","resolution":{"observed_at":"2026-08-05T13:46:02.644311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:06.444633Z","title":"Improving surgical techniques: Use of surgical procedures videos as learning tools-a multicentric study","venue":null,"work_id":"01d64090-bdb4-4f45-a257-9850b122452e","year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:02.789076Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:9bd532ec3cd3d7bb0e7ee5adfb295c78a58a3a0207ad17c7a1d77f75e0350f9f","observation_id":"9b35a9a8-c5d1-47c6-8aac-be098586cc0d","resolution":{"observed_at":"2026-08-05T13:46:06.533360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08003","last_updated":"2024-07-02T03:45:56Z","snapshot_observed_at":"2026-08-16T14:10:27.237009Z","submitted_at":"2024-03-12T18:12:42Z","title":"Augmenting Efficient Real-time Surgical Instrument Segmentation in Video with Point Tracking and Segment Anything","version":2},"cited_work":{"arxiv_id":"2403.08003","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.08003","snapshot_observed_at":"2026-08-05T13:46:04.565031Z","title":"Augmenting Efficient Real-time Surgical Instrument Segmentation in Video with Point Tracking and Segment Anything","venue":"cs.CV","work_id":"b00b907d-67f4-41b1-892f-62430a9b9231","year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:02.911403Z"},"links":{"cited_paper":"/paper/2403.08003","citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:20973a8ff7fc9c7463fbba0133b8263db8524b97225268c0d0220693c18c8d30","observation_id":"db89e269-7d84-4e4c-bb2b-0401c22b4792","resolution":{"observed_at":"2026-08-05T13:46:04.650862Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:06.306866Z","title":"Generative artificial intelligence in surgery","venue":null,"work_id":"ce3b9891-16c4-44e8-a1bb-a7b97330fb93","year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:03.034571Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:6a13cb1855a64452638ac1b82096d07c06b8005f233564fec5dd8d1c35423b5d","observation_id":"131e2a0e-caad-491d-9fd6-2af8ac254bdf","resolution":{"observed_at":"2026-08-05T13:46:06.356342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:03.161645Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:03.161645Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:5b37c31216bd76f562798cd210a1946ed90368c04ff9aef2412df216768e8c58","observation_id":"1c9a743d-caf2-4cba-997f-e90e94e6d8b8","resolution":{"observed_at":"2026-08-05T13:46:03.161645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:03.193108Z","title":"Video understanding with large language models: A survey.arXiv preprint arXiv:2312.17432, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:03.193108Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:22fd4ccd73a5c2c6a146f702148e67aaed8b182d3d0b7db95005420da28d2d93","observation_id":"4dc63890-4256-4950-ba34-7261808f1f3f","resolution":{"observed_at":"2026-08-05T13:46:03.193108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-05T13:46:03.231674Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:03.231674Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:c38f27b33fd8efce82ec40bc7c228dec03a3d64a4d61b55447a8187068b0a336","observation_id":"e415d0d4-be99-4788-82cc-0caaa4d12129","resolution":{"observed_at":"2026-08-05T13:46:03.231674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-08-16T15:37:09.325292Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-08-05T13:46:03.282561Z","title":"Chatvideo: A tracklet-centric multimodal and versatile video understanding system","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:03.282561Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:0d3b728a8427594d1c195798346c7be5a98fdfce5a0753cd422fd5ba52f797d2","observation_id":"c9e2d0ce-b931-4d3f-84e6-2435b6d1b4d1","resolution":{"observed_at":"2026-08-05T13:46:03.282561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-05T13:46:03.368638Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:03.368638Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:6fb6a5af98651b2092d233290e5426bc481b97d62aebca1ffc9747a0fefdc2c5","observation_id":"092a05a8-d0e4-418b-9b00-e4a257951581","resolution":{"observed_at":"2026-08-05T13:46:03.368638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:06.129049Z","title":"Languagebind: Extending video-language pretraining to n-modality by language- based semantic alignment, 2023","venue":null,"work_id":"5f7c25bc-90c3-44ed-a1a4-ecdfeb501b23","year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:03.411646Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:cff97f405151b3d5b637cfae436947f1fd487983751cfc595d4699655722a794","observation_id":"9c437b1e-b594-4dc4-9516-21d9636b5583","resolution":{"observed_at":"2026-08-05T13:46:06.195929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-05T13:46:03.460362Z","title":"Videollama 2: Advancing spatial-temporal mod- eling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:03.460362Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:03194e418b82f0f3cc4f0219c4d3d035365bb03edbd50dd55c954e63635ce36b","observation_id":"cb284694-c4dc-4451-912c-38ebcfcc4188","resolution":{"observed_at":"2026-08-05T13:46:03.460362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:05.973726Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":"f964a758-ac76-4966-a6a8-5fc927191c95","year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:03.465640Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:8c2e4b971e2217d0b7e71dc8b74b63c01df9c8d4c8d883a61b168486554f8fec","observation_id":"35cd8b61-10af-4121-b98a-f26f312e9455","resolution":{"observed_at":"2026-08-05T13:46:06.042839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:05.799490Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":"e0faeca8-9421-4af0-9a6f-7d73c6ef9657","year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:03.493495Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:078eaa8f3200884bec0d15c89ba0d2062f5ad725dd36a1fd88f2690ba40fa2eb","observation_id":"ea332b6e-3d3f-4907-b6a8-c9f15b6b84a2","resolution":{"observed_at":"2026-08-05T13:46:05.890395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:05.675873Z","title":"Chat-univi: Unified visual representation empowers large language models with image and video understanding","venue":null,"work_id":"fe5cf5e6-04d2-4c8f-8e6e-da6937e0393d","year":2024},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:03.560461Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:3f19462f0400679fc21bd1e5da95e4f1fc7684a912eed51a1fb0f7b4e273f684","observation_id":"dd924638-0eb0-4ff8-a0d3-ccd34676dec6","resolution":{"observed_at":"2026-08-05T13:46:05.738076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:05.529200Z","title":"Unmasked teacher: Towards training-efficient video foundation models","venue":null,"work_id":"2adb1196-29f3-465f-9643-43276bdd7629","year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:03.626831Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:76ca2f13ce2c25cd117eafbe54190cf20ba2e377a310796ba1e220d27d339ba8","observation_id":"54416aee-ca14-4319-bd9f-3dc3f4801778","resolution":{"observed_at":"2026-08-05T13:46:05.579207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2204.14746","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:04.261673Z","title":"Gonzalez, and Nicolas Padoy","venue":null,"work_id":"ab415df8-f999-40fb-8683-a8527c9bc789","year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:03.700788Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:a9b856861563c2bb7301dae0f386320ce84681bb0040c438a5b4e9e0bf69c2b6","observation_id":"7153bcf8-16fa-43dd-8908-da89084000b2","resolution":{"observed_at":"2026-08-05T13:46:04.326020Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-16T19:40:28.523700Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T13:46:03.773427Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:03.773427Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:bfe4778f66d1996b3cc620f4deeccd5da8df9e25eb3f68804b01f6705e54342f","observation_id":"c69a8d00-89f2-4d33-b8b6-7397af76cdbe","resolution":{"observed_at":"2026-08-05T13:46:03.773427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:03.833343Z","title":"Automatic differentiation in pytorch","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:03.833343Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:5fa73e4e622a2aacc6d6f2c990f31bc337d79301ab6127fd4d78e8e06fadd3bc","observation_id":"fac9e756-a098-49bc-b723-1251ca969b96","resolution":{"observed_at":"2026-08-05T13:46:03.833343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:05.435833Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"1c998801-b4d1-48a7-920c-ad0d8c5585db","year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:03.883206Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:d8aea2533dacbdc2d35ae4463284ca8855adb714de0f83800cd591c66a76ab3f","observation_id":"d41610c3-ab3e-469d-be31-43402c101ab4","resolution":{"observed_at":"2026-08-05T13:46:05.449627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:03.959584Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:03.959584Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:0215307c6e30be9f773a19d13bfe2353a7ef9296f33ee591c1f0a336790cbb9f","observation_id":"86ccb3c2-956c-493b-9035-e5fa4751c805","resolution":{"observed_at":"2026-08-05T13:46:03.959584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:05.233392Z","title":"Cider: Consensus-based image description evaluation","venue":null,"work_id":"42e84f84-1705-4d88-afbd-895a43aad0d1","year":2015},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:03.975884Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:99cffccf7afb2746f02620c9e2e0948ed6a398435eb1dd484fb439229ccab53f","observation_id":"cb119f43-295c-42f7-ac49-d8f735b029d1","resolution":{"observed_at":"2026-08-05T13:46:05.298161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:46:05.011404Z","title":"Calot's triangle dissection","venue":null,"work_id":"b9315644-3149-4aac-a860-9981041f7fca","year":2005},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:04.028487Z"},"links":{"citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:0e6d07d05cfca0b88331667ebbb9ed69740f1207760db157c5a1a2e9b1611af3","observation_id":"100205c3-213c-421c-a96a-874cb235e58d","resolution":{"observed_at":"2026-08-05T13:46:05.109410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T01:05:56.835803Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":2,"verified_fuzzy":55},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 4 inbound Pith citation observations for arXiv:2509.00357."}