{"as_of":"2026-08-17T19:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:86c3c0828ec21e00f414d1a6209abb6092798201c1461a3fb91eca199882fcba","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:43:43.323375Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T03:15:40.944411Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T03:16:18.683507Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"cited_work":{"arxiv_id":"2504.19918","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19918","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing surgical documentation through multimodal visual-temporal transformers and generative ai","venue":null,"work_id":"307bce19-4967-49d4-88bb-1711a5e4319e","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-08-16T13:19:00.029881Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2504.19918","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:d5f1d1d44661a4cc6c929cd866ff1e7fa8653d956c9a9d2a79d93d8bedd460b9","observation_id":"5758488c-4032-45a5-a1b7-4bada09099ed","resolution":{"observed_at":"2026-05-12T03:16:18.685120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.19918/citation-record","integrity":"/paper/2504.19918/integrity","json":"/paper/2504.19918/citation-record.json","paper":"/paper/2504.19918"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.358704Z","title":"Gaze-assisted automatic captioning of fetal ultrasound videos using three-way multi-modal deep neural networks","venue":null,"work_id":"1d57fb97-1867-4125-ad4f-09f2dd07d470","year":2022},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:41.901887Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:cc0874afbf81aac0fdf58deea54894f5dfb4d341ac03669e7d55eadcdc76bdf7","observation_id":"65b91c13-a6f5-46ea-aba4-1869d9f6ba08","resolution":{"observed_at":"2026-08-16T05:43:45.444080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.045511Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.045511Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:7aa7c8b5b296caecb53d56fcd3587cc08b4841fde6ab1b6fcdcb330b8d00022c","observation_id":"280b488c-fd8d-487b-9ffa-85a235bc249e","resolution":{"observed_at":"2026-08-16T05:43:42.045511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.340633Z","title":"Croma: Cross-modal attention for visual question answering in robotic surgery","venue":null,"work_id":"c15324ac-47ce-4246-91ed-7649dca16875","year":2024},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.094303Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:7b8d2ec0306595a153b018da294a0ce8ed63641ef0b97c52744e27c82b22b0f3","observation_id":"022d5a76-e071-460c-856a-0ba400f6845e","resolution":{"observed_at":"2026-08-16T05:43:45.344698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.329457Z","title":"Vivit: A video vision transformer","venue":null,"work_id":"a76b0aa8-8f42-4a34-84da-b727840021e9","year":2021},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.098989Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:acc6bb5ffd3af70da84f302c32fdc0377d3d7a152e7354299a8c00e9be278a1c","observation_id":"51231b20-71de-4633-97ae-83c22eb59cdd","resolution":{"observed_at":"2026-08-16T05:43:45.333637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.318013Z","title":"Video-based coaching in surgical education: a systematic review and meta-analysis","venue":null,"work_id":"25da00f6-480c-456f-81b4-7a4e1ab4fa16","year":2020},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.103523Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:8682c1ad867066500dd7510048219559e4d8edc8b5eb625a9b69e27fe7291798","observation_id":"039eefb5-dc0a-4d47-8dd1-0f44e18d48ad","resolution":{"observed_at":"2026-08-16T05:43:45.321896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-16T14:04:54.843248Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-16T05:43:42.108010Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.108010Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:1bf9dc7293c8b80a0019ba913f634e80b85cda8f99ea257911091e4145f47c71","observation_id":"603f2386-1211-4df2-b3dd-0cd525f62106","resolution":{"observed_at":"2026-08-16T05:43:42.108010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.306892Z","title":"Space-time attention networks for video understanding","venue":null,"work_id":"68211bee-747d-462c-9b1e-4f652ef97fd6","year":2021},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.112743Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:e819230f5be66335ba5b57e48fa442fbb69d8ad60449c4b68ea3c74a6951fb63","observation_id":"6914d4e4-bb35-4512-aaaa-0345ebd44a15","resolution":{"observed_at":"2026-08-16T05:43:45.310249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.296286Z","title":"Language models are few-shot learners","venue":null,"work_id":"97a5085b-b079-43dc-85d5-d4bff8b60250","year":1901},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.117842Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:1614b72a8d3b144f2b0b60fe23f3a90136f75dc2398660aa7b2d11eae10048c0","observation_id":"c6600e4a-58ef-4a81-9729-6d828ffecccb","resolution":{"observed_at":"2026-08-16T05:43:45.300076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.219918Z","title":"Cholect50: A dataset for surgical video understanding, 2020","venue":null,"work_id":"4006efcd-0c8f-4ce4-8606-ed7fa000c795","year":2020},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.184774Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:ec44caf7caa052551c5909104104e7f3eaab2c688d6d02e5d05ff3d450a95b45","observation_id":"87b33889-2b43-46fe-be96-4dbfdc430a75","resolution":{"observed_at":"2026-08-16T05:43:45.288051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10994-024-06727-4","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:43.368783Z","title":"Unmasking deception: a topic-oriented multimodal approach to uncover false information on social media","venue":null,"work_id":"b75e7e5e-2287-43e7-a00b-2e3ef10ca1b2","year":2025},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.281716Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:9025574d3e1e46ba87a8935f51ed885e4ff0ec92559adf4144a42ff133e895fc","observation_id":"a32d99c5-1b30-4ab5-b1a5-ff6614355c87","resolution":{"observed_at":"2026-08-16T05:43:43.435845Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.101979Z","title":"Harnessing prompt- based large language models for disaster monitoring and automated reporting from social media feedback","venue":null,"work_id":"641bd41f-558e-4549-9a10-62182cbc9aa4","year":2025},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.285629Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:20c6314c8f069ee270c24ebfa6c891fc3e632464914cc67afa3143ebf4d5f02d","observation_id":"06637a61-a7e7-4ab1-b454-4217e529dcd1","resolution":{"observed_at":"2026-08-16T05:43:45.145499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.075947Z","title":"Surgical video captioning with mutual-modal concept alignment","venue":null,"work_id":"e5201a15-223e-4e17-a221-f17fcbf40059","year":2023},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.290474Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:4522552e7209fb7cd7f74b5907630a1574b839c6339c658ab11928989cd1d58d","observation_id":"39b92217-b8ee-4594-b58d-ed878c367b21","resolution":{"observed_at":"2026-08-16T05:43:45.079828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.064519Z","title":"Vision language models in medicine","venue":null,"work_id":"eea43a6e-1590-48d1-90ed-04813ea78a07","year":2025},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.294015Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:c29f2028330fc72cf1f926356f5ca61475775991e523c398be95dbb5d495551b","observation_id":"ded858a9-602a-4671-877b-82ee7d967e02","resolution":{"observed_at":"2026-08-16T05:43:45.068097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.052067Z","title":"Meshed-memory transformer for image captioning","venue":null,"work_id":"4782a597-4d6f-4dad-b608-1f00938d6400","year":2020},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.297352Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:542f175f3d0ce9869a09f44a53761ac694be80cbb15fa3723635896e7f94f32e","observation_id":"93f429a1-a0c4-44f9-bfc0-ba361da86f91","resolution":{"observed_at":"2026-08-16T05:43:45.056339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.039892Z","title":"Attribution-noncommercial-sharealike 4.0 international (cc by-nc-sa 4.0)","venue":null,"work_id":"1d001f80-8ea4-4bcd-897b-0240cf349783","year":2013},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.301598Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:44f4f9b1ce591f5d3449b45a946233efea8f3fe5d10fef364130ca08cc3c58c9","observation_id":"d8d9dc8d-ba59-44dc-b943-e148c86a717b","resolution":{"observed_at":"2026-08-16T05:43:45.044287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.306279Z","title":"Class-balanced loss based on effective number of samples","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.306279Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:e4f9a4b82b1c30741e7341ad7e48e995d4331569cf08e6bd47d914c7da503d08","observation_id":"56de2812-4295-4153-9b2a-c6e09463dc48","resolution":{"observed_at":"2026-08-16T05:43:42.306279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-16T05:43:42.310201Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.310201Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:bcab0b477a4972a6adf59d7f55b9781394cf137696c577f4f75e8820281a136a","observation_id":"194f44f0-0ef8-430b-aea0-ab09b47168ac","resolution":{"observed_at":"2026-08-16T05:43:42.310201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.020702Z","title":"Surgical video analysis: an emerging tool for improving surgeon performance, 2015","venue":null,"work_id":"9ec6bd10-ba2d-4423-b711-8f0fedcff042","year":2015},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.321600Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:b24b6e0c8991e1e1ddae829b07c7142dae64d42bc4c76edab591c8b3477029af","observation_id":"621034ec-7d7a-4a42-9e82-aab2b673014d","resolution":{"observed_at":"2026-08-16T05:43:45.025018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-16T05:43:42.420366Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.420366Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:a374fcaf6774eed93d179c1be19f51fcbf6c02acb7ecab2d150681dc2dee266f","observation_id":"f30f51f4-3509-40ea-85c8-9be32a31300a","resolution":{"observed_at":"2026-08-16T05:43:42.420366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16156","snapshot_observed_at":"2026-08-16T05:43:42.424641Z","title":"Videoorion: Tokenizing object dynamics in videos, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.424641Z"},"links":{"cited_paper":"/paper/2411.16156","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:1b1fcbd0db569221db262e628ae514411ee532112af9bd20df47bfbe10b175b7","observation_id":"33f7feff-207a-4e92-9c5b-053e6c498d97","resolution":{"observed_at":"2026-08-16T05:43:42.424641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.007603Z","title":"Image-text surgery: Efficient concept learning in image captioning by generating pseudopairs","venue":null,"work_id":"5e92d893-83cb-4791-a4f4-0ace077de77c","year":2018},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.428992Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:1233241acae79c96ad734a400c2580c77a654500f9992a9f8432e42485b6da76","observation_id":"31eb75b2-ec8e-4279-b99c-6a5079cf7248","resolution":{"observed_at":"2026-08-16T05:43:45.012197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.995229Z","title":"Using surgical video to improve technique and skill","venue":null,"work_id":"8518b560-416e-4ea2-834f-fd84a49188ac","year":2016},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.432844Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:413c153ff62cbcb0e204914dc1da45ab03700f65e4d827cee72ef620980bb9fd","observation_id":"bc4e316c-c4f0-4553-95c9-6d6039c5bad7","resolution":{"observed_at":"2026-08-16T05:43:44.999052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.873387Z","title":"Weinberger","venue":null,"work_id":"bc6d57eb-cef9-46f9-8e11-f52abe438eaa","year":2017},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.436742Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:479b42ff66519c479f01ac89ed0a7ced977ee6b092253125afd950f4a7bf6108","observation_id":"76f39dcb-1c49-4e43-83c0-b8b096c61cf7","resolution":{"observed_at":"2026-08-16T05:43:44.987453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.440064Z","title":"Hashimoto, Guy Rosman, Daniela Rus, and Ozanan R","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.440064Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:a149816ab3d06e4e5b0e85225699a79ee7b00787147b4b9e4506397583250074","observation_id":"affd8197-634a-4798-bb4c-b1d19b77990e","resolution":{"observed_at":"2026-08-16T05:43:42.440064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.443698Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.443698Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:4710a2ffd628f7f132e1d70ab5bbb8d898358f14f05825dfeba9c8e58d9c8e9c","observation_id":"24aa3131-0181-4d5f-a397-da3ab2eab46e","resolution":{"observed_at":"2026-08-16T05:43:42.443698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.09923","last_updated":"2017-12-28T16:46:05Z","snapshot_observed_at":"2026-08-14T19:59:33.923433Z","submitted_at":"2017-12-28T16:46:05Z","title":"What do we need to build explainable AI systems for the medical domain?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.09923","snapshot_observed_at":"2026-08-16T05:43:42.447190Z","title":"What do we need to build explainable ai systems for the medical domain? arXiv preprint arXiv:1712.09923, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.447190Z"},"links":{"cited_paper":"/paper/1712.09923","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:30cf38c4c91007e618777d3662bb1a97a264274d03471100eccb10c930016b42","observation_id":"18f0a98e-45a9-43c5-8002-ec7d69782cfb","resolution":{"observed_at":"2026-08-16T05:43:42.447190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.480347Z","title":"Advancing medical imaging with language models: featuring a spotlight on chatgpt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.480347Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:5ecc551873cb24e94cafc8193d90a83573a9299d0117fd2c5fdfc58f551a5d1e","observation_id":"f900bf73-ce3b-4439-a8b4-329ac5725203","resolution":{"observed_at":"2026-08-16T05:43:42.480347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.755665Z","title":"Exploring video captioning techniques: A comprehensive survey on deep learning methods","venue":null,"work_id":"0f4c459c-7a1b-4fa6-bfe9-c7657d2ea76d","year":2021},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.538829Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:cc97cdcc4c527f8e7159efcccfb0ecbf93a0b91384047c772dad0fe7b0fedea8","observation_id":"31430eef-cd38-4ddb-84a7-3b5354f949b2","resolution":{"observed_at":"2026-08-16T05:43:44.794772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.569371Z","title":"Multi-task recurrent convolutional network with correlation loss for surgical video analysis","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.569371Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:c1ab09be64ab9eaf0589eccbdacd1ce15ba72967a99f93288033a66b5936c0d6","observation_id":"1ab8b5de-f54d-4030-8a4f-742972c7a017","resolution":{"observed_at":"2026-08-16T05:43:42.569371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.736577Z","title":null,"venue":null,"work_id":"c7e3c3d9-2d84-490e-b7cf-703175c43b71","year":2020},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.572825Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:840bc020e84477a4086347db1da632aeee61550016052f253b5dd7e4177d7c42","observation_id":"edeb8745-7979-49a4-9857-c02cfe1e1b2f","resolution":{"observed_at":"2026-08-16T05:43:44.740682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.724662Z","title":"Predicting decompression surgery by applying multimodal deep learning to patients’ structured and unstructured health data","venue":null,"work_id":"de77fb3e-bd0d-4ea7-be10-dd84f4bc9f21","year":2023},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.576369Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:04ab1e9cb74d5ff994b6e31f1ce4b35ec7f88295bb7da16a121cafcca87d6ebe","observation_id":"f61e7426-f910-40f8-8c08-9a521495ec05","resolution":{"observed_at":"2026-08-16T05:43:44.728676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.713597Z","title":"Stvs: Spatio-temporal feature fusion for video summarization","venue":null,"work_id":"e5d4726a-bc9d-460f-a4e8-248995e1943f","year":2024},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.580245Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:f2a715a21ab8217a63d93ff134f0547289ec52973071e8c670a4f6a6334b6a09","observation_id":"875b45cd-286d-42fb-94fb-211e21c07b17","resolution":{"observed_at":"2026-08-16T05:43:44.717527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.702083Z","title":"Intraoperative video analysis and machine learning models will change the future of surgical training","venue":null,"work_id":"ed77b3ed-f03f-4081-928b-a4d671667c1c","year":2022},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.584521Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:93fdd1bfe70fe83c53108a36aeb25dee9e938efec639b5e94788ce54ad0f3a75","observation_id":"56c5463d-1a87-45e6-92ec-1370e65ebf37","resolution":{"observed_at":"2026-08-16T05:43:44.705961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.688808Z","title":"Video question-answering techniques, benchmark datasets and evaluation metrics leveraging video captioning: A comprehensive survey","venue":null,"work_id":"b95c134b-d43c-42b2-99fa-2455cfaf075f","year":2021},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.589002Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:ddb296f5ae6be20c290fd285e2cc5e138e80ee704b65f9fcf6cf7bf4ef56cd5a","observation_id":"854b319b-648e-4b96-afa4-23398b71d643","resolution":{"observed_at":"2026-08-16T05:43:44.694043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.625442Z","title":"Generating automatic surgical captions using a contrastive language-image pre-training model for nephrectomy surgery images","venue":null,"work_id":"d7fe9cae-b855-407d-916a-1af7c4655c62","year":2024},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.593164Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:107796a4ea79e54bab93297488bc27fe9920454725c3250e710edda43378d9b7","observation_id":"dd7a2d58-84ae-47f6-81b5-4bbd8eb01835","resolution":{"observed_at":"2026-08-16T05:43:44.680800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.519880Z","title":"Unicoder-vl: A universal encoder for vision and language by cross-modal pre-training","venue":null,"work_id":"192b5df9-176d-41cf-ba67-eaa5587b2442","year":2020},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.596149Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:9135bf6e90e0ef19de3146eaa2cd3348655b2acb9b6746a4a77e8de433421557","observation_id":"d1d62cd2-c2e6-484d-80b5-e3a8ae531713","resolution":{"observed_at":"2026-08-16T05:43:44.580260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.474271Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks","venue":null,"work_id":"51cd6dc5-aa84-4290-855e-acd598cab270","year":2020},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.599127Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:777669bf9ed1f5a38d7ec36a5700f098915c952f685ec8501352ddb843664f1c","observation_id":"c909f190-b858-4177-bbd7-26a6fe8458c0","resolution":{"observed_at":"2026-08-16T05:43:44.478307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.658846Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.658846Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:3f51e9f6fe55e1fee4707d870aa8aee4dc2581cf47d825c8059492915f789a6b","observation_id":"89765e17-031a-42ed-8228-629600724cc1","resolution":{"observed_at":"2026-08-16T05:43:42.658846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.723455Z","title":"Focal loss for dense object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.723455Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:4b6c0608fc0b9570dbf9fe7970327b5cda1442849aa86d92e4ad3ce32ed4ec2c","observation_id":"a2fe0918-af0a-4acb-a986-d5de792d3d04","resolution":{"observed_at":"2026-08-16T05:43:42.723455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.781863Z","title":"A survey on deep learning in medical image analysis","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.781863Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:f02af3cf7e2579ea03a046c4228e90419ec778e591f163400027b905f197bf11","observation_id":"c337ad92-c209-44d3-b340-6dc6b35f3806","resolution":{"observed_at":"2026-08-16T05:43:42.781863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.443290Z","title":"Video content analysis of surgical procedures","venue":null,"work_id":"0da1123d-e868-4863-9d6f-576141c414ac","year":2018},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.785565Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:8c63c0de05b7205511ecc96eb33ed838ecb9680259daffe56c1f955e608e1cd6","observation_id":"43827adc-7873-4fc2-9db6-e29b2b319165","resolution":{"observed_at":"2026-08-16T05:43:44.447588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-16T05:43:42.788616Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representa- tions for vision-and-language tasks","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.788616Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:1752aea140ab8dee9ebeb7bb1b238ab9895b158342d88ccf2fbea469b0e78974","observation_id":"2f6bb367-4920-4ce2-9860-cea82207a6a0","resolution":{"observed_at":"2026-08-16T05:43:42.788616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.793034Z","title":"BioGPT: generative pre-trained transformer for biomedical text generation and mining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.793034Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:ac1aa026404fb46e9b7783124a74c583ff8347a12ce5fd77fcab0e747640f581","observation_id":"e0c75f67-a4c2-4e39-8646-426c82a5e4cd","resolution":{"observed_at":"2026-08-16T05:43:42.793034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.431877Z","title":"Surgical data science for next- generation interventions","venue":null,"work_id":"a54c0fc5-c7f7-4692-8686-e7e06d8d5fe9","year":2017},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.796684Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:d9e6fdfcc00765f3aea50bc7375340f849032de75a15c221b3aef74c3a4bdf28","observation_id":"2ccc63c2-d92e-4809-bc7b-05c429c369a7","resolution":{"observed_at":"2026-08-16T05:43:44.435637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.362829Z","title":"Is online video-based education an effective method to teach basic surgical skills to students and surgical trainees? a systematic review and meta-analysis","venue":null,"work_id":"9fc1fb94-ea42-409e-92da-ea6d5367e7e7","year":2022},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.800372Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:e627a05700faa51124c6c646b6bc15417751b6e8c3c2dbcf01c9a400750ee14c","observation_id":"60222a66-fa30-4a7b-a46b-4040224b16cd","resolution":{"observed_at":"2026-08-16T05:43:44.424288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.804020Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.804020Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:c3eb881e598b60290433a1505c46a84df42de7587802288e9aabf939c982b686","observation_id":"ebb80fc1-898e-4d06-9d57-2c6d1f0d20db","resolution":{"observed_at":"2026-08-16T05:43:42.804020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-16T05:43:42.807245Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.807245Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:3fdda379c6c0951d8fb0809ce2e1c844b7336897fbab48e4432ebf281459c96f","observation_id":"b4b81d0e-c758-4e95-a55d-13f7aa103878","resolution":{"observed_at":"2026-08-16T05:43:42.807245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.252268Z","title":"Bleu: A method for automatic evaluation of machine translation","venue":null,"work_id":"2b0315a9-17c1-4289-ad01-62c7e0a6cae5","year":2002},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.811499Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:3f0bdc2f8c0704aebc7f6b2bf8c6f3d7355719ec11a9001d7f9935b9c1dfaca4","observation_id":"5192ce61-c9ab-4f48-aa7c-97b85abee2c4","resolution":{"observed_at":"2026-08-16T05:43:44.281583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.240355Z","title":"Dense video captioning: A survey of techniques, datasets and evaluation protocols","venue":null,"work_id":"e3233ef5-d376-405a-9df0-0ad1efe1c6ba","year":2025},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.814496Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:bf5ad8c4034b0605b2f0f60ae0eb7121ae19fb70ef9a080508cbc0fa5effb832","observation_id":"6f62def6-996b-4313-afd1-14255631a386","resolution":{"observed_at":"2026-08-16T05:43:44.244441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.818065Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.818065Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:8c0d5faf578ff19c0b35693f8d8183da87e0cea96ae54dd789eaafe9d13c4fea","observation_id":"e9597801-e764-448d-8094-729d3e9a4ed6","resolution":{"observed_at":"2026-08-16T05:43:42.818065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.218864Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"392f0719-75af-40a1-aeb3-9c63453100c3","year":2020},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.849230Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:51511a024544474ea68a115a64db956f2b513e6e7a57ab79967815d8f0dbb868","observation_id":"a2d14e7b-3278-431b-b548-cfa2e625cae2","resolution":{"observed_at":"2026-08-16T05:43:44.223163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.205945Z","title":"Dl4burn: Burn surgical candidacy prediction using multimodal deep learning","venue":null,"work_id":"264845db-441e-46f5-bd81-c44eaed15be9","year":2021},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.948706Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:d62eedcd71e874951334f4d38a1bff14944c8d335737d0bfafda6c8e5efef48f","observation_id":"a8db6b68-3d6a-441d-b31f-1f5e81d6c2ea","resolution":{"observed_at":"2026-08-16T05:43:44.209756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-16T05:43:43.025376Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.025376Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:84c63b3d8da1e9ded2c8fa3ce0a462c016e81616a22c257a3cfe55e17c325916","observation_id":"72a4f4ca-b025-429d-ae1f-59c2dc181554","resolution":{"observed_at":"2026-08-16T05:43:43.025376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.143646Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter","venue":null,"work_id":"f77a7091-331b-43c4-8bc8-c9a5f21cda6e","year":2019},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.101180Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:2251a81157179d4228a6ce893830180402bfe22b9b4cd2576d6cfb8426d1c98f","observation_id":"6b1be94f-f1bf-43dc-9574-4cdb699098fb","resolution":{"observed_at":"2026-08-16T05:43:44.168239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.085835Z","title":"Evolution of visual data captioning methods, datasets, and evaluation metrics: A comprehensive survey","venue":null,"work_id":"61408972-a242-4279-a172-0b83f1e951be","year":2023},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.105167Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:ee6e6e29c0c699b7c44553eeb755a6ed2e773dafb561fd4e68678e0fca44fd34","observation_id":"00ee135e-a59f-423f-b686-cb6bf8cc72fe","resolution":{"observed_at":"2026-08-16T05:43:44.091053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09617","last_updated":"2023-05-16T17:11:29Z","snapshot_observed_at":"2026-08-16T14:30:19.311365Z","submitted_at":"2023-05-16T17:11:29Z","title":"Towards Expert-Level Medical Question Answering with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09617","snapshot_observed_at":"2026-08-16T05:43:43.109468Z","title":"Sara Mahdavi, Joelle Barral, Dale Webster, Greg S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.109468Z"},"links":{"cited_paper":"/paper/2305.09617","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:35c11b7c74c3017115e1f7d2ec4c1d66dae9118ac244a4e5acd209160827351d","observation_id":"080d5a68-750d-4eed-8abb-1f2fa956df12","resolution":{"observed_at":"2026-08-16T05:43:43.109468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.072765Z","title":"Automated radiology report generation: A review of recent advances","venue":null,"work_id":"a59cb4b3-c8a7-4af8-b98a-f5aa66dfeaf5","year":2024},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.113530Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:848cf16055567043215002943f6ffd1e2e8c41f2d39959b724ccbd78bbe1ca0d","observation_id":"b93d691c-fb74-4455-9ca1-f88d7ac64bf8","resolution":{"observed_at":"2026-08-16T05:43:44.077498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.060382Z","title":"The role of large language models in medical image processing: a narrative review","venue":null,"work_id":"c67afa85-e92b-4b2a-a793-5e9e2a25e618","year":2023},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.116866Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:8309b85fb106700eb7c6c97d332dfdae25e80e2114b83eea0c7b2271afa1b18a","observation_id":"b121b26e-e170-4c4e-8181-0ab025da6cfc","resolution":{"observed_at":"2026-08-16T05:43:44.064101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:43.971807Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"08c0dbcc-8fc1-4621-812e-130bebfb4f22","year":2021},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.121206Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:3f93915e04b4a61532b11a3780b697109512987a6559461ce6629d952dcf9857","observation_id":"5a201b1c-71ab-45af-be40-162d8b6f8ebe","resolution":{"observed_at":"2026-08-16T05:43:44.013534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:43.125685Z","title":"On large visual language models for medical imaging analysis: An empirical study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.125685Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:59a73ca6ada6f2572de6423ab44aa79ce15f227a99fe94a67e3da7fed5a46927","observation_id":"dd672e10-d9ce-4a40-840c-77e56c8c2c97","resolution":{"observed_at":"2026-08-16T05:43:43.125685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:43.949870Z","title":"Attention is all you need","venue":null,"work_id":"95d609e1-0706-4df7-8aef-645198077f3b","year":2017},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.129378Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:399058aecf67cdb26c355f42ca11a7439b04aef8403a9d3204a98bbca7d091f3","observation_id":"6d3aafef-a6f4-489c-86ec-f0c9fa1398d6","resolution":{"observed_at":"2026-08-16T05:43:43.954375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:43.933558Z","title":"A novel multimodal deep learning model for preoperative prediction of microvascular invasion and outcome in hepatocellular carcinoma","venue":null,"work_id":"b0df4847-2579-4f99-802d-45edc7118324","year":2023},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.133062Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:f6b50a2856e9f2f45ff1962795658b397a19a5accf54c93f94c4624c55211bdb","observation_id":"35513820-fcbf-4ea4-a480-08bee0340569","resolution":{"observed_at":"2026-08-16T05:43:43.939261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11347","last_updated":"2025-03-15T02:35:48Z","snapshot_observed_at":"2026-08-15T06:37:59.261620Z","submitted_at":"2025-01-20T09:12:06Z","title":"EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11347","snapshot_observed_at":"2026-08-16T05:43:43.205100Z","title":"Endochat: Grounded multimodal large language model for endoscopic surgery","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.205100Z"},"links":{"cited_paper":"/paper/2501.11347","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:dd1d77f03b33d0cd177a8fea21fcb04cae3c030a28c91870d23d08c8b660a01b","observation_id":"86232122-99d9-4ead-bb87-b5f9a2c435f1","resolution":{"observed_at":"2026-08-16T05:43:43.205100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07257","last_updated":"2023-02-14T18:54:06Z","snapshot_observed_at":"2026-08-16T15:55:21.008454Z","submitted_at":"2023-02-14T18:54:06Z","title":"ChatCAD: Interactive Computer-Aided Diagnosis on Medical Image using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07257","snapshot_observed_at":"2026-08-16T05:43:43.297751Z","title":"Chatcad: Interactive computer-aided diagnosis on medical image using large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.297751Z"},"links":{"cited_paper":"/paper/2302.07257","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:d3c427847d82c974949e679d60bc7698363cbc0a7cf2390e4ed622c603c54b25","observation_id":"0757bc3e-862d-41ab-a634-bdf0b97c9697","resolution":{"observed_at":"2026-08-16T05:43:43.297751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:43.821888Z","title":"Learning domain adaptation with model calibration for surgical report generation in robotic surgery","venue":null,"work_id":"6ebb58ad-d6a1-4c3b-8927-b8b4ed482668","year":2021},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.301562Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:c047517b108263ffb50081aefd0b9b63828eda8a12c888f1aef2759c04cea66c","observation_id":"3794ff53-9cc3-4163-814a-2a6337dfae74","resolution":{"observed_at":"2026-08-16T05:43:43.905987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13848","last_updated":"2023-01-31T18:46:19Z","snapshot_observed_at":"2026-08-16T15:58:44.768557Z","submitted_at":"2023-01-31T18:46:19Z","title":"Benchmarking Large Language Models for News Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13848","snapshot_observed_at":"2026-08-16T05:43:43.305442Z","title":"Benchmarking large language models on summarization tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.305442Z"},"links":{"cited_paper":"/paper/2301.13848","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:c0f50d2fd6754bcf4c18540b331699d02b304247416769ebb1e4144cc96f5511","observation_id":"2967e3a6-3463-43d7-a1e2-9fabf322452f","resolution":{"observed_at":"2026-08-16T05:43:43.305442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:43.726637Z","title":"Weinberger, and Yoav Artzi","venue":null,"work_id":"b7e73836-2430-425d-9a79-c07865d9c6d5","year":2020},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.309955Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:261ad2ef385fd2bd1beb20f1c08a4736dd520f287154a23e6b15c73c4599166e","observation_id":"c767ffd8-2e02-4c35-abda-429d62379f7f","resolution":{"observed_at":"2026-08-16T05:43:43.784836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:43.713457Z","title":"Dilated temporal relational adversarial network for generic video summarization","venue":null,"work_id":"ea3c2e73-9ec2-422f-85af-196664a6e853","year":2019},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.314461Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:da35ce2ccce03bbe2407c7e0f81510bcdd9919b021bfe90cae9f182b17258edb","observation_id":"2e0eda0c-4008-4bed-9363-b4aec77c412d","resolution":{"observed_at":"2026-08-16T05:43:43.717687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:43.700875Z","title":"Dense video captioning using graph-based sentence summarization","venue":null,"work_id":"2b9e0c07-7eb8-4c1b-8599-4a3c65c914ce","year":2020},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.317969Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:86c36ee0561101938738401da824c917af6447927f1afd3312b889bdfd82c582","observation_id":"7f1238d6-d592-4abf-8762-97061ca11778","resolution":{"observed_at":"2026-08-16T05:43:43.704809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:43.661496Z","title":"Surgical activity recognition in robot-assisted radical prostatectomy using deep learning","venue":null,"work_id":"7a8580e4-7fd0-43f3-b29d-c95856c55efe","year":2018},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.323375Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:8cebc227c47676bbd69feb41f383ee729cb4d5f6257292470b2373391089df64","observation_id":"897c983f-7c11-485f-a915-05066dc267e2","resolution":{"observed_at":"2026-08-16T05:43:43.692625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T06:04:21.329763Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":43},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 1 inbound Pith citation observation for arXiv:2504.19918."}