{"as_of":"2026-08-06T02:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:824a4c933cc69addc168d8a58c01fd58e328c4024a3e40c2d1347a0e4560122c","coverage":[{"denominator":111,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T03:15:40.944411Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:28:14.878855Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T16:58:42.440544Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"cited_work":{"arxiv_id":"2605.08712","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.08712","snapshot_observed_at":"2026-07-03T16:58:42.440544Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","venue":"cs.CV","work_id":"2dadef9e-0bae-4002-8c3e-6f672e02efbf","year":2026},"citing_paper":{"arxiv_id":"2607.01633","last_updated":"2026-07-02T03:00:23Z","snapshot_observed_at":"2026-07-07T00:07:08.919017Z","submitted_at":"2026-07-02T03:00:23Z","title":"Bridging 3D Gaussians and Semantic Occupancy for Comprehensive Open-Vocabulary Scene Understanding from Unposed Images","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-03T16:56:01.473703Z"},"links":{"cited_paper":"/paper/2605.08712","citing_paper":"/paper/2607.01633"},"observation_digest":"sha256:69f783db8ad915f043f31249eb0a37100c0b253faac313efde4ece1baf5290d3","observation_id":"0f9a31cd-32de-451c-93a3-5ede0cde4bf0","resolution":{"observed_at":"2026-07-03T16:58:42.441756Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.08712","snapshot_observed_at":"2026-07-11T06:04:00.932282Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05543","last_updated":"2026-07-06T18:26:27Z","snapshot_observed_at":"2026-07-11T06:04:00.408838Z","submitted_at":"2026-07-06T18:26:27Z","title":"GEM-Occ: From Visual Geometry Evidence to Embodied Semantic Occupancy Memory","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-11T06:04:00.932282Z"},"links":{"cited_paper":"/paper/2605.08712","citing_paper":"/paper/2607.05543"},"observation_digest":"sha256:ed868b376f226aa2e9c7ecb5effd439e0af259e6e5e3e2cd95790b6875ebfa63","observation_id":"5ae9bed3-ff51-4ae4-84d9-eedd36baee31","resolution":{"observed_at":"2026-07-11T06:04:00.932282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.08712","snapshot_observed_at":"2026-08-05T23:28:14.878855Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03211","last_updated":"2026-08-04T06:49:04Z","snapshot_observed_at":"2026-08-06T02:33:31.986959Z","submitted_at":"2026-08-04T06:49:04Z","title":"CrossScope: A Role-Asymmetric World Model for Joint Dual-Scope Surgical Video Prediction","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T23:28:14.878855Z"},"links":{"cited_paper":"/paper/2605.08712","citing_paper":"/paper/2608.03211"},"observation_digest":"sha256:0724d4a70dbb3dc1df06858aaf85fa4396f2442d9053a40c3ca6fe6af212b145","observation_id":"5953f377-4ddd-4a2b-a2ed-8d5fb8e8a953","resolution":{"observed_at":"2026-08-05T23:28:14.878855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.08712/citation-record","integrity":"/paper/2605.08712/integrity","json":"/paper/2605.08712/citation-record.json","paper":"/paper/2605.08712"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:7afaeed287fd29b710599b2e1002d002f3507aac122077f68da284f8c3be8c61","observation_id":"e9f829c1-89a9-4b72-a575-39e509e4ddfc","resolution":{"observed_at":"2026-05-12T03:16:18.826892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3787.2023","doi":"10.1109/isbi53787.2023.10230448","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2023 IEEE 20th International Symposium on Biomedical Imaging (ISBI), 1–6, DOI: 10.1109/ISBI53787.2023.10230477 (2023)","venue":null,"work_id":"607fb6fe-6b57-437a-90bb-230c3406593a","year":2023},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:73c97245dd0162fd9e71576055cb619b261f761397c2da0b69668f7a22b93b8e","observation_id":"f283fe95-3dce-40ce-ad01-bdb899da39ce","resolution":{"observed_at":"2026-05-12T03:16:18.682236Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hierasurg: Hierarchy-aware diffusion model for surgical video generation","venue":null,"work_id":"ccbccc78-0fb0-4129-985c-aa0ac3720024","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:88323fe7fbbe04c3d278605a5b2ccd70f4c3039f2c86a2ee26f06f34add1790e","observation_id":"9ab51cba-4026-4580-9e37-857e1104e182","resolution":{"observed_at":"2026-05-12T20:26:49.575792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative ai for synthetic surgical training videos.British Journal of Surgery, 113(3):znag017","venue":null,"work_id":"a076e195-72e7-4db5-9fdc-11d416d0e460","year":2026},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:00eb8d580ca40faef70ca77e07a03b49fc78734df216803b4231fabe348d10e7","observation_id":"d4f5a7ac-f8a1-4739-b8ed-326832f2c44a","resolution":{"observed_at":"2026-05-12T20:21:51.291608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11943","last_updated":"2024-11-18T18:37:09Z","snapshot_observed_at":"2026-07-06T19:52:11.774784Z","submitted_at":"2024-11-18T18:37:09Z","title":"Medical Video Generation for Disease Progression Simulation","version":1},"cited_work":{"arxiv_id":"2411.11943","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.11943","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Medical video generation for disease progression simulation","venue":null,"work_id":"f381cc19-e596-4d45-8a0c-4dd5e8b24d04","year":2024},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2411.11943","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:2d3fab0f846d48861bb3b34024a737ac03cd2419fd08ad7be865737e9eb9b928","observation_id":"b65a0463-6c5e-402c-9339-aa6c44094008","resolution":{"observed_at":"2026-05-12T03:16:18.717228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Encoder-decoder with atrous separable convolution for semantic image segmentation","venue":null,"work_id":"4f3c8f63-b16f-4a1c-8733-8946cd309735","year":2018},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:15429c7ed8af4e01fa54d160bfda90d64c6f6bd1da0a3b15c832da1b604082a8","observation_id":"67da1eb8-5da4-45b8-ab6a-8f94ffdea174","resolution":{"observed_at":"2026-05-12T20:21:51.299878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"H-rssg: High- fidelity robotic surgical scene generation with implicit deformable neural radiance field.IEEE Transactions on Automation Science and Engineering, 23:3353–3364","venue":null,"work_id":"de286284-d940-4fd2-a58c-55dd7883f32d","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:98bb07106ac661621bb1a7837fc487f2277373eccc481a5dbb9bd64045409100","observation_id":"f912a2cb-d65f-4d11-b58e-1daa7ae48be1","resolution":{"observed_at":"2026-05-12T20:21:51.283693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04842","last_updated":"2025-03-06T14:40:15Z","snapshot_observed_at":"2026-07-06T20:02:39.525801Z","submitted_at":"2024-12-06T08:27:53Z","title":"UniMLVG: Unified Framework for Multi-view Long Video Generation with Comprehensive Control Capabilities for Autonomous Driving","version":3},"cited_work":{"arxiv_id":"2412.04842","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04842","snapshot_observed_at":"2026-07-08T03:24:28.737164Z","title":"Unimlvg: Unified framework for multi-view long video generation with comprehensive control capabilities for autonomous driving","venue":"cs.CV","work_id":"a9c14806-0fa5-4b7c-8f71-9be772d4f974","year":2024},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2412.04842","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:104f7ee8aa53cea58547d46113382e464d02cb5c4bfead5cd4b80107a3203453","observation_id":"76890c64-368c-4b10-b6b3-94f526ec1808","resolution":{"observed_at":"2026-05-12T03:16:18.800836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Surgsora: Object-aware diffusion model for controllable surgical video generation","venue":null,"work_id":"71489b3a-1cb5-411c-8af6-643b47f47c7d","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:1bf86aef4e6ade986ab5adedd30372a7da6d1f3f95e5e1324eb1e18aca69fd86","observation_id":"bb9087ea-c502-42ba-a591-f894927aaf15","resolution":{"observed_at":"2026-05-12T20:21:51.287616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama-vg: A video vision llama-based model for endoscopy video generation","venue":null,"work_id":"710cad2d-56ff-482d-8567-2ee5c43a3196","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:1a9e3aa5cc33ec19d2b620e40216dbf14adbba984a217e7ef058cc9506e93c85","observation_id":"07720345-b719-4888-a321-a14bbadee40b","resolution":{"observed_at":"2026-05-12T20:21:51.270819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Surgical workflow image generation based on generative adversarial networks","venue":null,"work_id":"02bf4847-49d0-4bf8-a19d-52c78d83fe11","year":2018},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:553027a0e104543d224eb83ce09385757929986626aa0f953771cc19bfd55b82","observation_id":"c38f24b2-cc31-465c-a270-782553e9b46e","resolution":{"observed_at":"2026-05-12T20:21:51.263241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.01775","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:56:57.721006Z","title":"arXiv:2511.01775 (2025)","venue":null,"work_id":"987d4957-b25e-4ac9-bbec-bb1d480eb5b4","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:15d8fa21dc069b5ec6842a2498557dccaea0bc79689c58a9e2f5d8d4ac618222","observation_id":"d4144380-e897-4088-afec-8c6dd11ccc54","resolution":{"observed_at":"2026-05-12T03:16:18.691868Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Schwing, Alexander Kirillov, and Rohit Girdhar","venue":null,"work_id":"6e802c46-1808-4d5e-ad3f-b7aaea77d661","year":2022},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:b82f884e8b8f2b666bc1b99a5c97d43f019106329b91487c50c2805e28740462","observation_id":"1e631fd4-9d1d-41c7-bebe-49546127b6c9","resolution":{"observed_at":"2026-05-12T20:21:51.266839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14028","last_updated":"2024-09-24T23:23:50Z","snapshot_observed_at":"2026-07-06T19:05:49.062452Z","submitted_at":"2024-08-26T05:38:27Z","title":"SurGen: Text-Guided Diffusion Model for Surgical Video Generation","version":3},"cited_work":{"arxiv_id":"2408.14028","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.14028","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Surgen: Text-guided diffusion model for surgical video generation","venue":null,"work_id":"d3a10818-2d72-438f-a66f-4a1733337f2b","year":2024},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2408.14028","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:dc189ac17a3be4755c7553c0cb208bafe5f920b07140b4476ef517b7385296bf","observation_id":"60ecf07b-1f8a-464a-b5f8-8babc4113b53","resolution":{"observed_at":"2026-05-12T03:16:18.816869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5a84f394-d635-4e26-a02e-e9f3c0953d34","year":2023},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:ae9d166bc3da42a9ab0a891c4cbc05ab7b159a1d64e425baec994d824f0475ed","observation_id":"e516b634-64b1-47fc-b6bf-19cce8dfb0ae","resolution":{"observed_at":"2026-05-12T20:21:51.279434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pyslowfast","venue":null,"work_id":"120b9b75-425c-4032-b612-53a76c6ab3b4","year":2020},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:6e9f82f9b7943f48be9506f4a6a47e18285353940e0b654089ddc974405f9b3d","observation_id":"05a26ba0-0c71-4273-b700-e1f5d05d0095","resolution":{"observed_at":"2026-05-12T20:21:51.312282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11633","last_updated":"2024-09-09T02:17:12Z","snapshot_observed_at":"2026-07-06T18:47:08.782799Z","submitted_at":"2024-07-16T11:55:23Z","title":"Scaling Diffusion Transformers to 16 Billion Parameters","version":3},"cited_work":{"arxiv_id":"2407.11633","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.11633","snapshot_observed_at":"2026-07-04T13:29:51.553624Z","title":"Scaling Diﬀusion Transformers to 16 Billion Parameters","venue":null,"work_id":"383c8ebe-0b7f-4033-bd95-40a79feabb21","year":2024},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2407.11633","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:8cddfd644e98e4c8886afe52ee8be9bb1c8e28da51652a7fa28c8840a9a275ab","observation_id":"46243908-2a23-4f57-af49-00684e85a5bb","resolution":{"observed_at":"2026-05-12T03:16:18.741884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.26232","last_updated":"2026-04-29T02:24:28Z","snapshot_observed_at":"2026-08-01T02:56:18.432166Z","submitted_at":"2026-04-29T02:24:28Z","title":"DepthPilot: From Controllability to Interpretability in Colonoscopy Video Generation","version":1},"cited_work":{"arxiv_id":"2604.26232","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.26232","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DepthPilot: From Controllability to Interpretability in Colonoscopy Video Generation","venue":"cs.CV","work_id":"af0c17e1-4620-427e-bad6-bb91b2787b54","year":2026},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2604.26232","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:be79185c3d9643faaf452d90a8560eed4cb6792aed94c41c568c139fc2b7a580","observation_id":"681d4346-9273-423c-b05d-a7ccccd278bb","resolution":{"observed_at":"2026-05-12T03:16:18.823506Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Colodiff: Integrating dynamic consistency with content awareness for colonoscopy video generation.IEEE Transactions on Medical Imaging","venue":null,"work_id":"3b29deaa-4647-47ad-b3d5-89521d0e98b2","year":2026},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:372ee000c9d2004defcded204bc6834fdd265138163f867bdf3cca2396614bff","observation_id":"eedf3924-3ced-4838-850e-f47843ae95ec","resolution":{"observed_at":"2026-05-12T20:21:51.255613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.22193","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pam: A pose-appearance-motion engine for sim-to-real hoi video generation","venue":null,"work_id":"ea64c350-7ca1-4bdb-b466-af3d50713cd4","year":2026},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:a37846b30a44c1f304eb6973717601ecbb58bedb5834405f14c22bac8e933a8d","observation_id":"04ccbeb3-3031-4e46-9707-988a877e7f43","resolution":{"observed_at":"2026-05-12T03:16:18.810191Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magicdrive: Street view generation with diverse 3d geometry control","venue":null,"work_id":"3aecdfa4-2f76-498a-ab2a-00eef40354a2","year":2024},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:fdac85f4cfe352976594c4fb6a80dc8dc7111ef19d437b7ed4fd63eea1dd5a43","observation_id":"8f57c110-7475-4292-9172-a4033459dcbb","resolution":{"observed_at":"2026-05-12T20:21:51.244994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vista: A generalizable driving world model with high fidelity and versatile controllability.Advances in Neural Information Processing Systems, 37:91560–91596","venue":null,"work_id":"f861fe58-27bc-44bf-b8e5-34eb60c30231","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:2b6a6244fe0c1656b13a8cabc7a18bb31ee6d456afc6ced3c0d6e7c6280940bd","observation_id":"eb86c5a3-df8f-451f-94e0-29d7a72f5315","resolution":{"observed_at":"2026-05-12T20:21:51.241551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18108","last_updated":"2025-03-23T15:27:43Z","snapshot_observed_at":"2026-07-06T20:57:21.459904Z","submitted_at":"2025-03-23T15:27:43Z","title":"Unraveling the Effects of Synthetic Data on End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2503.18108","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18108","snapshot_observed_at":"2026-07-04T02:59:26.701448Z","title":"Unraveling the effects of synthetic data on end-to-end autonomous driving","venue":null,"work_id":"bb7c0ae5-3ddd-4c3d-952c-a3feef59edfb","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2503.18108","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:4f9d672c39262b6b33de0f414bf237e01e46bd48b9d840919a127a9e5e38c1bf","observation_id":"78f695dc-bc32-4866-abc6-af6a522ed66d","resolution":{"observed_at":"2026-05-12T03:16:18.804088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-07-06T21:15:54.445465Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"cited_work":{"arxiv_id":"2504.19918","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19918","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing surgical documentation through multimodal visual-temporal transformers and generative ai","venue":null,"work_id":"307bce19-4967-49d4-88bb-1711a5e4319e","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2504.19918","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:851506426ce39cf743f4228f858ff1c2f1c0ee9dd589dc0520db0772e73ee225","observation_id":"5758488c-4032-45a5-a1b7-4bada09099ed","resolution":{"observed_at":"2026-05-12T03:16:18.685120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15208","last_updated":"2025-03-19T13:49:48Z","snapshot_observed_at":"2026-08-01T23:42:29.749765Z","submitted_at":"2025-03-19T13:49:48Z","title":"DiST-4D: Disentangled Spatiotemporal Diffusion with Metric Depth for 4D Driving Scene Generation","version":1},"cited_work":{"arxiv_id":"2503.15208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.15208","snapshot_observed_at":"2026-07-08T03:24:28.768344Z","title":"Dist-4d: Disentangled spatiotemporal diffusion with metric depth for 4d driving scene generation","venue":"cs.CV","work_id":"48e2d19a-8aee-4a66-b8d4-1bc3fc521e17","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2503.15208","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:334c03317e0fc7202e6578d1959c9d0c4a1ed4553be30d8ae9e5bdc80f0d9a3b","observation_id":"b6296617-b780-44ce-946c-c65d102f5315","resolution":{"observed_at":"2026-05-12T03:16:18.679224Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.23162","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:19:31.431181Z","title":"arXiv:2512.23162 (2025) 10 Authors Suppressed Due to Excessive Length","venue":null,"work_id":"0911d961-e397-4181-ae5e-81216135738b","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:b1bbf81a7c54e8618fb491c5339794e98e99aea5e6f027b6507095a90d76619c","observation_id":"e173bed9-6c80-4ebf-9d25-7205af107ff3","resolution":{"observed_at":"2026-05-12T03:16:18.751618Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16760","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:46:40.293866Z","title":"Vision-language-action models for autonomous driving: Past, present, and future","venue":null,"work_id":"3ed0d403-c946-4357-b4f8-c33ead499359","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:96e716f1fa7f6d4a04b03a04cdc360e08b5c7378ecbb49bda5018bb582fd73ec","observation_id":"d59d0854-9d29-4876-ac8e-b55e8d0e64d6","resolution":{"observed_at":"2026-05-12T03:16:18.787557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Surgen-net: A generative approach for surgical vqa with structured text generation","venue":null,"work_id":"71f5de14-d013-43a3-a754-2fd1a4738c7b","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:9872bf5839d0bdc8b8e823412cb9fba874b535c60d6146711648fbc71073eaca","observation_id":"fc973bda-ab88-46c6-b63d-b1ef2394355d","resolution":{"observed_at":"2026-05-12T20:21:51.251816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17242","last_updated":"2025-04-02T21:12:32Z","snapshot_observed_at":"2026-08-02T01:59:04.180455Z","submitted_at":"2024-10-22T17:58:28Z","title":"LVSM: A Large View Synthesis Model with Minimal 3D Inductive Bias","version":2},"cited_work":{"arxiv_id":"2410.17242","doi":"10.48550/arxiv.2410.17242","metadata_source":"pith","pith_arxiv_id":"2410.17242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lvsm: A large view synthesis model with minimal 3d inductive bias","venue":"cs.CV","work_id":"c5e225cf-22b3-4efa-a3c4-5346587616d0","year":2024},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2410.17242","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:964bca810276ad70acd28399febfa35188b95d603ea5637ab8c881188361aff6","observation_id":"2c9a4357-daf0-403c-b1b6-f557808b7bd0","resolution":{"observed_at":"2026-05-12T03:16:18.698272Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09750","last_updated":"2024-10-13T07:12:35Z","snapshot_observed_at":"2026-07-06T19:32:28.772012Z","submitted_at":"2024-10-13T07:12:35Z","title":"Surgical-LLaVA: Toward Surgical Scenario Understanding via Large Language and Vision Models","version":1},"cited_work":{"arxiv_id":"2410.09750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.09750","snapshot_observed_at":"2026-07-02T17:27:15.548001Z","title":"Surgical-llava: Toward surgical scenario understanding via large language and vision models","venue":null,"work_id":"8b2cbd24-a8c1-4add-8ae9-c7eb70025e5d","year":2024},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2410.09750","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:cae36d3ceffd21fd3646b3f9c17cc5cf06a90f79e315dc5ee29c3f1bbb5034b8","observation_id":"71f0ffbc-740c-47b1-ba44-c3de66dbfb82","resolution":{"observed_at":"2026-05-12T03:16:18.784277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.08577","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Disturbance-free surgical video generation from multi-camera shadowless lamps for open surgery","venue":null,"work_id":"58af37a6-5cdb-4f3b-99cd-72947a24d280","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:dc50231e78f533f0de8565d85e8ce36ba0f8714fda34df729f3a1d4e49af9397","observation_id":"bc43c6d1-c58f-4ee5-916b-722106507495","resolution":{"observed_at":"2026-05-12T03:16:18.734410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Surgical vision world model","venue":null,"work_id":"5d7ab9d5-3273-40ee-976b-3a9df60002f4","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:2cbffbcfabf9f6f49d9487c5f14cbb084c80ecfa5371d02b23b09783f25fae1a","observation_id":"654acb25-adb7-4424-abc1-7f352b5dc06b","resolution":{"observed_at":"2026-05-12T20:21:51.237417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sangria: surgical video scene graph optimization for surgical workflow prediction","venue":null,"work_id":"3572185f-f979-46f8-93f2-9df9c30959ea","year":2024},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:cecbc73a98ead9afe75fbd197ce7bcb49fa4d7c156f2f7e87adfeca9a2e88474","observation_id":"b47a9ebf-2231-4b1d-af2b-68e19c9c74f4","resolution":{"observed_at":"2026-05-12T20:21:51.225139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07996","last_updated":"2026-07-20T17:34:32Z","snapshot_observed_at":"2026-08-05T06:03:57.824747Z","submitted_at":"2025-09-04T17:59:58Z","title":"3D and 4D World Modeling: A Survey","version":4},"cited_work":{"arxiv_id":"2509.07996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.07996","snapshot_observed_at":"2026-07-21T03:22:29.733321Z","title":"3d and 4d world modeling: A survey","venue":null,"work_id":"0197d8fe-e11f-40f4-9254-87e63d981bf9","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2509.07996","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:5d632dbaff1349967c60ef716fea55f05e454d1c69789a679372c76d1030e9b6","observation_id":"56eb046d-3e6f-4954-82ad-d8dc7dbdd976","resolution":{"observed_at":"2026-07-21T03:22:29.733321Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:5acae78f379485bc96f89d7a3ae9bade97ce3a86d4c56462ed67ca39d5ebf5fd","observation_id":"93a6befe-1888-4b3a-8b23-7303bc1354e7","resolution":{"observed_at":"2026-05-12T03:16:18.758132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Modeling disease progression with diffusion-based generative models","venue":null,"work_id":"523b6b9f-bbc9-482c-aa93-5a711b11672a","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:f41c751af8624b3fe3cf6cb099c14e72f8f7ecc970f4387ab8b3c04ab0dc08da","observation_id":"e98de1b0-21ed-471c-85d6-a570e16dfb25","resolution":{"observed_at":"2026-05-12T20:21:51.220238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segmentation of surgical instruments in laparoscopic videos: training dataset generation and deep-learning-based framework","venue":null,"work_id":"7500070a-e773-4556-954f-1c81aad34d57","year":2019},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:79fc2df12c80a43a5897150bab925feab3cbdb6dc20fe546326bdb131ad44f17","observation_id":"dff7f821-e836-4413-86f6-d7ca751b34e2","resolution":{"observed_at":"2026-05-12T20:21:51.229132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uniscene: Unified occupancy-centric driving scene generation","venue":null,"work_id":"caec56cd-32ff-42c7-996a-92be91d92299","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:fe92a655854a495242f7d5b3a0199821ebdca4d375c4b2ab636145332f501602","observation_id":"435063ef-9248-403f-9949-f0f41d14dd98","resolution":{"observed_at":"2026-05-12T20:21:51.233500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Endosparse: Real-time sparse view synthesis of endoscopic scenes using gaussian splatting","venue":null,"work_id":"8d403b4b-1686-4855-ad21-99e7feee5ed5","year":2024},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:218d0cf7c3d37ddc46fbf6468de47d9619d4fa2f295fe645fc5dcfcc09218c45","observation_id":"ba9a2841-cf63-44af-a0c1-a8824f66a47e","resolution":{"observed_at":"2026-05-12T20:21:51.259201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Endora: Video generation models as endoscopy simulators","venue":null,"work_id":"0bba23e9-62b3-4ca9-83ce-3f52984242b4","year":2024},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:0f693c0d02634cfcab3bb394e70b5bf7ecc1ffd5895302f5524255c0d7f3cb81","observation_id":"db639285-1959-4b7d-86c3-92aa7273760e","resolution":{"observed_at":"2026-05-12T20:21:51.274874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07981","last_updated":"2024-08-15T07:00:20Z","snapshot_observed_at":"2026-07-06T19:00:57.743738Z","submitted_at":"2024-08-15T07:00:20Z","title":"LLaVA-Surg: Towards Multimodal Surgical Assistant via Structured Surgical Video Learning","version":1},"cited_work":{"arxiv_id":"2408.07981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.07981","snapshot_observed_at":"2026-07-03T16:38:39.543254Z","title":"arXiv preprint arXiv:2408.07981 (2024)","venue":null,"work_id":"183d8392-5211-43c5-9bbb-7afd03c7ae03","year":2024},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2408.07981","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:95a662bf177db77a94d6789b4dd7822bbe94f31e7a4aa90a7684b0b262ef1b01","observation_id":"4ad746c2-5651-488c-a713-1c5e14e8f8bc","resolution":{"observed_at":"2026-05-12T03:16:18.813273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07619","last_updated":"2024-11-12T08:05:58Z","snapshot_observed_at":"2026-08-02T15:32:09.305263Z","submitted_at":"2024-11-12T08:05:58Z","title":"Artificial Intelligence for Biomedical Video Generation","version":1},"cited_work":{"arxiv_id":"2411.07619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.07619","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Artificial intelligence for biomedical video generation","venue":null,"work_id":"5190c2fb-8bdd-4071-a44f-e3bf2ad0caaa","year":2024},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2411.07619","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:175ccf24236fada1370ab1e014e4d15be9d09714e437c2289fd08624e1797871","observation_id":"d8e3c345-6d63-4316-b784-912a403c6bea","resolution":{"observed_at":"2026-05-12T03:16:18.672959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02265","last_updated":"2025-06-02T21:15:00Z","snapshot_observed_at":"2026-08-02T21:37:47.475951Z","submitted_at":"2025-06-02T21:15:00Z","title":"Rig3R: Rig-Aware Conditioning for Learned 3D Reconstruction","version":1},"cited_work":{"arxiv_id":"2506.02265","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02265","snapshot_observed_at":"2026-07-08T23:55:43.023437Z","title":"arXiv preprint arXiv:2506.02265 (2025) 9","venue":"cs.CV","work_id":"9214147d-641e-4e08-aeb2-d98bedf03256","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2506.02265","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:ba23b8f14f0de4cb7e1b8aab90d5b5259a29fbf41ecd7faf51cbc246e952b3a9","observation_id":"cdb16a78-8ac4-4e01-80b8-6b95223fc059","resolution":{"observed_at":"2026-05-12T03:16:18.807109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ophora: a large-scale data-driven text-guided ophthalmic surgical video generation model","venue":null,"work_id":"dad9a0d0-800e-42cd-9ea5-7d4a852066b9","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:d1b1746c0b86a07c8182b8bc6efe677394a859f88004a90c4bd8c600fcb0d897","observation_id":"d5084304-9acb-429f-947f-840a8ceb4af1","resolution":{"observed_at":"2026-05-12T20:21:51.295774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Surgpub-video: A comprehensive surgical video framework for enhanced surgical intelligence in vision-language model","venue":null,"work_id":"3aa6625c-0316-451b-8f97-1c8c00f3c3f9","year":2026},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:742157783fa10b924e63eb8b1113c957e83eecd2e60a9f04725d7d1491a52a67","observation_id":"fd2aa445-4fc7-41bc-8ac3-e7fc254f1699","resolution":{"observed_at":"2026-05-12T20:21:51.308428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.10958","last_updated":"2026-06-01T17:54:44Z","snapshot_observed_at":"2026-08-03T18:19:00.778254Z","submitted_at":"2025-12-11T18:59:58Z","title":"WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World","version":2},"cited_work":{"arxiv_id":"2512.10958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.10958","snapshot_observed_at":"2026-07-03T21:58:58.283718Z","title":"WorldLens: Full-spectrum evaluations of driving world models in real world","venue":"cs.CV","work_id":"52b9a2ed-a099-4858-8787-4578c04dc509","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2512.10958","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:9666fd25e21fc64cc50634880901d09aa7402561307713df60490d002823a08d","observation_id":"782843e4-1fe8-420c-89d5-af6b79dc34fa","resolution":{"observed_at":"2026-06-02T04:04:48.711248Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18590","last_updated":"2025-03-22T20:49:08Z","snapshot_observed_at":"2026-07-06T20:28:33.378335Z","submitted_at":"2025-01-30T18:59:11Z","title":"DiffusionRenderer: Neural Inverse and Forward Rendering with Video Diffusion Models","version":2},"cited_work":{"arxiv_id":"2501.18590","doi":"10.48550/arxiv.2501.18590","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18590","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2501.18590 (2025)","venue":"ArXiv.org","work_id":"76e1931d-8baa-4c77-8dfe-d5c710b653fe","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2501.18590","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:2385fe148bf39663e1d6e755860fb8370049385df7fa808076b022013dde066d","observation_id":"507f9443-9897-4360-a26f-d203539438e9","resolution":{"observed_at":"2026-05-12T03:16:18.797230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00704","last_updated":"2025-07-18T19:07:12Z","snapshot_observed_at":"2026-07-06T21:17:42.853055Z","submitted_at":"2025-05-01T17:59:57Z","title":"Controllable Weather Synthesis and Removal with Video Diffusion Models","version":2},"cited_work":{"arxiv_id":"2505.00704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00704","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Controllable weather synthesis and removal with video diffusion models","venue":null,"work_id":"92811d84-b403-41cb-b48b-b18909c8aa6b","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2505.00704","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:f60fb96b6ed3e8ff9594a583ed770ea2924ab4b509996c86c3d95f7a771e0ccc","observation_id":"6cf91b7e-7002-494b-8091-1637f73a202d","resolution":{"observed_at":"2026-05-12T03:16:18.720374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ctrl-adapter: An efficient and versatile framework for adapting diverse controls to any diffusion model","venue":null,"work_id":"4247a1bd-febc-4b51-b2bb-c09949d5cf6d","year":2024},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:1154c7fb88505f8cdd98973347a7341fb2e98dba454036e52dc5e1f1c8e0da6a","observation_id":"9411a15f-8121-4ba1-bac0-d18f877c154d","resolution":{"observed_at":"2026-05-12T20:26:49.581651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:1dfb8a994e6a357ac99e56cba2a48f10e1aa774632a65c2791dbdec72cae7c1c","observation_id":"d0118a94-8fe3-4d65-bd57-ce03803e9585","resolution":{"observed_at":"2026-05-12T03:16:18.771101Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.23171","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:59:33.594018Z","title":"arXiv preprint arXiv:2505.23171 (2025)","venue":null,"work_id":"f82769c5-3648-452c-be6b-0b3ac76b7007","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:f51e32313fc5c5725f88d3324819b84c02157aba19e78da9a7d5aaff2701ee59","observation_id":"72062a27-ab35-4146-8474-bc9d8b3e6a1e","resolution":{"observed_at":"2026-05-12T03:16:18.695071Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Endogen: Conditional autoregressive endoscopic video generation","venue":null,"work_id":"c6b2ed8a-2a9f-425b-a1f8-f48436de6a8c","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:5995ed136c846f18bef872839a3caad5f52aa97cb96f37e6e99604658a54795a","observation_id":"41be7bf8-2d35-43ec-be27-3f70fca0ce67","resolution":{"observed_at":"2026-05-12T20:26:49.627468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-07-06T11:22:38.453675Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":"2106.13230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-07-03T19:08:49.804199Z","title":"In European Conference on Computer Vision, pages 413–430","venue":null,"work_id":"4eab6a90-c0e0-4827-9c27-5744f88b5eac","year":2021},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:6b5f510db08d98578deb2efe69f6a5fb2fff21d43425ac5c07120ba00e4a6bec","observation_id":"4d1c6c00-887c-4f63-87b8-1ab91b108f48","resolution":{"observed_at":"2026-05-12T03:16:18.777601Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:4623255f4215680d287902e9e1b59164866510e3010a78747c9179a0b1a3043c","observation_id":"a4b0c8e5-f6d1-4e13-8fc9-3d61fdf2f122","resolution":{"observed_at":"2026-05-12T03:16:18.707840Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video content analysis of surgical procedures.Surgical endoscopy, 32 (2):553–568","venue":null,"work_id":"0a0ceb56-0761-40ca-b545-dbb44b81db9c","year":2018},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:0b425aabba5e5986a40ed58d419a65e5883cda1b06aa87c0b867a450dd9aac86","observation_id":"d4cb33da-4e69-4c8d-8416-e32444467081","resolution":{"observed_at":"2026-05-12T20:21:51.248572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open- world surgical video generation via dual-visual diffusion and dual-annealed generation.Neural Networks, page 108281","venue":null,"work_id":"80f0b380-e2f0-4df6-a2d7-e0151c53bd3c","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:434dba451602200e5c8726d1e2b0fe5e252123e24e7846a44da6edf9d59f5c14","observation_id":"fcb94b62-a4d1-49aa-8fa0-e3ade497d13f","resolution":{"observed_at":"2026-05-12T20:21:51.304194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00784","last_updated":"2026-06-26T17:35:03Z","snapshot_observed_at":"2026-07-13T14:51:28.934623Z","submitted_at":"2026-04-01T11:45:28Z","title":"An Approach to Enriching Surgical Video Datasets for Fine-Grained Spatial-Temporal Understanding of Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2604.00784","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2604.00784","snapshot_observed_at":"2026-06-29T02:14:53.026538Z","title":"An approach to enriching surgical video datasets for fine-grained spatial-temporal understanding of vision-language models","venue":null,"work_id":"bd937ad5-7c9e-41ce-9690-4f140b3efbac","year":2026},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2604.00784","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:871e350ec93f841d25ae3362819044d82d4ca6c22108ee03527eb180d28a4419","observation_id":"7711b961-0753-4cce-8165-9fb17d3bd60a","resolution":{"observed_at":"2026-06-29T02:14:53.026538Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6d99b3e9-5a20-4478-ba90-7003fc77ea45","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:42f87cba357de283c3bf744a30a6d9f703caa1b93e01b6d43b3855a12729e8cd","observation_id":"50901873-8af0-4342-8282-46326807304b","resolution":{"observed_at":"2026-05-12T20:26:49.647202Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simuscope: Realistic endoscopic synthetic dataset generation through surgical simulation and diffusion models","venue":null,"work_id":"f1ec3fee-341d-4425-8e93-89d01dc5f9fb","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:961be92312baa400c64ea0db9a7ff5479bc3c479383ccaee8a86f871a31d960f","observation_id":"ec6888f2-f87b-43f7-81fb-e0beb3d57883","resolution":{"observed_at":"2026-05-12T20:26:49.707421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mixture of experts: a literature survey.Artificial Intelligence Review, 42(2):275–293","venue":null,"work_id":"71e70e50-9d14-463c-9837-379da2a90680","year":2014},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:31d61900fd5c0907fb6ee6254ae94d857f6692b19cc3b5366f03fde0433cb754","observation_id":"5fceab92-6d61-42a8-b107-b8cf023238c1","resolution":{"observed_at":"2026-05-12T20:26:49.692818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Innovating robot-assisted surgery through large vision models.Nature Reviews Electrical Engineering, 2(5):350–363","venue":null,"work_id":"88b62b58-14ff-4a80-b0b7-8e94f19cde4e","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:053aa356516f8658abe9794aec6a49304bdd98cc3b3522b7b8928c89cd05b9f3","observation_id":"010d0917-6e23-4307-9933-100a066d28ce","resolution":{"observed_at":"2026-05-12T20:26:49.569806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dianye Huang","venue":null,"work_id":"f8396317-9604-4415-97fd-04d7719a5635","year":2026},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:903c25d476c1f22b4753ceeffc2fc764494f47cb8f8be836a17e977198922896","observation_id":"65ce0393-4309-4ece-818a-fc9cafbf6150","resolution":{"observed_at":"2026-05-12T20:26:49.728854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4e63433b-15f9-49d5-a5f8-e3cdc7e5d3b4","year":2021},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:c1f0625fc1b2077276208143c20db40e6b21ebc879c0f4bafaaf97487b0777ba","observation_id":"38330193-ee7d-407a-80c5-893faa5b8891","resolution":{"observed_at":"2026-05-12T20:26:49.637721Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00496","last_updated":"2024-01-23T23:30:57Z","snapshot_observed_at":"2026-08-02T18:08:38.646548Z","submitted_at":"2023-12-31T13:32:18Z","title":"SAR-RARP50: Segmentation of surgical instrumentation and Action Recognition on Robot-Assisted Radical Prostatectomy Challenge","version":2},"cited_work":{"arxiv_id":"2401.00496","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.00496","snapshot_observed_at":"2026-07-10T08:06:57.763274Z","title":"arXiv preprint arXiv:2401.00496 (2023) 10 C","venue":"cs.CV","work_id":"19126299-b1af-49fb-a760-0f18e72033d3","year":2023},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2401.00496","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:26634e06f7db0e90eca607305b9e0513fb73e9fb3fd10b78a0875ec5d7ac49c0","observation_id":"d2dfc504-47d8-43dc-8e47-3051d1aef4d4","resolution":{"observed_at":"2026-05-12T03:16:18.688736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.13024","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:19:31.443245Z","title":"Saw: Toward a surgical action world model via controllable and scalable video generation","venue":null,"work_id":"b795f218-a037-485d-be6c-033a4b3ce148","year":2026},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:e7f9a3a4d0d4677e36ee6c5953217ff1cb4358af46fe3b2a3af0c0b9b2dc3554","observation_id":"8c4f304f-c2ca-48cc-becf-58035f7d29a5","resolution":{"observed_at":"2026-05-12T03:16:18.767929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:e79d7c99d4b7f1f3a9a9e7101c3c6c3c238773e112f3fc858bfbcb3588fcb83a","observation_id":"ea2b6858-2a9e-43a7-9f49-bcad79396f2c","resolution":{"observed_at":"2026-05-12T03:16:18.710551Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Motion generation of robotic surgical tasks: Learning from expert demonstrations","venue":null,"work_id":"601ede68-61c2-4e35-a5ee-6dd7bb46c562","year":2010},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:fce2bbc8687ad1bcadd285d5e1f429e13d80fd267b9c49eeb9932c906fdbeb8a","observation_id":"5e3f5fb9-4872-47b2-b9a1-1c6f0aefa2c0","resolution":{"observed_at":"2026-05-12T20:26:49.614652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks","venue":null,"work_id":"e5bbd382-cf5d-45bd-bd78-9bcde657b5c9","year":2024},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:28a54b6a0938626c4998b682e3f1325989b7ff1eb3dd3d608062514a2a4f827a","observation_id":"1ca25064-5c62-4b6d-8adb-10dd6383875d","resolution":{"observed_at":"2026-05-12T20:26:49.610134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.08476","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T21:06:14.786232Z","title":"Lar-moe: Latent-aligned routing for mixture of experts in robotic imitation learning","venue":null,"work_id":"20c59822-954b-4936-a995-8319c56a8149","year":2026},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:aa97c463e4909f992a4c82b6003808351ed3bb6f2a3719742a3087bfd5275944","observation_id":"2ada182e-ec79-47d3-88f7-d6e80da79354","resolution":{"observed_at":"2026-05-12T03:16:18.723667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:03:52.552260Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":"d9e83908-4fe2-4288-a175-8230b59d0899","year":2015},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:d9494e10e09981931d91a7340d54d8346308acff431846cb87e05b632d36ccd6","observation_id":"5cce5403-2e13-432c-a1ad-a766b65ce30e","resolution":{"observed_at":"2026-05-12T20:26:49.657247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"New generation evaluations: video-based surgical assessments: a technology update.Surgical endoscopy, 37(10):7401–7411","venue":null,"work_id":"82a7446e-c722-44fc-b056-d079c6b9f8c3","year":2023},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:7097c2a0a0583f5b2dcfbf0d272848cb0119838dc01b883cc7958a23cc73c842","observation_id":"688004e7-8c7a-4297-9bdc-de449af1ed01","resolution":{"observed_at":"2026-05-12T20:26:49.697233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Binary cross entropy with deep learning technique for image classification.Int","venue":null,"work_id":"b57ee6f0-4316-4fc1-ba58-0316e1ebf46d","year":2020},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:a2cc103cd3ce7309385a3b00275c9c1f7261d2f086205b6d03a5de886578ad5c","observation_id":"6c84c60c-7b52-4d27-8991-85c0f752ccca","resolution":{"observed_at":"2026-05-12T20:26:49.722829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Empowering surgeons with integrated synthetic data: solutions for mastering complex clinical scenarios","venue":null,"work_id":"a1ac75d0-bff2-4b03-9531-ba9bfe04c7b1","year":2026},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:dea316476edf10efd0ec7032e04046c3d7cff0b73ac45b29e6627d1229ff6d94","observation_id":"8ce8518b-23cc-4226-9111-c0270e57450c","resolution":{"observed_at":"2026-05-12T20:26:49.712006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R3d-18 for ucf-101 action recognition","venue":null,"work_id":"3f30f7db-bc45-4cde-a197-325285ea2075","year":2024},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:b6e733e9e71c1f383606c43b8153a012918f92d40635b2efa7223c325262282e","observation_id":"c6bc3852-518f-45a6-a226-b02c4d9648e3","resolution":{"observed_at":"2026-05-12T20:26:49.594159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sg2vid: Scene graphs enable fine-grained control for video synthesis","venue":null,"work_id":"c60afdc3-1e1f-4e47-a7a0-d3920c278def","year":null},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:36b71cd057c733cf1c7ce6cdf242b57c233e8513fcd76da7297fafabcd8ad043","observation_id":"df867961-edd6-41e5-a88a-6912a9147ed9","resolution":{"observed_at":"2026-05-12T20:26:49.664216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08944","last_updated":"2024-07-16T03:00:07Z","snapshot_observed_at":"2026-07-06T18:45:09.719850Z","submitted_at":"2024-07-12T03:00:25Z","title":"Bora: Biomedical Generalist Video Generation Model","version":2},"cited_work":{"arxiv_id":"2407.08944","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08944","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bora: biomedical generalist video generation model","venue":null,"work_id":"0cd571df-372b-474e-bf8a-d4c487a20db5","year":2024},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2407.08944","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:bd75dbdb277e39764e344ae68ba6f3d46b7fe3dbc3d921df162b5e8ca86d5d2c","observation_id":"c00780bd-e038-4626-853c-ce450809d357","resolution":{"observed_at":"2026-05-12T03:16:18.727110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openai’s sora and google’s veo 2 in action: a narrative review of artificial intelligence-driven video generation models transforming healthcare.Cureus, 17(1):e77593","venue":null,"work_id":"e1f4fdbd-67ba-49e9-926a-06d3477d28f7","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:3a4c56f907ddc61a96b609038e39110c51f413f0ba438fcec0d066f8cc78c2f3","observation_id":"5af5924f-b52b-46ca-b8cc-62d60e63358a","resolution":{"observed_at":"2026-05-12T20:26:49.589296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12531","last_updated":"2025-03-16T14:51:12Z","snapshot_observed_at":"2026-07-06T20:53:31.919637Z","submitted_at":"2025-03-16T14:51:12Z","title":"Towards Suturing World Models: Learning Predictive Models for Robotic Surgical Tasks","version":1},"cited_work":{"arxiv_id":"2503.12531","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12531","snapshot_observed_at":"2026-07-04T03:19:31.421209Z","title":"Towards sutur- ing world models: Learning predictive models for robotic surgical tasks","venue":null,"work_id":"846dfb60-12f9-48ec-ad7d-67f037f788bf","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2503.12531","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:8f7382185832176365ffb5d4b4341d276fb530a09932baf320911910b3b9bc16","observation_id":"61a1f260-4b7e-4f90-97c8-7f9926250895","resolution":{"observed_at":"2026-05-12T03:16:18.764414Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards holistic surgical scene understanding","venue":null,"work_id":"4dc2de72-b6bd-46c4-8784-d49702ecc386","year":2022},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:a58f747971f40f577f69e363b382ebc4e0c593a233eae6c8836f3257a0f8a451","observation_id":"050bea69-a343-4613-a341-d9f1afd338ad","resolution":{"observed_at":"2026-05-12T20:26:49.652383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.07345","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigating surgical data imbalance with dual-prediction video diffusion model","venue":null,"work_id":"0d0bb16e-07e0-48a3-ab93-633657d77435","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:73b4863f672676115e605a053e03c85ecd00f972899115ab9e50a38cfb4a7367","observation_id":"f7f95204-17d2-43ff-9cb9-7e0565233e18","resolution":{"observed_at":"2026-05-12T03:16:18.701475Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:14a4e7732b3fbeaf943bdb695af425b33017504a21387db4ff278e1a401f8d98","observation_id":"ede8bc07-38c0-486b-98a3-9f617cc905d7","resolution":{"observed_at":"2026-05-12T03:16:18.745155Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.17873","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T09:47:59.386711Z","title":"arXiv preprint arXiv:2506.17873 (2025)","venue":null,"work_id":"47b95199-6dba-4b5a-af70-655d8077f52f","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:aa9e65fc1cd2ce5d07e4dc78818021cc631b13fbd5eb501a2c9777390cd7100f","observation_id":"58ba6df4-0196-4aa6-8aaa-f0df87c201fb","resolution":{"observed_at":"2026-05-12T03:16:18.748607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Feat: Full-dimensional efficient attention transformer for medical video generation","venue":null,"work_id":"8c2fd67e-d973-44be-9b26-a8cae9c01a41","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:63a30b8e0ef9543b03a6cfb876a2444c3ec5794125c2131fae12c6e068a58bc1","observation_id":"10969d8c-08b6-4f7d-8387-726988dc2438","resolution":{"observed_at":"2026-05-12T20:26:49.620123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05675","last_updated":"2025-07-08T04:58:36Z","snapshot_observed_at":"2026-08-02T23:38:29.002346Z","submitted_at":"2025-07-08T04:58:36Z","title":"MedGen: Unlocking Medical Video Generation by Scaling Granularly-annotated Medical Videos","version":1},"cited_work":{"arxiv_id":"2507.05675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.05675","snapshot_observed_at":"2026-07-03T09:47:59.611944Z","title":"Medgen: Unlocking medical video generation by scaling granularly-annotated medical videos","venue":null,"work_id":"271ca213-6f5b-4ac1-82b1-3bf03d4e0066","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2507.05675","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:598bbe92d5c4fa20444b6306eb09b53f0ab96b225eff6d36db22bc474ece47ae","observation_id":"72ced6b7-7694-4ba9-9ad3-608cfeaf0bf6","resolution":{"observed_at":"2026-05-12T03:16:18.790532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards accurate and interpretable surgical skill assessment: a video-based method for skill score prediction and guiding feedback generation","venue":null,"work_id":"af546412-5fd7-4afa-b918-0cb5b47a6a9e","year":2021},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:6150dbbf89af1c6cd85479cf2c51a3ce558557b18e6de49aac732fde959b61cd","observation_id":"d5bf5d86-21f6-4013-ae36-902fffe3b57a","resolution":{"observed_at":"2026-05-12T20:26:49.680530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video grounded conversation generation for reference surgical instrument segmentation","venue":null,"work_id":"fd345044-de3c-4b0e-b840-5c3e9e289fff","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:77f8c01b7059cd9c3b5e6100fb65d4ba52999087ac159744d070649fa9c5708d","observation_id":"a772bc9e-8993-4f30-87f1-d1bc0c50754c","resolution":{"observed_at":"2026-05-12T20:26:49.598281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accelerating surgical skill acquisition by using multi-view bullet-time video generation.Applied Sciences, 15(16):8830","venue":null,"work_id":"40406dad-c6b3-4ce9-8a5f-fd7e2c089698","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:9c77cd901974fa9b7c2d4c24ada0c2370a92502e2263dfa692ea1c0bfd70ae6e","observation_id":"7d0dface-152a-424e-bfef-c9e05d9ae588","resolution":{"observed_at":"2026-05-12T20:26:49.670258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning multi-domain representations to restore degraded surgical videos","venue":null,"work_id":"c5d9fa32-d381-4928-b1df-db244d1d0c0d","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:e68d666e4c6c9cdae0f776a70e3e3bde1b132f7ac919a9c9222ecaa4f89d8901","observation_id":"0297da80-58eb-4e8f-83ea-1254d6bbaf56","resolution":{"observed_at":"2026-05-12T20:26:49.623719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generation of fundus fluorescein angiography videos for health care data sharing.JAMA ophthalmology, 143(8):623–632","venue":null,"work_id":"c134aac9-cb4d-4868-9dc7-3ef8f1144523","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:f746fef3c0419f500b7678815cb46edb2ec279346d9765f30bcef1ed89c615c7","observation_id":"3656e64f-3d44-41fd-9191-12f9ddbed149","resolution":{"observed_at":"2026-05-12T20:26:49.686556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segformer: Simple and efficient design for semantic segmentation with transformers.Advances in neural information processing systems, 34:12077–12090","venue":null,"work_id":"d8d78ec5-fb35-477b-be28-cdfd3ddf1bbb","year":2021},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:853b159901465da971349a97f4beaff65debb67e4a5dd61709709093a7d1447c","observation_id":"e0224cd8-1168-41c8-bef8-6cd842c3e00b","resolution":{"observed_at":"2026-05-12T20:26:49.676118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12137","last_updated":"2025-08-05T02:59:52Z","snapshot_observed_at":"2026-08-03T21:17:44.016075Z","submitted_at":"2025-07-16T11:10:57Z","title":"AD-GS: Object-Aware B-Spline Gaussian Splatting for Self-Supervised Autonomous Driving","version":3},"cited_work":{"arxiv_id":"2507.12137","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12137","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ad-gs: Object- aware b-spline gaussian splatting for self-supervised autonomous driving","venue":null,"work_id":"e7afc99d-4273-4cb8-a18c-b34476c03ad9","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2507.12137","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:13f625d8e9e0dc5add05e373253d56ac8e40e8c7ce81cd9f605e2dcec7d89c80","observation_id":"55c59fea-990c-4bb2-bb36-4fb209e4aea3","resolution":{"observed_at":"2026-05-12T03:16:18.761349Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.12787","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generalized recognition of basic surgical actions enables skill assessment and vision-language-model-based surgical planning","venue":null,"work_id":"3568550f-3d92-42f1-9209-16e731fa8a76","year":2026},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:5135b0e2da09d579e5715902e15eff085b8303849f0a0ee3ae04fb697b58c22d","observation_id":"3c8464bf-c045-4fbe-8dc2-35d63d5fb073","resolution":{"observed_at":"2026-05-12T03:16:18.730848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09981","last_updated":"2026-04-28T09:28:14Z","snapshot_observed_at":"2026-08-02T12:46:46.614409Z","submitted_at":"2025-06-11T17:55:05Z","title":"ReSim: Reliable World Simulation for Autonomous Driving","version":2},"cited_work":{"arxiv_id":"2506.09981","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.09981","snapshot_observed_at":"2026-07-08T07:14:45.217635Z","title":"ReSim: Reliable World Simulation for Autonomous Driving","venue":"cs.CV","work_id":"e31f3c52-a2f2-439c-8a03-2de4afea35bb","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2506.09981","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:491c16a3b0f70428fa6e34e8e3ed74eafa1107057745af1f1d267c7d0aa770fc","observation_id":"9941c8f6-d919-464c-8b82-f190b807c9a3","resolution":{"observed_at":"2026-05-12T03:16:18.780521Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.03079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:39:17.317093Z","title":"Orv: 4d occupancy-centric robot video generation","venue":null,"work_id":"ebcf2f70-fab4-4f11-ae56-45d4c39afb28","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:08124f4e15201c6c1e686dbfb5cfd66517b7ad551c87c7d4190963559ebb3740","observation_id":"3724eda2-d8f7-4ba6-991f-5709e06c4959","resolution":{"observed_at":"2026-05-12T03:16:18.754876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Medical world model","venue":null,"work_id":"c7332477-819c-4182-ad21-a4b743a944cc","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:e22cd8f38cee65589fdee69e7fe68662292382fa21166002ba4b1d3ec7dfa19f","observation_id":"25fa039f-65ea-4233-85b0-9c25779488ba","resolution":{"observed_at":"2026-05-12T20:26:49.560503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Driving view synthesis on free-form trajectories with generative prior","venue":null,"work_id":"924fea07-edc0-4a05-a3b9-147c30207fe2","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:680e2c7c3582e498875ee724450e927d886f8596ee1551583cf2c02f214227bc","observation_id":"5de37b63-0016-4469-abff-c1cdc25c6efe","resolution":{"observed_at":"2026-05-12T20:26:49.603526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instadrive: Instance-aware driving world models for realistic and consistent video generation","venue":null,"work_id":"8900e000-e4e9-4063-b879-b29f3be28282","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:5891a9cdb03da235c4bc7a24c95fab1dc49338e16f8fb77d542529d6603798bc","observation_id":"f9764541-4ed0-41d2-a4ba-433593ae30f8","resolution":{"observed_at":"2026-05-12T20:26:49.701950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:c6bfb392c6c059c06851847f44a4aeb0921506a288c4bfe92d0b3f3a181a51e1","observation_id":"3c8e7cc1-faa4-4edc-948f-474ae8ae649e","resolution":{"observed_at":"2026-05-12T03:16:18.713990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Automated trajectory generation for robotic surgical tasks","venue":null,"work_id":"f25a6882-384b-478f-800c-1fdf736c8732","year":2024},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:902147aa7508e35406ffd1c73fb75498f3eaceaed577e372ef210a7b54caf2dd","observation_id":"9db1eec0-73ef-4f5e-8c06-ad110a9d0c6f","resolution":{"observed_at":"2026-05-12T20:26:49.643256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Movis: Motion-guided video generation for laparoscopic surgery","venue":null,"work_id":"c4ab9ab7-e9c7-4bab-b0dd-fe9070180849","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:033066ea063a3363b0a0f4753815af346fcc1851657a41588254207fdfd93d50","observation_id":"3c643ba2-d830-4a9b-8818-e642d1a865bc","resolution":{"observed_at":"2026-05-12T20:26:49.631622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":3,"verified_exact":41,"verified_fuzzy":52},"total_outbound_references":111},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 111 outbound references and 3 inbound Pith citation observations for arXiv:2605.08712."}