{"as_of":"2026-08-04T16:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:736c475edcf165d5fd64d50083b5e514f390baca93d8de42dcb5c98e40a44deb","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":38,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:12:32.995933Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T04:09:35.034771Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2505.12705","last_updated":"2025-06-17T22:33:35Z","snapshot_observed_at":"2026-07-06T21:26:01.534136Z","submitted_at":"2025-05-19T04:55:39Z","title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T23:50:45.332466Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2505.12705"},"observation_digest":"sha256:dc617e8de78b9e3b3c3622ae1a0d578c5683d7ea0bed7ba866afdbec9cfee63a","observation_id":"5e282bed-5e98-430f-8d20-22b08266d0e8","resolution":{"observed_at":"2026-05-15T23:50:45.507330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2507.01264","last_updated":"2026-04-12T14:54:50Z","snapshot_observed_at":"2026-07-06T21:50:49.929005Z","submitted_at":"2025-07-02T00:45:19Z","title":"LLM-based Realistic Safety-Critical Driving Video Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T07:13:57.747558Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2507.01264"},"observation_digest":"sha256:9b68699cd799ef48715e2d4693aba384b50e5f3963283b077ddb30646245b844","observation_id":"2da991c7-4eda-40fe-8528-f2e42769e2ed","resolution":{"observed_at":"2026-05-19T07:17:08.402206Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2508.10934","last_updated":"2025-08-12T18:39:13Z","snapshot_observed_at":"2026-07-06T22:13:09.586800Z","submitted_at":"2025-08-12T18:39:13Z","title":"ViPE: Video Pose Engine for 3D Geometric Perception","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T16:41:08.620285Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2508.10934"},"observation_digest":"sha256:b6698406ada31104184877b1d986a839aa4f67bcc88033533e8a7efecc85e504","observation_id":"3ba50032-e5d0-456e-979a-531c29d79df5","resolution":{"observed_at":"2026-05-16T16:41:08.660028Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-08-04T09:12:32.995933Z","title":"Cosmos-Transfer1: Conditional world generation with adaptive multimodal control,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.16732","last_updated":"2026-06-25T19:54:02Z","snapshot_observed_at":"2026-08-04T09:12:26.148461Z","submitted_at":"2025-10-19T07:12:32Z","title":"A Comprehensive Survey on World Models for Embodied AI","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T09:12:32.995933Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2510.16732"},"observation_digest":"sha256:f865aa943656c88e2d0cb3eb8f8a9d9671c590a1de7f15c90093b2c0a878273d","observation_id":"ad860091-6241-488a-adf2-3e0c71ae3199","resolution":{"observed_at":"2026-08-04T09:12:32.995933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:a79e6311f2f944c68d3383158cf8397d77dddece4e93422fa3cca45dd9590f25","observation_id":"f344ecf1-a33d-49c0-8634-5443f93647f8","resolution":{"observed_at":"2026-05-12T23:01:13.712342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2511.23369","last_updated":"2026-04-10T09:10:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-28T17:17:38Z","title":"SimScale: Learning to Drive via Real-World Simulation at Scale","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T04:33:03.629533Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2511.23369"},"observation_digest":"sha256:8bac6def2331595e1db37c47d6d1c914e1f82d2e0ea9e7f7b9272d4044b915b9","observation_id":"413fc347-8f25-4d88-b12e-6edb1181e763","resolution":{"observed_at":"2026-05-17T04:34:01.784781Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2512.09646","last_updated":"2026-04-08T15:03:02Z","snapshot_observed_at":"2026-08-03T08:11:41.374378Z","submitted_at":"2025-12-10T13:40:24Z","title":"VHOI: Controllable Video Generation of Human-Object Interactions from Sparse Trajectories via Motion Densification","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T23:30:14.969895Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2512.09646"},"observation_digest":"sha256:c67cc2b4de57af2e0b9a6fc56e64ac93a4cfb0c90ce37863a59fa25fe1b2bdab","observation_id":"71b2a9e8-8232-40ee-af7a-485e338f3e93","resolution":{"observed_at":"2026-05-16T23:31:22.067393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-08-03T16:49:01.716396Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.11797","last_updated":"2026-07-06T16:12:36Z","snapshot_observed_at":"2026-08-03T16:48:58.445599Z","submitted_at":"2025-12-12T18:59:45Z","title":"AnchorDream: Repurposing Video Diffusion for Embodiment-Aware Robot Data Synthesis","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T16:49:01.716396Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2512.11797"},"observation_digest":"sha256:14daea2db928d04796ad468b23826274dd73e330a82029f9eca078b604658447","observation_id":"3dccb086-3cfa-411f-b109-557b3f4459f1","resolution":{"observed_at":"2026-08-03T16:49:01.716396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-08-03T13:24:42.566290Z","title":"Cosmos-transfer1: Conditional world generation with adaptive multimodal control.arXiv preprint arXiv:2503.14492, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24551","last_updated":"2026-06-18T22:13:10Z","snapshot_observed_at":"2026-08-03T13:24:41.191940Z","submitted_at":"2025-12-31T01:19:14Z","title":"PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T13:24:42.566290Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2512.24551"},"observation_digest":"sha256:4dd0bb64e5c8c47026b0ec2f68a314a8588adf22212f4750641b21ebbf3e6d17","observation_id":"6fb857da-9b42-483e-9399-8a3d8b802345","resolution":{"observed_at":"2026-08-03T13:24:42.566290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-14T23:29:30.577918Z","title":"Cosmos-transfer1: Conditional world generation with adaptive multimodal control.arXiv:2503.14492","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10604","last_updated":"2026-06-29T14:25:39Z","snapshot_observed_at":"2026-08-04T03:26:51.670278Z","submitted_at":"2026-03-11T10:05:32Z","title":"HyPER-GAN: Hybrid Patch-Based Image-to-Image Translation for Real-Time Photorealism Enhancement in Game Engines","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T23:29:30.577918Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2603.10604"},"observation_digest":"sha256:f90e0efced798cf9775c20fed608eb0702325b8e8bc6f5c5f5e3526aec7d6416","observation_id":"0272825e-e743-4e18-a674-283a3ff737fa","resolution":{"observed_at":"2026-07-14T23:29:30.577918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2603.11911","last_updated":"2026-05-06T13:54:46Z","snapshot_observed_at":"2026-07-06T22:48:48.873215Z","submitted_at":"2026-03-12T13:28:50Z","title":"InSpatio-WorldFM: An Open-Source Real-Time Generative Frame Model","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T12:07:17.341611Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2603.11911"},"observation_digest":"sha256:793c7555b8989a275d6bf16112c39a90ba5782ca7deffe9cbdd25a01a2483c80","observation_id":"4a4a10b6-253f-42e4-8f14-bd9ddd52bf8b","resolution":{"observed_at":"2026-05-15T12:09:59.863054Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2603.17714","last_updated":"2026-04-03T10:04:30Z","snapshot_observed_at":"2026-07-06T22:49:33.482934Z","submitted_at":"2026-03-18T13:32:26Z","title":"From Virtual Environments to Real-World Trials: Emerging Trends in Autonomous Driving","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-15T09:02:21.114658Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2603.17714"},"observation_digest":"sha256:8a83b81c1e0649bb2967ef69ae4478e031268a460dd6ff0fbaf51d3cba925275","observation_id":"ae7c6457-8b68-451b-ba46-09e1bab78836","resolution":{"observed_at":"2026-05-15T09:05:20.323081Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2604.04887","last_updated":"2026-04-06T17:36:05Z","snapshot_observed_at":"2026-07-06T22:53:46.999911Z","submitted_at":"2026-04-06T17:36:05Z","title":"HorizonWeaver: Generalizable Multi-Level Semantic Editing for Driving Scenes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T19:39:31.357223Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2604.04887"},"observation_digest":"sha256:e185af415c26669233b758f44a3ce5be59c213dafcaf596bea0a5055e32088ca","observation_id":"3f0f9fb4-ec28-4450-9ba4-9227d43d7231","resolution":{"observed_at":"2026-05-10T22:40:50.102371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2604.11707","last_updated":"2026-04-13T16:42:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T16:42:46Z","title":"Representations Before Pixels: Semantics-Guided Hierarchical Video Prediction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T16:30:53.578491Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2604.11707"},"observation_digest":"sha256:0ae4580e2f84c9342c6d16d60d5bf6d94394a4843e4a73f0f05a5deecbf23a2f","observation_id":"86f88068-b48d-4c81-b1b6-7cfe6e2af4ab","resolution":{"observed_at":"2026-05-11T08:45:58.697450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2604.15569","last_updated":"2026-04-16T22:55:39Z","snapshot_observed_at":"2026-07-06T23:03:07.228701Z","submitted_at":"2026-04-16T22:55:39Z","title":"ShapeGen: Robotic Data Generation for Category-Level Manipulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T10:17:05.939312Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2604.15569"},"observation_digest":"sha256:f34dcdb144b58bef5f6c5007cf992e099bc223705399f15bce0f930df1a58752","observation_id":"7789962c-23b6-48a7-9e69-19b41cc8b409","resolution":{"observed_at":"2026-05-10T10:19:20.659201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2604.22851","last_updated":"2026-07-07T12:47:51Z","snapshot_observed_at":"2026-07-12T18:45:30.417168Z","submitted_at":"2026-04-22T07:49:02Z","title":"EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T00:09:18.068337Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2604.22851"},"observation_digest":"sha256:4897f8a1a7acf20eb868238b2ec198da74e502d8e974fed4ae294a0e72cfc152","observation_id":"51215b4c-d1d4-4180-b51c-808bb123b4b6","resolution":{"observed_at":"2026-05-10T00:19:47.220532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2605.02757","last_updated":"2026-05-04T15:57:07Z","snapshot_observed_at":"2026-07-06T23:15:46.390406Z","submitted_at":"2026-05-04T15:57:07Z","title":"Seeing Realism from Simulation: Efficient Video Transfer for Vision-Language-Action Data Augmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T18:21:00.089755Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2605.02757"},"observation_digest":"sha256:d68b961a1a1741bd8c726c90a8b46cef1d3de5d4d8af27c6e40b1b51d05d1b27","observation_id":"eaa97439-eff9-4e1b-a624-221d3ae74aff","resolution":{"observed_at":"2026-05-09T06:35:38.590103Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2605.07326","last_updated":"2026-05-08T06:32:12Z","snapshot_observed_at":"2026-07-30T05:23:33.496468Z","submitted_at":"2026-05-08T06:32:12Z","title":"GEM: Generating LiDAR World Model via Deformable Mamba","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T01:31:09.604703Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2605.07326"},"observation_digest":"sha256:399a97737837d17421b0f0ccd392d6fa5b3361af19621b0891b235c2e9b6d618","observation_id":"7dca4217-d4eb-4efb-86bb-ebcd2e9dbffa","resolution":{"observed_at":"2026-05-11T01:45:51.336546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:f2add05f9f89d3b0b3ee85116415cc1f21d8b5bcaa09da7d86aeded3653c72a4","observation_id":"e9f829c1-89a9-4b72-a575-39e509e4ddfc","resolution":{"observed_at":"2026-05-12T03:16:18.826892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":296,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:7bd079a1b267732fa94b856ada2b5bc333ed540d4dc6e6dbdf4f2e7886822672","observation_id":"9f5332e1-14a8-41c8-8b9d-e055560af3c8","resolution":{"observed_at":"2026-05-13T05:07:18.079258Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2605.15477","last_updated":"2026-05-25T20:56:59Z","snapshot_observed_at":"2026-07-06T23:26:46.595393Z","submitted_at":"2026-05-14T23:35:54Z","title":"EgoExo-WM: Unlocking Exo Video for Ego World Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T14:32:27.920029Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2605.15477"},"observation_digest":"sha256:c931f18adba2f314f79491c57466c7dfac36a44e6bf412a18cc88c905344692a","observation_id":"bce5491f-574c-42f6-9951-6721c7c2c7f4","resolution":{"observed_at":"2026-05-19T14:32:36.109827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2605.15477","last_updated":"2026-05-25T20:56:59Z","snapshot_observed_at":"2026-07-06T23:26:46.595393Z","submitted_at":"2026-05-14T23:35:54Z","title":"EgoExo-WM: Unlocking Exo Video for Ego World Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T20:26:11.104536Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2605.15477"},"observation_digest":"sha256:eb8b0f55dc4d53a4b0a5699ca1d6afc856f92405b05224370422dafd8a6c3f13","observation_id":"ecc64b75-8f5b-49e3-bcc0-f48ca5f9812c","resolution":{"observed_at":"2026-07-01T14:35:47.482613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2605.19924","last_updated":"2026-05-19T14:47:38Z","snapshot_observed_at":"2026-07-06T23:30:35.042915Z","submitted_at":"2026-05-19T14:47:38Z","title":"RoHIL: Robust Human-in-the-Loop Robotic Reinforcement Learning Against Illumination Variations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T05:07:39.815615Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2605.19924"},"observation_digest":"sha256:4d083b8138327f4a8961e3619e3681d65258cbaefbd8708bc8e1b62c9b3b5e28","observation_id":"968dc632-0e55-4fa1-8cef-c33b988c931d","resolution":{"observed_at":"2026-05-20T05:08:04.874886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2605.22996","last_updated":"2026-05-21T19:51:20Z","snapshot_observed_at":"2026-08-02T14:22:11.396159Z","submitted_at":"2026-05-21T19:51:20Z","title":"CoMoGen: COntrollable MOtion Dynamics and Interactions with Mask-Guided Video GENeration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-25T05:44:58.627525Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2605.22996"},"observation_digest":"sha256:6dd02b45107bc1389776bcee3bfe48a7a9e68d4d3de20cf261d709ae9f6aef30","observation_id":"efb92402-e075-48d6-8dad-750b10bbf3f3","resolution":{"observed_at":"2026-05-25T05:45:23.526235Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2606.00133","last_updated":"2026-05-28T21:23:24Z","snapshot_observed_at":"2026-07-06T23:40:51.363776Z","submitted_at":"2026-05-28T21:23:24Z","title":"World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications","version":1},"reference_index":275,"source":"pdf_text","source_observed_at":"2026-06-29T08:36:23.776293Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2606.00133"},"observation_digest":"sha256:2eb32042870f6a80d192b4866f4a934d2887b46a1ed36a896036628a2b24d4c8","observation_id":"c0fa389b-a2db-4b08-84b2-460798eaa30d","resolution":{"observed_at":"2026-06-29T08:43:15.745971Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2606.03314","last_updated":"2026-06-02T08:25:53Z","snapshot_observed_at":"2026-08-02T05:52:01.949970Z","submitted_at":"2026-06-02T08:25:53Z","title":"TASE: Truncation-Aware Semantic Embeddings for 3D Scene Understanding and Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T10:19:39.120104Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2606.03314"},"observation_digest":"sha256:b07dba687659b50c0758a5637965cb5b61ac70a35cc6a06f982c567caf20f7a3","observation_id":"b22c48c3-17b1-4e22-950d-5d80f993366f","resolution":{"observed_at":"2026-07-02T03:06:30.059920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2606.16776","last_updated":"2026-06-28T12:48:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-15T14:21:35Z","title":"JoyAI-Sim: A Simulation-Enabled Interconversion Toolchain for the Embodied Data Pyramid","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T10:31:54.292897Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2606.16776"},"observation_digest":"sha256:55a24b192486c81a0eb47f581ecb3ee8ce40ddba14755d0093b7106c3de56070","observation_id":"264d94bf-b860-4798-82bf-ef815477d434","resolution":{"observed_at":"2026-06-30T10:34:36.277338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2606.17362","last_updated":"2026-06-15T23:39:36Z","snapshot_observed_at":"2026-08-01T07:45:46.804972Z","submitted_at":"2026-06-15T23:39:36Z","title":"DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T03:04:13.554098Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2606.17362"},"observation_digest":"sha256:6b2bda3bab98cdc41bd8e0f6c1dffa85aa0aa6e793e307f8e53cce79fcf8bbd3","observation_id":"5ed1139f-9600-4d64-8b52-90d39ef99734","resolution":{"observed_at":"2026-07-03T18:28:48.900716Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2606.20781","last_updated":"2026-06-18T17:05:19Z","snapshot_observed_at":"2026-08-03T05:46:19.564000Z","submitted_at":"2026-06-18T17:05:19Z","title":"World Action Models: A Survey","version":1},"reference_index":129,"source":"pdf_text","source_observed_at":"2026-06-26T17:11:12.686936Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2606.20781"},"observation_digest":"sha256:34f153225c05250c5c1384fe496175ee31d0f983a8bee31d6c495fcbee3585b3","observation_id":"fc251de0-052a-49f8-ad33-759b3d1cfd83","resolution":{"observed_at":"2026-07-04T04:09:35.037927Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2606.29020","last_updated":"2026-06-27T17:38:21Z","snapshot_observed_at":"2026-07-07T00:03:02.476882Z","submitted_at":"2026-06-27T17:38:21Z","title":"Semantic-Aware, Physics-Informed, Geometry-Grounded Weather Video Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T09:19:50.748415Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2606.29020"},"observation_digest":"sha256:6617d65a014a982264d779e4fd5025c18f7b13977681271ea7f02f2bef9de4fe","observation_id":"bb79cc3d-066d-403d-9d7c-fb93c367e906","resolution":{"observed_at":"2026-06-30T09:24:32.484310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2606.29095","last_updated":"2026-06-27T21:23:40Z","snapshot_observed_at":"2026-08-02T20:08:19.679369Z","submitted_at":"2026-06-27T21:23:40Z","title":"HorizonRelight: Relighting Long-horizon Videos Consistently via Diffusion Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T09:24:04.427234Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2606.29095"},"observation_digest":"sha256:a4915c115e5849189918a17c9a4882bee2b9cb41a2e41479fbdde6c4a235017e","observation_id":"998a84b1-3e48-42a4-b8a7-977d2f7f7f24","resolution":{"observed_at":"2026-06-30T09:24:32.107963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2606.30677","last_updated":"2026-06-26T09:45:56Z","snapshot_observed_at":"2026-07-07T00:04:29.879877Z","submitted_at":"2026-06-26T09:45:56Z","title":"DANTE-W: Diffuse Albedo Neural Texturing in the Wild","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-01T07:02:23.273554Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2606.30677"},"observation_digest":"sha256:15fc8ece026d5c3974516f00fbaf6cc1114968b36f53f7dbb30edc28a72215ab","observation_id":"cb3eaec8-6f38-4d73-9081-531eae02fd22","resolution":{"observed_at":"2026-07-01T07:05:28.523396Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-12T08:04:48.963890Z","title":"Cosmos-transfer1: Conditional world generation with adaptive multimodal control.arXiv preprint arXiv:2503.14492, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02642","last_updated":"2026-07-02T17:02:43Z","snapshot_observed_at":"2026-08-03T12:39:47.539491Z","submitted_at":"2026-07-02T17:02:43Z","title":"GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T08:04:48.963890Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2607.02642"},"observation_digest":"sha256:158a6049c232bf9f9e1e0406579ea3a91fa18bb78dbd35d6fbeff302e6c8f789","observation_id":"f7466bbb-15a8-4171-be02-cd866fe194bb","resolution":{"observed_at":"2026-07-12T08:04:48.963890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-11T22:42:31.529313Z","title":"Cosmos-transfer1: Conditional world generation with adaptive multimodal control.arXiv preprint arXiv:2503.14492, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03964","last_updated":"2026-07-04T17:45:38Z","snapshot_observed_at":"2026-08-03T09:38:13.465849Z","submitted_at":"2026-07-04T17:45:38Z","title":"Worldscape-MoE: A Unified Mixture-of-Experts World Model for Scalable Heterogeneous Action Control","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T22:42:31.529313Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2607.03964"},"observation_digest":"sha256:4779267288a19753d09ceb91aa22cff96971baae3db59b43c9b0fd3dac3fcd15","observation_id":"1452d2f7-5f44-4469-9bff-9ac11d4998d7","resolution":{"observed_at":"2026-07-11T22:42:31.529313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-08-02T03:16:51.693644Z","title":"Cosmos-transfer1: Conditional world generation with adaptive multimodal control.arXiv preprint arXiv:2503.14492, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13960","last_updated":"2026-07-17T13:39:37Z","snapshot_observed_at":"2026-08-03T18:30:12.569959Z","submitted_at":"2026-07-15T15:46:42Z","title":"GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:51.693644Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2607.13960"},"observation_digest":"sha256:13da65ddd9e060314419af9d3e08dbadf152ef9b8cd8f3ee26c28638c2631e67","observation_id":"babce225-27ae-4451-b350-a6b723bbe9cf","resolution":{"observed_at":"2026-08-02T03:16:51.693644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-08-01T22:44:38.587764Z","title":"Cosmos-transfer1: Conditional world generation with adaptive multimodal control,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15663","last_updated":"2026-07-17T06:15:01Z","snapshot_observed_at":"2026-08-03T09:49:16.019678Z","submitted_at":"2026-07-17T06:15:01Z","title":"Adaptive Model-Based Transfer Learning for Dynamic HVAC Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T22:44:38.587764Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2607.15663"},"observation_digest":"sha256:cb5711b59be793fdbf4cc43c846f1dee1fe782caa5933094ef92e4815d6920d1","observation_id":"c315cee6-6f04-4a6e-a37a-b747b6da00b7","resolution":{"observed_at":"2026-08-01T22:44:38.587764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-08-01T06:35:27.692918Z","title":"Cosmos-transfer1: Conditional world generation with adaptive multimodal control.arXiv preprint arXiv:2503.14492,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21848","last_updated":"2026-07-27T16:34:17Z","snapshot_observed_at":"2026-08-01T06:35:27.013428Z","submitted_at":"2026-07-23T22:33:52Z","title":"Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T06:35:27.692918Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2607.21848"},"observation_digest":"sha256:e53852512b0fb696b941bc62f6f7478d697fd9a1eb83de727670aede5d3076c6","observation_id":"a01029ff-4844-4745-b95b-7a609e529c82","resolution":{"observed_at":"2026-08-01T06:35:27.692918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-08-04T00:40:18.395572Z","title":"arXiv preprint arXiv:2503.14492 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00094","last_updated":"2026-07-30T16:55:28Z","snapshot_observed_at":"2026-08-04T16:37:40.664239Z","submitted_at":"2026-07-30T16:55:28Z","title":"Video Models as Native 4D Renderers: World-Grounded Conditioning from Animated Mesh","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T00:40:18.395572Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2608.00094"},"observation_digest":"sha256:7f4f2a223f91b42fb1adaf1df5ab93a13219112e3dcbdaab31f80d1a9dacff86","observation_id":"7fd41cc2-0ce4-428b-abf4-4df544bd91cf","resolution":{"observed_at":"2026-08-04T00:40:18.395572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.14492/citation-record","integrity":"/paper/2503.14492/integrity","json":"/paper/2503.14492/citation-record.json","paper":"/paper/2503.14492"},"outbound":[],"paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 38 inbound Pith citation observations for arXiv:2503.14492."}