{"as_of":"2026-08-21T03:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e2f6c4b560514b701031540389832596038f0e05190914ce935740594bbccbe","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T00:12:39.787489Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:12:54.494472Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T00:09:14.650014Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01099","snapshot_observed_at":"2026-08-04T09:12:54.494472Z","title":"Geometry-aware 4D video generation for robot manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.16732","last_updated":"2026-06-25T19:54:02Z","snapshot_observed_at":"2026-08-19T23:45:04.716820Z","submitted_at":"2025-10-19T07:12:32Z","title":"A Comprehensive Survey on World Models for Embodied AI","version":3},"reference_index":215,"source":"pdf_text","source_observed_at":"2026-08-04T09:12:54.494472Z"},"links":{"cited_paper":"/paper/2507.01099","citing_paper":"/paper/2510.16732"},"observation_digest":"sha256:56b43ab67eaa500e2260b9764cc0213f7feedd9fa6fa68b5a5bc52666dbef893","observation_id":"b1bcbaed-01d8-48b0-a5ca-1eb891ba66f7","resolution":{"observed_at":"2026-08-04T09:12:54.494472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"cited_work":{"arxiv_id":"2507.01099","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01099","snapshot_observed_at":"2026-07-04T00:09:14.650014Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","venue":"cs.CV","work_id":"f55e8d8f-f6cf-4bd2-be05-2eb5449645bb","year":2025},"citing_paper":{"arxiv_id":"2512.16811","last_updated":"2026-04-07T13:11:17Z","snapshot_observed_at":"2026-07-06T22:39:28.855621Z","submitted_at":"2025-12-18T17:51:42Z","title":"GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T21:26:59.341715Z"},"links":{"cited_paper":"/paper/2507.01099","citing_paper":"/paper/2512.16811"},"observation_digest":"sha256:588da0c6899f12d79100ef0e2bf374580f0e1bf9ec1965bbcfb0bb14eaed0ac7","observation_id":"f2f0c198-bbbb-458d-a84f-fd548184518b","resolution":{"observed_at":"2026-05-20T00:04:11.530715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01099","snapshot_observed_at":"2026-08-03T02:45:07.583622Z","title":"Geometry-aware 4d video generation for robot manipulation.arXiv preprint arXiv:2507.01099,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09878","last_updated":"2026-05-26T17:06:15Z","snapshot_observed_at":"2026-08-16T10:59:13.335731Z","submitted_at":"2026-02-10T15:19:17Z","title":"MVISTA-4D: View-Consistent 4D World Model with Test-Time Action Inference for Robotic Manipulation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T02:45:07.583622Z"},"links":{"cited_paper":"/paper/2507.01099","citing_paper":"/paper/2602.09878"},"observation_digest":"sha256:432fca0dd4c8d978bba2c6e89a5310ca911e34463d6ff57a6f4e8034b28e3851","observation_id":"ac8960f6-1069-456d-8fc3-34b85e1fe6e2","resolution":{"observed_at":"2026-08-03T02:45:07.583622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"cited_work":{"arxiv_id":"2507.01099","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01099","snapshot_observed_at":"2026-07-04T00:09:14.650014Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","venue":"cs.CV","work_id":"f55e8d8f-f6cf-4bd2-be05-2eb5449645bb","year":2025},"citing_paper":{"arxiv_id":"2604.06168","last_updated":"2026-04-15T01:21:52Z","snapshot_observed_at":"2026-08-11T00:13:32.050236Z","submitted_at":"2026-04-07T17:59:30Z","title":"Action Images: End-to-End Policy Learning via Multiview Video Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:05.206602Z"},"links":{"cited_paper":"/paper/2507.01099","citing_paper":"/paper/2604.06168"},"observation_digest":"sha256:0033c0dbbacbcb433e8528a61c696c8d7353dc3bd7ad292bcb0f0c58ac52988e","observation_id":"22fae36d-ade7-4181-bdcd-5b18bbc08358","resolution":{"observed_at":"2026-05-20T00:04:11.530715Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"cited_work":{"arxiv_id":"2507.01099","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01099","snapshot_observed_at":"2026-07-04T00:09:14.650014Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","venue":"cs.CV","work_id":"f55e8d8f-f6cf-4bd2-be05-2eb5449645bb","year":2025},"citing_paper":{"arxiv_id":"2604.15569","last_updated":"2026-04-16T22:55:39Z","snapshot_observed_at":"2026-08-13T14:31:44.188727Z","submitted_at":"2026-04-16T22:55:39Z","title":"ShapeGen: Robotic Data Generation for Category-Level Manipulation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T10:17:05.939312Z"},"links":{"cited_paper":"/paper/2507.01099","citing_paper":"/paper/2604.15569"},"observation_digest":"sha256:a4b4e900ec85c107f4d6c824e6bfd9fcbd919c3397e5ad5827c627fe97fb5256","observation_id":"2866a64b-9007-4a49-84aa-ce01f84f878d","resolution":{"observed_at":"2026-05-20T00:04:11.530715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"cited_work":{"arxiv_id":"2507.01099","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01099","snapshot_observed_at":"2026-07-04T00:09:14.650014Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","venue":"cs.CV","work_id":"f55e8d8f-f6cf-4bd2-be05-2eb5449645bb","year":2025},"citing_paper":{"arxiv_id":"2604.21914","last_updated":"2026-04-23T17:57:13Z","snapshot_observed_at":"2026-08-13T08:34:04.703373Z","submitted_at":"2026-04-23T17:57:13Z","title":"VistaBot: View-Robust Robot Manipulation via Spatiotemporal-Aware View Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-09T21:18:12.192842Z"},"links":{"cited_paper":"/paper/2507.01099","citing_paper":"/paper/2604.21914"},"observation_digest":"sha256:b96b364ee25373db39b8862902e209e1a55ad4b64e3e039fc8223e4c1f443ab9","observation_id":"b05f868a-cf9b-4dfe-86dc-4b04d68ea36c","resolution":{"observed_at":"2026-05-20T00:04:11.530715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"cited_work":{"arxiv_id":"2507.01099","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01099","snapshot_observed_at":"2026-07-04T00:09:14.650014Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","venue":"cs.CV","work_id":"f55e8d8f-f6cf-4bd2-be05-2eb5449645bb","year":2025},"citing_paper":{"arxiv_id":"2604.26694","last_updated":"2026-05-07T11:23:39Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T14:01:54Z","title":"Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-07T10:40:04.767657Z"},"links":{"cited_paper":"/paper/2507.01099","citing_paper":"/paper/2604.26694"},"observation_digest":"sha256:f4aeaa4c4d5def67c3017113b4e44978f11b32627473b9bf7235d8b59465d303","observation_id":"331752ca-14b8-45dd-8dcc-6ecb1985b2b9","resolution":{"observed_at":"2026-05-20T00:04:11.530715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"cited_work":{"arxiv_id":"2507.01099","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01099","snapshot_observed_at":"2026-07-04T00:09:14.650014Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","venue":"cs.CV","work_id":"f55e8d8f-f6cf-4bd2-be05-2eb5449645bb","year":2025},"citing_paper":{"arxiv_id":"2604.26694","last_updated":"2026-05-07T11:23:39Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T14:01:54Z","title":"Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-08T03:20:04.435904Z"},"links":{"cited_paper":"/paper/2507.01099","citing_paper":"/paper/2604.26694"},"observation_digest":"sha256:396008d51ca98d5446dd0de59a56ee97d1570392c1af1e1a101d668432ee4f55","observation_id":"b47d4d92-06bb-4240-ba0f-f4d6efb0d4b9","resolution":{"observed_at":"2026-05-20T00:04:11.530715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"cited_work":{"arxiv_id":"2507.01099","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01099","snapshot_observed_at":"2026-07-04T00:09:14.650014Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","venue":"cs.CV","work_id":"f55e8d8f-f6cf-4bd2-be05-2eb5449645bb","year":2025},"citing_paper":{"arxiv_id":"2605.22272","last_updated":"2026-05-22T04:19:09Z","snapshot_observed_at":"2026-08-17T04:45:55.074409Z","submitted_at":"2026-05-21T10:15:39Z","title":"Imagine2Real: Towards Zero-shot Humanoid-Object Interaction via Video Generative Priors","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-22T06:02:40.043871Z"},"links":{"cited_paper":"/paper/2507.01099","citing_paper":"/paper/2605.22272"},"observation_digest":"sha256:c07d4c493626f7afe09b02ae0a373ad1dd13b349644acc00a6a61d4a3309a307","observation_id":"6950829d-e897-478c-86c8-51e8e5981ff8","resolution":{"observed_at":"2026-05-22T06:04:39.509788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"cited_work":{"arxiv_id":"2507.01099","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01099","snapshot_observed_at":"2026-07-04T00:09:14.650014Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","venue":"cs.CV","work_id":"f55e8d8f-f6cf-4bd2-be05-2eb5449645bb","year":2025},"citing_paper":{"arxiv_id":"2605.22272","last_updated":"2026-05-22T04:19:09Z","snapshot_observed_at":"2026-08-17T04:45:55.074409Z","submitted_at":"2026-05-21T10:15:39Z","title":"Imagine2Real: Towards Zero-shot Humanoid-Object Interaction via Video Generative Priors","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-25T05:59:52.760486Z"},"links":{"cited_paper":"/paper/2507.01099","citing_paper":"/paper/2605.22272"},"observation_digest":"sha256:f8eb0d48f4a639703edec39b8bd61117d606db3ba10ae437196d487e25cb1847","observation_id":"c24504df-a69e-40e4-9332-b841e18998bc","resolution":{"observed_at":"2026-05-25T06:00:23.174342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"cited_work":{"arxiv_id":"2507.01099","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01099","snapshot_observed_at":"2026-07-04T00:09:14.650014Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","venue":"cs.CV","work_id":"f55e8d8f-f6cf-4bd2-be05-2eb5449645bb","year":2025},"citing_paper":{"arxiv_id":"2605.22882","last_updated":"2026-08-03T23:32:29Z","snapshot_observed_at":"2026-08-19T08:35:01.048645Z","submitted_at":"2026-05-20T21:36:44Z","title":"GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-25T05:34:03.684055Z"},"links":{"cited_paper":"/paper/2507.01099","citing_paper":"/paper/2605.22882"},"observation_digest":"sha256:ffecae91bc85af29063827965b9e330a4d274c3cfd486371872fe5d83831c552","observation_id":"3b3c036d-6d5a-4cf5-b745-3560ba3cbfef","resolution":{"observed_at":"2026-05-25T05:36:39.742035Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"cited_work":{"arxiv_id":"2507.01099","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01099","snapshot_observed_at":"2026-07-04T00:09:14.650014Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","venue":"cs.CV","work_id":"f55e8d8f-f6cf-4bd2-be05-2eb5449645bb","year":2025},"citing_paper":{"arxiv_id":"2605.22882","last_updated":"2026-08-03T23:32:29Z","snapshot_observed_at":"2026-08-19T08:35:01.048645Z","submitted_at":"2026-05-20T21:36:44Z","title":"GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T16:45:15.955954Z"},"links":{"cited_paper":"/paper/2507.01099","citing_paper":"/paper/2605.22882"},"observation_digest":"sha256:5358259f3ae8476ad4c54356d2fcf8a3a0c269825a8c30f894f37b3bea7ca524","observation_id":"a4f0a876-4357-4e8f-ab1d-955b9f91d0aa","resolution":{"observed_at":"2026-06-30T16:54:59.342170Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"cited_work":{"arxiv_id":"2507.01099","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01099","snapshot_observed_at":"2026-07-04T00:09:14.650014Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","venue":"cs.CV","work_id":"f55e8d8f-f6cf-4bd2-be05-2eb5449645bb","year":2025},"citing_paper":{"arxiv_id":"2605.30060","last_updated":"2026-07-16T15:48:01Z","snapshot_observed_at":"2026-08-18T00:18:49.501741Z","submitted_at":"2026-05-28T15:11:17Z","title":"Towards Consistent Video Geometry Estimation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T08:03:13.579650Z"},"links":{"cited_paper":"/paper/2507.01099","citing_paper":"/paper/2605.30060"},"observation_digest":"sha256:6080db46d6c5f76a1e3e7a291212e50af4699b82ae519b6227ad9600913897f7","observation_id":"e8548b04-6d39-42a5-8651-85b6531a5d1c","resolution":{"observed_at":"2026-06-29T08:13:16.062309Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01099","snapshot_observed_at":"2026-08-02T12:54:16.470127Z","title":"Geometry-aware 4d video generation for robot manipulation.arXiv preprint arXiv:2507.01099, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30060","last_updated":"2026-07-16T15:48:01Z","snapshot_observed_at":"2026-08-18T00:18:49.501741Z","submitted_at":"2026-05-28T15:11:17Z","title":"Towards Consistent Video Geometry Estimation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T12:54:16.470127Z"},"links":{"cited_paper":"/paper/2507.01099","citing_paper":"/paper/2605.30060"},"observation_digest":"sha256:6e5003b48e6ae56db870312def621c7b384c3c2f75132d06571df106e4074c60","observation_id":"a4405053-c274-4b8d-aba6-38826adb8cf3","resolution":{"observed_at":"2026-08-02T12:54:16.470127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"cited_work":{"arxiv_id":"2507.01099","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01099","snapshot_observed_at":"2026-07-04T00:09:14.650014Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","venue":"cs.CV","work_id":"f55e8d8f-f6cf-4bd2-be05-2eb5449645bb","year":2025},"citing_paper":{"arxiv_id":"2606.09187","last_updated":"2026-06-08T08:23:12Z","snapshot_observed_at":"2026-08-12T15:44:08.400536Z","submitted_at":"2026-06-08T08:23:12Z","title":"CP4D: Compositional Physics-aware 4D Scene Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T16:52:36.288955Z"},"links":{"cited_paper":"/paper/2507.01099","citing_paper":"/paper/2606.09187"},"observation_digest":"sha256:cdee6c3397f27ae8042af69521e16f6426f4e337da4af939433fe63e8bab1918","observation_id":"f7cb2cd3-0b22-4871-83e8-23bd9c7614f0","resolution":{"observed_at":"2026-07-03T00:57:30.503918Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"cited_work":{"arxiv_id":"2507.01099","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01099","snapshot_observed_at":"2026-07-04T00:09:14.650014Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","venue":"cs.CV","work_id":"f55e8d8f-f6cf-4bd2-be05-2eb5449645bb","year":2025},"citing_paper":{"arxiv_id":"2606.18558","last_updated":"2026-06-17T00:19:00Z","snapshot_observed_at":"2026-08-12T09:20:26.643022Z","submitted_at":"2026-06-17T00:19:00Z","title":"MolmoMotion: Forecasting Point Trajectories in 3D with Language Instruction","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T21:27:47.702578Z"},"links":{"cited_paper":"/paper/2507.01099","citing_paper":"/paper/2606.18558"},"observation_digest":"sha256:e3b1b68d6a11d2bfd4f69051465ecb83de6c107a0e3e394ad3b8a7198aa0abeb","observation_id":"3596d35f-8fe9-4e4e-8237-197fb3c10558","resolution":{"observed_at":"2026-07-04T00:09:14.651825Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.01099/citation-record","integrity":"/paper/2507.01099/integrity","json":"/paper/2507.01099/citation-record.json","paper":"/paper/2507.01099"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-17T06:54:13.493934Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":"2104.10157","doi":"10.48550/arxiv.2104.10157","metadata_source":"pith","pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","venue":"cs.CV","work_id":"703c74c3-fa5e-455c-8c00-697c83511fcf","year":2021},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:42ecd8a698af13449267318da09e0d52b76b66d6a20d00c59a3ff5b743aca75d","observation_id":"53cffb0b-c61b-41c4-bf6d-3fea8a147ec5","resolution":{"observed_at":"2026-05-22T00:14:27.919148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video diffusion models","venue":null,"work_id":"3c7ac136-ec07-4f9b-9815-d43869ccb90c","year":2022},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:a83bb2e80aee0cb1387d3e35e0ab3f1a238c5bd324fe36c9b0da08be8f0d459d","observation_id":"ac4bf494-836a-4ec4-b010-8df19bdb0a11","resolution":{"observed_at":"2026-05-22T00:14:29.050856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17470","last_updated":"2025-02-27T21:52:39Z","snapshot_observed_at":"2026-08-18T18:18:22.721632Z","submitted_at":"2024-07-24T17:59:43Z","title":"SV4D: Dynamic 3D Content Generation with Multi-Frame and Multi-View Consistency","version":2},"cited_work":{"arxiv_id":"2407.17470","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.17470","snapshot_observed_at":"2026-07-07T14:03:48.614659Z","title":"Sv4d: Dynamic 3d content generation with multi-frame and multi-view consistency","venue":"cs.CV","work_id":"222bc271-404d-4612-a299-23de538a73eb","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2407.17470","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:e665c64f0615b8e5eb49bcdf7da499ff05a13201c3697cdc2ec76ae98ad1129d","observation_id":"282ec790-7e75-4ae9-962a-ccb6ed8741b3","resolution":{"observed_at":"2026-05-22T00:14:27.784521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vivid-zoo: Multi-view video generation with diffusion model","venue":null,"work_id":"84c571c6-d5c9-452a-8197-93c110c02b12","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:298a45b7282e67254866c7f17bea230bc373357adc50e18260970985d5ab8f2c","observation_id":"776ac925-ee96-4cde-88f6-cb58b823bccb","resolution":{"observed_at":"2026-05-22T00:14:29.046757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"4diffusion: Multi-view video diffusion model for 4d generation.Advances in Neural Information Processing Systems, 37:15272–15295","venue":null,"work_id":"0e1a6de4-63e8-4b6c-a3b0-7106ea95d85f","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:7494dc28a46dfed3bf3dd497706fe8b62d3354a2029c43e82f1aa16af3157bf3","observation_id":"7924ca27-2e5d-4eda-a1d0-13c6b686de57","resolution":{"observed_at":"2026-05-22T00:14:29.043148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dust3r: Geometric 3d vision made easy","venue":null,"work_id":"1d6a55ec-88d5-4220-bd5f-e08d960e7c58","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:7346b494046bace32875ed819aa3c25aa2da8ec1f89e6c8c3d16ff50ed262b9e","observation_id":"a9aa21b8-949f-4bed-ae0c-1bfb8d9e4dc6","resolution":{"observed_at":"2026-05-22T00:14:29.038181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Foundationpose: Unified 6d pose estimation and tracking of novel objects","venue":null,"work_id":"a60dd8e3-0dde-4945-83a7-c80aad598685","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:5900ac643972522632ef8b9ad039e84992d85de678494ae17ef1557da0b6dbff","observation_id":"42c0b8b2-8c5b-4519-84f9-4f843365a309","resolution":{"observed_at":"2026-05-22T00:14:29.034300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsupervised learning of video representations using lstms","venue":null,"work_id":"150b6e71-857f-4113-a29c-6e6d5c86d283","year":2015},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:5b3eb405bdcff25c1990a6ea5dc682d08f44b549d6faf7571eccc2dfb4caa75b","observation_id":"8b98f810-1122-4878-954f-ce81858b3223","resolution":{"observed_at":"2026-05-22T00:14:29.030736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.02254","last_updated":"2017-04-19T15:43:32Z","snapshot_observed_at":"2026-08-18T22:04:17.968502Z","submitted_at":"2017-04-07T14:53:54Z","title":"Recurrent Environment Simulators","version":2},"cited_work":{"arxiv_id":"1704.02254","doi":null,"metadata_source":"pith","pith_arxiv_id":"1704.02254","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recurrent Environment Simulators","venue":"cs.AI","work_id":"7e6065f9-c055-4d8e-8803-b0c214603687","year":2017},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/1704.02254","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:976a6d9035deed4539c484fd985f9a5014030c108c2c82456caa692c6bc17f1c","observation_id":"86333821-dce2-480c-a4fa-1dc5b76dead8","resolution":{"observed_at":"2026-05-22T00:14:27.871276Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating videos with scene dynamics","venue":null,"work_id":"36f3bbeb-d0c4-4fe1-86c8-3023b58359f4","year":2016},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:0561658b0f2ef95edb3b89c2e5a48ffd67c482a73ee4f9c793347da32280edf6","observation_id":"abcd5f32-e313-4b8f-a048-ef27d102450c","resolution":{"observed_at":"2026-05-22T00:14:29.026536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-20T09:39:07.545813Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:4b2eee66a395b5a498ae77efe42b226f5845eb10afb017031d3c7d78cba8c0b0","observation_id":"35c5d183-c00f-4c58-b0db-5aacd25b020d","resolution":{"observed_at":"2026-05-22T00:14:27.846421Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20280","last_updated":"2024-10-26T21:12:32Z","snapshot_observed_at":"2026-08-16T13:05:43.137904Z","submitted_at":"2024-10-26T21:12:32Z","title":"MarDini: Masked Autoregressive Diffusion for Video Generation at Scale","version":1},"cited_work":{"arxiv_id":"2410.20280","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20280","snapshot_observed_at":"2026-07-01T19:16:00.498245Z","title":"Mardini: Masked autoregressive diffusion for video generation at scale","venue":null,"work_id":"c55eb05e-1cd3-4b08-8542-48c1765a085c","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2410.20280","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:6417d2163412139aeb51b4b1f716b5df0c7fbf16e534b3e0ee8ccede1e1eb5db","observation_id":"f92cfa37-e3ce-47c6-8180-4db4227a202c","resolution":{"observed_at":"2026-05-22T00:14:27.886735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-08-20T23:16:18.586164Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":"2412.20404","doi":"10.48550/arxiv.2412.20404","metadata_source":"pith","pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open-Sora: Democratizing Efficient Video Production for All","venue":"cs.CV","work_id":"8b29ba7b-3d84-4281-85b7-9eaf905afd7f","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:a924c9c1c6099e843587010292ce01eec59e1f9262bf2f77d9f2345ebbb67eeb","observation_id":"3ce58965-c534-4215-9a5e-2878ca5fe0b0","resolution":{"observed_at":"2026-05-22T00:14:27.888618Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:6a3babd3c9926ab9157e2fe44e196333309bca65d53d58ad430007bf8f1b04ad","observation_id":"bd79ae07-3fff-4f44-a3eb-f18531803e8d","resolution":{"observed_at":"2026-05-22T00:14:27.875634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14816","last_updated":"2023-02-28T18:08:21Z","snapshot_observed_at":"2026-08-16T15:51:59.080096Z","submitted_at":"2023-02-28T18:08:21Z","title":"Monocular Depth Estimation using Diffusion Models","version":1},"cited_work":{"arxiv_id":"2302.14816","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.14816","snapshot_observed_at":"2026-06-30T06:24:19.408294Z","title":"Monocular depth estimation using diffusion models","venue":null,"work_id":"9c660250-05d5-485a-9c26-94371fcb3875","year":2023},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2302.14816","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:3efa7f5ef0e4d495780b3575e8b3088f2709e20d6ad38c0283c793f89cb2a5a0","observation_id":"6f16495f-6ce2-47db-9004-608a320039f3","resolution":{"observed_at":"2026-05-22T00:14:27.907942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02095","last_updated":"2024-11-27T07:59:25Z","snapshot_observed_at":"2026-08-16T18:10:25.611057Z","submitted_at":"2024-09-03T17:52:03Z","title":"DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos","version":2},"cited_work":{"arxiv_id":"2409.02095","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02095","snapshot_observed_at":"2026-07-10T01:46:41.351531Z","title":"Depthcrafter: Generating consistent long depth sequences for open-world videos","venue":"cs.CV","work_id":"b80b942c-6eaa-47a0-81b4-eda8f9dbb2b5","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2409.02095","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:d8a1a218afbba77a29a5860eff00342aa8da22bfe53b477706e93e87a77a0159","observation_id":"5ab287ad-9094-4f9e-b2d4-e73163baea35","resolution":{"observed_at":"2026-05-22T00:14:27.814877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01493","last_updated":"2025-06-07T07:24:16Z","snapshot_observed_at":"2026-08-18T20:57:59.739948Z","submitted_at":"2024-06-03T16:20:24Z","title":"Learning Temporally Consistent Video Depth from Video Diffusion Priors","version":4},"cited_work":{"arxiv_id":"2406.01493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01493","snapshot_observed_at":"2026-07-04T12:59:53.009791Z","title":"Learning temporally consistent video depth from video diffusion priors","venue":null,"work_id":"81b3e193-2914-4ebc-8ced-237b61c18a7e","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2406.01493","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:d20500c56ebea8a16972c6d14a53402c77961cb5629b32ec2fd3e8efe96bce9a","observation_id":"98fde7d7-a816-4244-9ba4-206e26a065fd","resolution":{"observed_at":"2026-05-22T00:14:27.927985Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.02913","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pointmap-conditioned diffusion for consistent novel view synthesis","venue":null,"work_id":"f42aa522-f2c3-4ce0-b1ab-bfe76db7b060","year":2025},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:6c4c0b5ccf1568d098e64026a781795065e2211ed93e0591789e563fa753c116","observation_id":"c2a5b748-0b16-4153-994a-21507831e5ac","resolution":{"observed_at":"2026-05-22T00:14:27.852285Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative camera dolly: Extreme monocular dynamic novel view synthesis","venue":null,"work_id":"e1bd9ba4-8a15-4ae8-b934-70f901244232","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:a4e56bbc0e6fbb7bd98faeb139d75daa2b989a7c2e804b65704f3d403e09557b","observation_id":"33371518-6719-403e-a43f-bf30293ff11f","resolution":{"observed_at":"2026-05-22T00:14:29.022981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-08-16T17:39:09.604516Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2404.02101","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-07-10T01:46:41.167891Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","venue":"cs.CV","work_id":"1c05c278-c023-4ef0-a359-25a41f1065eb","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:f5186ea867c0a1673670bd043304a9171f338e28b5c3e617a711544d1ec9304e","observation_id":"35b11df5-3c89-4303-8cde-943849bb4d36","resolution":{"observed_at":"2026-05-22T00:14:27.947604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Collaborative video diffusion: Consistent multi-video generation with camera control","venue":null,"work_id":"a9bcbdb7-3bb9-41a1-b45b-0c6f10baf745","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:33c1f194398ffec34e2bbc8ac52f620c132768b43275b4f6784d2275a751cacc","observation_id":"20b4a955-a76d-4ecf-b51a-de8ead676bf0","resolution":{"observed_at":"2026-05-22T00:14:29.019764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10802","last_updated":"2024-10-14T17:58:07Z","snapshot_observed_at":"2026-08-18T12:56:43.699225Z","submitted_at":"2024-10-14T17:58:07Z","title":"Boosting Camera Motion Control for Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2410.10802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10802","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Boosting camera motion control for video diffusion transformers","venue":null,"work_id":"3ed9c15a-874d-4e24-bbcb-1139d2fd0ecc","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2410.10802","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:1e9221c109d9a6c6ee0b97d4647f9984399fc67e7ecfc96ab27fdf810ae410e1","observation_id":"58a7ca4c-0757-46c3-baff-bb2e48051243","resolution":{"observed_at":"2026-05-22T00:14:27.882162Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18132","last_updated":"2024-05-28T12:47:22Z","snapshot_observed_at":"2026-08-16T13:48:38.738710Z","submitted_at":"2024-05-28T12:47:22Z","title":"EG4D: Explicit Generation of 4D Object without Score Distillation","version":1},"cited_work":{"arxiv_id":"2405.18132","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.18132","snapshot_observed_at":"2026-07-02T08:06:48.045719Z","title":"Eg4d: Explicit generation of 4d object without score distillation","venue":null,"work_id":"fb66e13f-1ec5-4647-b8f2-bce25f914f9e","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2405.18132","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:ae52f558951c6c29bc0254d01bc2093c50b2466307095b270ce993f9ff243776","observation_id":"6c089247-936e-4758-88a3-7d551b34f1ee","resolution":{"observed_at":"2026-05-22T00:14:27.923404Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16822","last_updated":"2024-05-27T04:43:44Z","snapshot_observed_at":"2026-08-16T13:49:12.877826Z","submitted_at":"2024-05-27T04:43:44Z","title":"Vidu4D: Single Generated Video to High-Fidelity 4D Reconstruction with Dynamic Gaussian Surfels","version":1},"cited_work":{"arxiv_id":"2405.16822","doi":"10.48550/arxiv.2405.16822","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16822","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vidu4d: Single generated video to high-fidelity 4d reconstruction with dynamic gaussian surfels","venue":"arXiv (Cornell University)","work_id":"0487d20e-4762-4cea-b835-d6d90cdfc8e1","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2405.16822","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:a8ee9a36f17d0992c7897a056858e8cb0f3b9a5fa101dac1cf86778e8176674f","observation_id":"482f4f86-5beb-4bfd-9536-a1172a48a60d","resolution":{"observed_at":"2026-05-22T00:14:27.831284Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02148","last_updated":"2024-10-02T14:07:04Z","snapshot_observed_at":"2026-08-16T14:04:13.088918Z","submitted_at":"2024-04-02T17:58:03Z","title":"Diffusion$^2$: Dynamic 3D Content Generation via Score Composition of Video and Multi-view Diffusion Models","version":4},"cited_work":{"arxiv_id":"2404.02148","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02148","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion 2: Dynamic 3d content generation via score composition of video and multi-view diffusion models","venue":null,"work_id":"04aebbf7-4dc2-460f-b004-88f973025012","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2404.02148","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:f77759a4a1cbc3b59b4583cb1ce172eae14951f2d4c0966ddec91835a9836475","observation_id":"485c2479-39b6-452b-85e4-fb7e43431184","resolution":{"observed_at":"2026-05-22T00:14:27.932836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning universal policies via text-guided video generation","venue":null,"work_id":"41dc0158-e813-4cb9-9e88-54f9f59a745b","year":2023},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:b96b6c2992a2b741fbcb6d9419672ce5c75eecf401f1f51288bac74728b7ecbc","observation_id":"f7188171-1d57-41f8-a4b6-204ea149d6e7","resolution":{"observed_at":"2026-05-22T00:14:29.016551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15109","last_updated":"2024-12-19T17:52:50Z","snapshot_observed_at":"2026-08-18T07:25:34.849820Z","submitted_at":"2024-12-19T17:52:50Z","title":"Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2412.15109","doi":"10.48550/arxiv.2412.15109","metadata_source":"pith","pith_arxiv_id":"2412.15109","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation","venue":"cs.RO","work_id":"50911eef-b866-4e23-b501-1b4c4bfd1a78","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2412.15109","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:0c0aa6fb822aaed62fc144580b8ccb7babf01ca05528b4bf25ad46de0ffd2f84","observation_id":"55ecb31a-45c2-4e5d-93c9-27233adf3d82","resolution":{"observed_at":"2026-05-22T14:38:25.165602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20995","last_updated":"2025-04-29T17:59:30Z","snapshot_observed_at":"2026-08-19T20:36:18.684533Z","submitted_at":"2025-04-29T17:59:30Z","title":"TesserAct: Learning 4D Embodied World Models","version":1},"cited_work":{"arxiv_id":"2504.20995","doi":"10.48550/arxiv.2504.20995","metadata_source":"pith","pith_arxiv_id":"2504.20995","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2504.20995 (2025)","venue":"cs.CV","work_id":"3a971c23-d9fe-4291-9743-6a2b015ce29b","year":2025},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2504.20995","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:b226b0b314b9fe9beab62bd0c0c087ee5aac69916742600c83d1ab964f37cf76","observation_id":"8ff1a0d8-8c02-4d00-8320-c8fcdca8e743","resolution":{"observed_at":"2026-05-22T00:14:27.897807Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15208","last_updated":"2024-10-04T04:05:27Z","snapshot_observed_at":"2026-08-16T13:32:21.178898Z","submitted_at":"2024-07-21T16:15:02Z","title":"Flow as the Cross-Domain Manipulation Interface","version":2},"cited_work":{"arxiv_id":"2407.15208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.15208","snapshot_observed_at":"2026-07-10T18:47:31.575403Z","title":"Flow as the cross-domain manipulation interface","venue":"cs.RO","work_id":"40196361-5c47-4912-87a6-0e600288d197","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2407.15208","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:8ee1e9a820809bc12eaa4c2ab20eec87c43fb359e7d8db26250de695657e48ed","observation_id":"8829f7e2-2a08-4528-89f5-c414f9aa0190","resolution":{"observed_at":"2026-05-22T00:14:27.867242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-08-15T00:36:59.684390Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:9e44af13ae9312a101277a32bd4d92baa75b95dfb8af7dc40e6975e801c05c51","observation_id":"68102722-7369-4727-9a9b-da6f7232ef04","resolution":{"observed_at":"2026-05-22T00:14:27.918399Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.01895","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:16:48.600688Z","title":"Enerverse: Envisioning embodied future space for robotics manipulation","venue":null,"work_id":"4edb56a7-cf30-48b4-b9dc-572548ad8cac","year":2025},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:49640a3dcc6b0f642c2092a40fa6ecd6ca8559507994c2bb6c1362041267cf18","observation_id":"766cab2a-1d52-4710-b0c0-08c656489fc2","resolution":{"observed_at":"2026-05-22T00:14:27.913920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":"2406.16862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-07-08T02:04:26.253123Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":"cs.RO","work_id":"45d8eed6-8b6f-40b3-99c2-eb10a736919a","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:c0a10807f4b07f74329ca76b78bfffd0f696ef635e84d2a3296fce5603ec6754","observation_id":"f79772b2-0054-4973-82f3-263257369076","resolution":{"observed_at":"2026-05-22T00:14:27.884033Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02792","last_updated":"2025-05-23T00:47:24Z","snapshot_observed_at":"2026-08-10T02:54:28.264405Z","submitted_at":"2025-04-03T17:38:59Z","title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","version":3},"cited_work":{"arxiv_id":"2504.02792","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.02792","snapshot_observed_at":"2026-07-10T18:47:31.709153Z","title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","venue":"cs.RO","work_id":"c181dcf1-e774-4216-a30e-e55c3f3a766c","year":2025},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2504.02792","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:2e7d19d9436f0bf6c1a2cff392d1dff000f97499734cacf3e43621a1bc670ac6","observation_id":"a7b8eae1-d4d4-48ba-91e4-9d491e308384","resolution":{"observed_at":"2026-05-22T00:14:27.909928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00200","last_updated":"2025-04-24T20:02:43Z","snapshot_observed_at":"2026-08-14T06:14:38.487820Z","submitted_at":"2025-02-28T21:38:17Z","title":"Unified Video Action Model","version":3},"cited_work":{"arxiv_id":"2503.00200","doi":"10.48550/arxiv.2503.00200","metadata_source":"pith","pith_arxiv_id":"2503.00200","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified Video Action Model","venue":"cs.RO","work_id":"fb4cc512-d1d9-40f4-8854-d35950ad20b3","year":2025},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2503.00200","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:bfd870288b0ab5bb87253968ecb87313df3886ecace6ce78fe86c9c9d756ad06","observation_id":"db5616ea-89d5-4be6-83c7-dd1edfafe0d5","resolution":{"observed_at":"2026-05-22T00:14:27.819690Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Auto-encoding variational bayes","venue":null,"work_id":"8290a11f-68db-4e38-8e9a-adae1a97e9ba","year":2013},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:fb58ba9d3a5ac4794db4acf3878d2da8ce640a9e7f4be4b307ad5828eda52d1c","observation_id":"de99005a-2dcc-4422-b314-9753c4d54569","resolution":{"observed_at":"2026-05-22T00:14:29.013736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"9cd5caf3-2284-435a-97e6-b59d17f0a6a7","year":2020},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:c72b7d588043620cd43418f5ae25781ca4f008630bbf00ef97f40a82a8bc4410","observation_id":"27866a51-beda-455b-80d3-4fa29af03b59","resolution":{"observed_at":"2026-05-22T00:14:29.010697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:d77560b88b4d90d5593097b2c0671b3f1f77eda67aa28307a428e931780df905","observation_id":"a98b81f6-f58d-445b-b56e-5e2cff3fc537","resolution":{"observed_at":"2026-05-22T00:14:27.850803Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lbm eval: Drake-based lbm simulation evaluation suite","venue":null,"work_id":"186abe21-1792-4f62-a0e2-fce6eb14f6da","year":2025},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:cdc876167c34868b627f9f9765b885345aada96a0090bd776913eb20f0414953","observation_id":"a4b54c6b-2f2f-4f91-a7bd-7e9fb69698d5","resolution":{"observed_at":"2026-05-22T00:14:29.007134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Drake: Model-based design and verification for robotics","venue":null,"work_id":"f6a184a8-f484-46a3-8492-5ed3a8aacdb1","year":2019},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:48b5797837ad8b5da19a9da650f7340d1127684d1604da98d5f2fb72dc1b713c","observation_id":"2af2c1d4-520e-4eb6-8271-4d5193ea2ff3","resolution":{"observed_at":"2026-05-22T00:14:29.003952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.13764","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T10:58:02.632025Z","title":"Shape of motion: 4d reconstruc- tion from a single video","venue":null,"work_id":"2f2b7286-8215-48a7-809a-cc9543de6e28","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:df838263446e9dfe252485fe97a2caef020c0bf97a650d39ac26707e807d13e0","observation_id":"c9db65d3-bd9a-4b2d-b122-1571bd43e7c2","resolution":{"observed_at":"2026-05-22T00:14:27.836845Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-18T04:00:09.136122Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":"1812.01717","doi":"10.48550/arxiv.1812.01717","metadata_source":"pith","pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","venue":"cs.CV","work_id":"72f42543-17d5-49aa-ba5a-25d67ffbb88a","year":2018},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:383d8db16247c0040f002a07a5f3201807444687a04c29fe53dc57118d879b42","observation_id":"924c111e-e842-4932-be53-cf421368a57a","resolution":{"observed_at":"2026-05-22T00:14:27.923660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"bbe9ea91-bf8d-4bef-bb49-d0cbbc9791aa","year":2023},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:119a38013aa4bd03245122b02d8618e5ad52b9b30f620ada0a5164421867de47","observation_id":"dda0635f-4b09-4033-ac11-64d8f295dd9f","resolution":{"observed_at":"2026-05-22T00:14:29.000667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06870","last_updated":"2022-12-13T19:30:03Z","snapshot_observed_at":"2026-08-18T10:46:41.078856Z","submitted_at":"2022-12-13T19:30:03Z","title":"MegaPose: 6D Pose Estimation of Novel Objects via Render & Compare","version":1},"cited_work":{"arxiv_id":"2212.06870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.06870","snapshot_observed_at":"2026-07-04T09:59:45.381734Z","title":"Megapose: 6d pose estimation of novel objects via render & compare","venue":null,"work_id":"aae2e7fc-c8d3-49a0-89aa-229fca9e29cc","year":2022},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2212.06870","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:37812d70861aefae7e1c4b13cb562260f4930a2b14d0b4196db8b647ed2a4703","observation_id":"7ba82f52-973d-4d1e-b1d3-dec217fc3a23","resolution":{"observed_at":"2026-05-22T00:14:27.928249Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:12:45.688323Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"71233f6e-d1df-40e1-8b1a-676c2d5405d1","year":2021},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:8f1064278b770131795f161af30268088986ca925157bca8bd168103eef29c01","observation_id":"d0329822-8eff-487b-bb99-4f7e1eab28da","resolution":{"observed_at":"2026-05-22T00:14:28.997703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09898","last_updated":"2025-04-04T00:51:17Z","snapshot_observed_at":"2026-08-14T13:53:43.298863Z","submitted_at":"2025-01-17T01:01:44Z","title":"FoundationStereo: Zero-Shot Stereo Matching","version":4},"cited_work":{"arxiv_id":"2501.09898","doi":"10.48550/arxiv.2501.09898","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09898","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Foundationstereo: Zero-shot stereo matching","venue":"ArXiv.org","work_id":"0bb4ef60-0cc0-48f7-9d4e-3bd8d1de96d7","year":2025},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2501.09898","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:a6fdcfd67eefb16363b4a9716dc9b80aef8ba97c9801392dee5c922135f845a8","observation_id":"e6fcda68-b45b-45f6-af27-3344da5c4c62","resolution":{"observed_at":"2026-05-22T00:14:27.932995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient video prediction via sparsely conditioned flow matching","venue":null,"work_id":"71fb2e0f-ac51-4c1a-ab46-5e104d112138","year":2023},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:c1b4718b434da5d42ea5b98726341869208c4c065f546bc2b01485405aa6e396","observation_id":"7e36acaf-7971-4ad2-8fd4-cfaf96e7a220","resolution":{"observed_at":"2026-05-22T00:14:28.992171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.05954","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T00:07:43.037042Z","title":"Pyramidal flow matching for efficient video generative modeling.arXiv preprint arXiv:2410.05954","venue":null,"work_id":"86ba3b09-fc7d-4d26-acce-10677e0b5d69","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:a8c0963a5cb10d0398e363a3665ecd74cdcf976cefbaa9cb2bd7c5d469e8ec45","observation_id":"36bfb67f-5508-482c-84e7-80ca88898b61","resolution":{"observed_at":"2026-05-22T00:14:27.942858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.07772","doi":"10.48550/arxiv.2412.07772","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From slow bidirectional to fast causal video generators","venue":"arXiv (Cornell University)","work_id":"abfa788c-f0ab-4015-ab03-6b2d05a5e36f","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:ecd2c387e6023202ef9180cee41f9b4e56ec5c064e121a31b2b9617bf684a97c","observation_id":"9a930659-c399-46ff-945b-82b73107f590","resolution":{"observed_at":"2026-05-22T00:14:27.799024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-08-13T00:09:27.237577Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:787cbf8dcd89d65a0f79028893466f6b9a3e2f1ccf162a6fda40b980cf58a8e3","observation_id":"2d1a1932-63a9-4f17-afee-c4073be0e256","resolution":{"observed_at":"2026-05-22T00:14:27.855764Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20502","last_updated":"2025-04-15T14:06:28Z","snapshot_observed_at":"2026-08-16T13:05:37.232051Z","submitted_at":"2024-10-27T16:28:28Z","title":"ARLON: Boosting Diffusion Transformers with Autoregressive Models for Long Video Generation","version":3},"cited_work":{"arxiv_id":"2410.20502","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20502","snapshot_observed_at":"2026-07-02T20:37:22.496220Z","title":"Arlon: Boosting diffusion transformers with autoregressive models for long video generation","venue":null,"work_id":"722a2b1e-c829-4cef-864f-4bbdb1eb0031","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2410.20502","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:823d499325666e187f9063050fe3491308d67f98feac77e5893ba5264cd3c6e8","observation_id":"71310e1e-4e10-4181-b05a-a37b0ef42456","resolution":{"observed_at":"2026-05-22T00:14:27.809466Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-08-15T15:00:19.916941Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"cited_work":{"arxiv_id":"2503.19325","doi":"10.48550/arxiv.2503.19325","metadata_source":"pith","pith_arxiv_id":"2503.19325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","venue":"cs.CV","work_id":"9700bbdc-df42-461a-81fa-b29ffe683326","year":2025},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2503.19325","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:93fe5d15bff306a25b4b6064801bb8b0d193fccc6819f86a33a6fc4ce9664f05","observation_id":"e00cf64f-7b1b-4096-bb85-d76c5f62a9e0","resolution":{"observed_at":"2026-05-22T00:14:27.847601Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":"c2d42c38-d554-4490-92eb-b24f2afae568","year":2022},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:a47758695b4b5b9620131ab14f968d6ff8d03c39215ffd337f843da6b0e60a35","observation_id":"7fc3ebbc-fd3b-4be2-b191-c69e8cbd6ed3","resolution":{"observed_at":"2026-05-22T00:14:28.988800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":33,"verified_fuzzy":18},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 16 inbound Pith citation observations for arXiv:2507.01099."}