{"as_of":"2026-08-07T23:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c59e54f3913a01f71853e9c62eb056b27c8f4c2e6014823e638525cca1a806c3","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T12:17:01.294466Z","state":"measured"},{"denominator":131,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":131,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":70,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:56:32.082618Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T23:07:47.692433Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T07:33:25.188358Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2411.19650"},"observation_digest":"sha256:1310eb7f95e4054f9928ffffc09bb4e92f20b406ff1735e33f26c061113a0401","observation_id":"7ca60efb-2d6a-426f-a05c-562b94407f37","resolution":{"observed_at":"2026-05-15T12:17:01.597427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-12T18:38:11.110166Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2412.14803"},"observation_digest":"sha256:23cbeb3b6b937d8a53b0bb9e63b3dc4cfdedcbf283a29615ac9be74b57301e45","observation_id":"08fcb0ee-3113-4928-b7a7-419907738d21","resolution":{"observed_at":"2026-05-15T12:17:01.597427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T19:09:10.112304Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2503.14734"},"observation_digest":"sha256:7cbad9088cd8cfd605704ac8697e2d0ef55c436c96b823b983c1c1c65eb2e061","observation_id":"c55d477a-ce5a-4eb9-b509-48ea5ed0074c","resolution":{"observed_at":"2026-05-15T12:17:01.597427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:44.903048Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2503.22020"},"observation_digest":"sha256:9974562e61e7189534b15c6bfd5f1f29635bb7f630ee18492e96a63a32c9a9b6","observation_id":"de8b0878-736a-499b-8dbc-6a840b28d918","resolution":{"observed_at":"2026-05-16T05:21:45.233665Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-08-07T00:53:01.614001Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T20:55:52.109166Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2505.03233"},"observation_digest":"sha256:64e740fbb8580519eda1bf1d9a6003b4d23082f3ab59eabc146b82bcaef3c7f5","observation_id":"2f036991-61f9-4386-8a23-b7724c83f23e","resolution":{"observed_at":"2026-05-17T20:55:52.347709Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2505.12705","last_updated":"2025-06-17T22:33:35Z","snapshot_observed_at":"2026-07-06T21:26:01.534136Z","submitted_at":"2025-05-19T04:55:39Z","title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T23:50:45.332466Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2505.12705"},"observation_digest":"sha256:4852b3d4864584f0f692283393c56322985fb25eaa60ce414bd9055d5ff5a075","observation_id":"e564a0c1-f300-4ade-b9a8-5fca9b62ce10","resolution":{"observed_at":"2026-05-15T23:50:45.515634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-08-07T14:56:32.082618Z","title":"Gen2act: Hu- man video generation in novel scenarios enables generaliz- able robot manipulation.arXiv preprint arXiv:2409.16283,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-07T14:49:29.061697Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:32.082618Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2505.17006"},"observation_digest":"sha256:2291a5a204fcb462163c24c312eed3c1ab0671e2ab199f12a06d9ed2d24945dd","observation_id":"1d7c1656-b81d-498e-b6b0-42b23703f075","resolution":{"observed_at":"2026-08-07T14:56:32.082618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-08-07T14:39:28.179162Z","title":"Gen2act: Human video generation in novel scenarios enables generalizable robot manipulation.arXiv preprint arXiv:2409.16283, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:28.179162Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:674a4822c2a60e5294f83f023b66cac20794747281c269fa3920dd020e79defa","observation_id":"e47415ba-09ac-47d7-9104-881ef902dfbf","resolution":{"observed_at":"2026-08-07T14:39:28.179162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-08-07T14:25:41.746221Z","title":"Gen2act: Human video generation in novel scenarios enables generalizable robot manipulation.arXiv preprint arXiv:2409.16283, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19017","last_updated":"2025-05-25T07:41:39Z","snapshot_observed_at":"2026-08-07T14:19:25.924640Z","submitted_at":"2025-05-25T07:41:39Z","title":"WorldEval: World Model as Real-World Robot Policies Evaluator","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.746221Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2505.19017"},"observation_digest":"sha256:7490177cee1827bdae6c97f489b36daac8fc8e59bfad725199e09c5f9bd465b1","observation_id":"8e2cb8d1-ed23-4764-aa5b-4309cf49ab13","resolution":{"observed_at":"2026-08-07T14:25:41.746221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-08-07T13:51:26.963771Z","title":"Bharadhwaj, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20795","last_updated":"2026-05-29T12:22:36Z","snapshot_observed_at":"2026-08-07T13:44:43.648217Z","submitted_at":"2025-05-27T06:56:14Z","title":"Learning Generalizable Robot Policy with Human Demonstration Video as a Prompt","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:26.963771Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2505.20795"},"observation_digest":"sha256:fea77a3dc10d508a553b5492830a7897200c218b6cf184c06b8e63f187644066","observation_id":"0152c7f7-8fb9-4bd7-8526-17463871aff0","resolution":{"observed_at":"2026-08-07T13:51:26.963771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-08-07T06:03:29.685470Z","title":"Bharadhwaj, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06199","last_updated":"2025-06-06T16:00:31Z","snapshot_observed_at":"2026-08-07T16:39:23.915537Z","submitted_at":"2025-06-06T16:00:31Z","title":"3DFlowAction: Learning Cross-Embodiment Manipulation from 3D Flow World Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T06:03:29.685470Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2506.06199"},"observation_digest":"sha256:fa9c799888edf481cd0ec9651b4bea099c52803f1c7006f7d92aa2750691163e","observation_id":"4acfe0af-982f-4a83-b4c1-d88260a07428","resolution":{"observed_at":"2026-08-07T06:03:29.685470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-08-06T22:17:14.317347Z","title":"Gen2act: Human video generation in novel scenarios enables generalizable robot manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22007","last_updated":"2025-06-27T08:21:55Z","snapshot_observed_at":"2026-08-06T22:10:52.001919Z","submitted_at":"2025-06-27T08:21:55Z","title":"RoboEnvision: A Long-Horizon Video Generation Model for Multi-Task Robot Manipulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:17:14.317347Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2506.22007"},"observation_digest":"sha256:0a725f2ab3d4d30a95b7b140f278dffcd535651a5333c0a77c4ae2211847809a","observation_id":"a8a80014-0c0e-4677-8b9d-e979157df557","resolution":{"observed_at":"2026-08-06T22:17:14.317347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2507.00990","last_updated":"2026-05-13T01:35:48Z","snapshot_observed_at":"2026-07-06T21:50:35.488353Z","submitted_at":"2025-07-01T17:39:59Z","title":"Robotic Manipulation by Imitating Generated Videos Without Physical Demonstrations","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T06:36:13.144868Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2507.00990"},"observation_digest":"sha256:c89cfe4aa9b4e47574dcf79ca4a4d3a4b55f6f07eee9486e66e3e04642d4469d","observation_id":"a6364e67-ae71-4d78-943d-ce0914886f8d","resolution":{"observed_at":"2026-05-19T06:37:07.494124Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-02T13:47:45.555967Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:6d5a5adac8ef58b487a4960b470ada27f205df833557d4a1a915c2261e1bef52","observation_id":"68102722-7369-4727-9a9b-da6f7232ef04","resolution":{"observed_at":"2026-05-22T00:14:27.918399Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T15:42:41.363422Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2507.04447"},"observation_digest":"sha256:750400e5ccb7f15a419b040c53357d913ed06cdec4b587c3fe36b2496b3af62e","observation_id":"053b7edf-4cb6-4d7e-b763-9f36948291d2","resolution":{"observed_at":"2026-05-16T15:42:41.440781Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2507.12768","last_updated":"2026-05-06T08:19:11Z","snapshot_observed_at":"2026-08-03T01:37:13.706745Z","submitted_at":"2025-07-17T03:48:57Z","title":"AnyPos: Automated Task-Agnostic Actions for Bimanual Manipulation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T03:52:18.984005Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2507.12768"},"observation_digest":"sha256:74ce987e3dfe3b62f7599276f382b6587153e97453d596cf7159548144127d6f","observation_id":"1c0632e1-bbf7-457b-8dad-1a2980ac07c5","resolution":{"observed_at":"2026-05-19T03:52:57.533297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2507.12898","last_updated":"2025-12-20T02:16:12Z","snapshot_observed_at":"2026-07-30T09:36:32.113048Z","submitted_at":"2025-07-17T08:31:55Z","title":"Vidar: Embodied Video Diffusion Model for Generalist Manipulation","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T09:54:28.271928Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2507.12898"},"observation_digest":"sha256:3334212e9da50d899fb16bfb2f8bf6de3e7f6d1ad7b404dab867b2504bdc8f68","observation_id":"fdbee5e9-1ad2-4191-af9e-e864ff7d47d5","resolution":{"observed_at":"2026-05-16T09:54:28.352175Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-08-05T19:15:31.357011Z","title":"Gen2act: Human video generation in novel scenarios enables generalizable robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13104","last_updated":"2025-08-18T17:12:28Z","snapshot_observed_at":"2026-08-05T19:13:32.356835Z","submitted_at":"2025-08-18T17:12:28Z","title":"Precise Action-to-Video Generation Through Visual Action Prompts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T19:15:31.357011Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2508.13104"},"observation_digest":"sha256:fd85a5c109bb5b16bda1c1d3a23d2fa6d946190c33eb275581386d8af74388c2","observation_id":"78af8e13-775a-43df-af28-0c2d8a3144e8","resolution":{"observed_at":"2026-08-05T19:15:31.357011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-08-05T16:22:54.474371Z","title":"Gen2act: Human video generation in novel scenarios enables generalizable robot manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18691","last_updated":"2025-08-26T05:25:57Z","snapshot_observed_at":"2026-08-06T17:59:05.037786Z","submitted_at":"2025-08-26T05:25:57Z","title":"Deep Sensorimotor Control by Imitating Predictive Models of Human Motion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:54.474371Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2508.18691"},"observation_digest":"sha256:fd33efe0f75592f8e62181c27b76b0cead52ab56b647450ca88264b4d306104d","observation_id":"f9efeae9-6188-4694-99fb-6121a36c3eba","resolution":{"observed_at":"2026-08-05T16:22:54.474371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2510.10125","last_updated":"2026-03-01T08:24:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-11T09:13:10Z","title":"Ctrl-World: A Controllable Generative World Model for Robot Manipulation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T01:14:10.174044Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2510.10125"},"observation_digest":"sha256:f8e56268f0148240e6feefd3a5b782936e7e93e961a1e6d74d2f5bb9e38bc064","observation_id":"3444e9b6-0d1d-4710-a6ac-97c920e5c615","resolution":{"observed_at":"2026-05-16T01:14:10.261976Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2512.13030","last_updated":"2025-12-25T08:16:05Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-15T06:58:40Z","title":"Motus: A Unified Latent Action World Model","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T18:44:36.636455Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2512.13030"},"observation_digest":"sha256:9dd4f4ecf4c702d278ea4253869f9ff39b579d0985bba9d7a496f088b7e67ee0","observation_id":"bdbbbb16-f417-4aee-87a0-c18cc8b12af6","resolution":{"observed_at":"2026-05-15T12:17:01.597427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2512.15840","last_updated":"2026-05-08T06:37:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:35:54Z","title":"Large Video Planner Enables Generalizable Robot Control","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T21:26:32.048309Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2512.15840"},"observation_digest":"sha256:6e69c20c73b474dd41ec62a0f79a81c6ad27504c823045e217ff33c1a03f8f06","observation_id":"f14a9dda-1b5a-413e-a890-69e7d6bbbf4e","resolution":{"observed_at":"2026-05-16T21:28:34.008786Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2601.07060","last_updated":"2026-04-04T05:08:38Z","snapshot_observed_at":"2026-07-06T22:41:24.948774Z","submitted_at":"2026-01-11T21:00:58Z","title":"PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T15:05:21.907878Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2601.07060"},"observation_digest":"sha256:aa41f2dda998487d157c44c0722a9cc5766f37b47339b333483310c8a611adc0","observation_id":"9b77c962-01f2-4379-83e6-cbd9c73f76aa","resolution":{"observed_at":"2026-05-16T15:08:01.753463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-08-03T02:45:06.654960Z","title":"Gen2act: Human video generation in novel scenarios enables generalizable robot manipulation.arXiv preprint arXiv:2409.16283,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09878","last_updated":"2026-05-26T17:06:15Z","snapshot_observed_at":"2026-08-03T02:45:05.244742Z","submitted_at":"2026-02-10T15:19:17Z","title":"MVISTA-4D: View-Consistent 4D World Model with Test-Time Action Inference for Robotic Manipulation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T02:45:06.654960Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2602.09878"},"observation_digest":"sha256:8c782efd03072e1a1bd686f6911adf58d057ee7ad127386af2f62da5b47d4606","observation_id":"28d3a22f-0137-4217-af38-8017209e66c7","resolution":{"observed_at":"2026-08-03T02:45:06.654960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T16:18:15.003371Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2602.15922"},"observation_digest":"sha256:c75374c4c102b8274c4ea30886cb77168051367d2e7d103508ac760a3175bdc9","observation_id":"0c6102a6-9dfc-4bfa-8d26-9b49bd797568","resolution":{"observed_at":"2026-05-15T12:17:01.597427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-15T13:07:10.012493Z","title":"Gen2act: Human video generation in novel scenarios enables generalizable robot manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.07690","last_updated":"2026-06-20T08:02:32Z","snapshot_observed_at":"2026-07-15T13:07:09.224323Z","submitted_at":"2026-03-08T15:46:03Z","title":"FrameVGGT: Coherence-Preserving Memory for Bounded Streaming Geometry","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-15T13:07:10.012493Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2603.07690"},"observation_digest":"sha256:eaaad00586a6c78dae620fa1e6a5f208415ca1477ed5707e97ec99f1de347457","observation_id":"891af52c-2463-4119-b862-c15f84c4a912","resolution":{"observed_at":"2026-07-15T13:07:10.012493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-07-06T22:49:23.750692Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T01:57:29.753735Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2603.16666"},"observation_digest":"sha256:0f4ea4c3f57a46effe6ec8a78580a21184ea0213c16570cf4aca53fa83437b58","observation_id":"f2d46835-fbf0-4424-a8c4-fcb4f6c7f964","resolution":{"observed_at":"2026-05-15T12:17:01.597427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2604.03181","last_updated":"2026-04-03T16:57:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-03T16:57:06Z","title":"Multi-View Video Diffusion Policy: A 3D Spatio-Temporal-Aware Video Action Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T18:54:07.081457Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2604.03181"},"observation_digest":"sha256:dcb6cedb3a40a32b3a980914743c9f4bf12c2b34fe2ad965ba5ee9d6706b923f","observation_id":"73d18080-2949-4d96-a4a2-3d0771e32286","resolution":{"observed_at":"2026-05-15T12:17:01.597427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2604.04974","last_updated":"2026-06-03T17:05:28Z","snapshot_observed_at":"2026-08-05T03:49:14.637609Z","submitted_at":"2026-04-04T15:37:11Z","title":"From Video to Control: A Survey of Learning Manipulation Interfaces from Temporal Visual Data","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-13T17:02:18.358675Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2604.04974"},"observation_digest":"sha256:d1a9ce8290190b579020eec575721614623de107a1fc8ca4718b19036a8c89bc","observation_id":"64eeb5d9-16fd-4bc6-80fe-b7227beb37bb","resolution":{"observed_at":"2026-05-15T12:17:01.597427Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2604.08168","last_updated":"2026-04-09T12:28:14Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T12:28:14Z","title":"ViVa: A Video-Generative Value Model for Robot Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T17:12:08.970164Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2604.08168"},"observation_digest":"sha256:f7275708441a8b435d0fe64a5e8ba5f30e88083ad19e918966693e2f50e77b98","observation_id":"d40b12db-4432-4f63-a553-0046a7d12d87","resolution":{"observed_at":"2026-05-15T12:17:01.597427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-13T00:03:53.609175Z","title":"Gen2act: Human video generation in novel scenarios enables generalizable robot manipulation.arXiv preprint arXiv:2409.16283, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.08169","last_updated":"2026-07-02T01:38:10Z","snapshot_observed_at":"2026-08-07T08:51:57.871195Z","submitted_at":"2026-04-09T12:28:22Z","title":"Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T00:03:53.609175Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2604.08169"},"observation_digest":"sha256:ae61b32a19de916612bc899a553761010a44620667d3e51763a9ed565ea7b6db","observation_id":"ac914cc8-773e-430a-ad58-95cb105f6045","resolution":{"observed_at":"2026-07-13T00:03:53.609175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2604.10809","last_updated":"2026-04-12T20:40:59Z","snapshot_observed_at":"2026-07-06T22:59:23.126963Z","submitted_at":"2026-04-12T20:40:59Z","title":"WARPED: Wrist-Aligned Rendering for Robot Policy Learning from Egocentric Human Demonstrations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:14:24.932972Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2604.10809"},"observation_digest":"sha256:ad5c6465864b7e5805574898c95a96fd336a369ae7d57c81073d985e478954b5","observation_id":"697cf87c-13a5-452f-bf8d-47e914d4b7c2","resolution":{"observed_at":"2026-05-15T12:17:01.597427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2604.17887","last_updated":"2026-04-20T06:57:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T06:57:55Z","title":"StableIDM: Stabilizing Inverse Dynamics Model against Manipulator Truncation via Spatio-Temporal Refinement","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T04:41:45.903419Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2604.17887"},"observation_digest":"sha256:01cd86ff5824244393517877f5c68983465fab892f237a2cbc957bbf29c8c6dd","observation_id":"9ed6ea99-5520-4157-b64b-6cbb56d431dd","resolution":{"observed_at":"2026-05-15T12:17:01.597427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2604.19092","last_updated":"2026-05-14T07:32:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T05:09:56Z","title":"RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T03:02:26.084185Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2604.19092"},"observation_digest":"sha256:571b323a1183152aecce4c437f06c5326e0be5cde71729c8813a0893891ae763","observation_id":"b9a8750a-1e4d-453c-9e44-81ca4daf7274","resolution":{"observed_at":"2026-05-15T12:17:01.597427Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2604.19092","last_updated":"2026-05-14T07:32:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T05:09:56Z","title":"RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T06:15:32.881140Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2604.19092"},"observation_digest":"sha256:f786775183455a3b3e083f5e2dbe1b77035cdd6f242d71c519d5a95ff3fbc9af","observation_id":"f70af589-066d-4655-9fca-f3b34c5c1e76","resolution":{"observed_at":"2026-05-15T12:17:01.597427Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2604.21741","last_updated":"2026-05-05T16:01:35Z","snapshot_observed_at":"2026-07-29T22:30:00.899443Z","submitted_at":"2026-04-23T14:42:54Z","title":"Hi-WM: Human-in-the-World-Model for Scalable Robot Post-Training","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T21:26:26.540403Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2604.21741"},"observation_digest":"sha256:62dd6e723d5423349c864fab097a1e88a85c46734d5d9e12bd2244586deadbdc","observation_id":"bb78bb12-eb5f-4aa0-a2c1-0b2778fba617","resolution":{"observed_at":"2026-05-15T12:17:01.597427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2604.22615","last_updated":"2026-04-30T12:27:46Z","snapshot_observed_at":"2026-08-06T16:33:11.467195Z","submitted_at":"2026-04-24T14:46:03Z","title":"GazeVLA: Learning Human Intention for Robotic Manipulation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T11:37:30.784513Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2604.22615"},"observation_digest":"sha256:e289bf7a228f32dd83e874b98a3d7320ac8be2314354e5a95be6a40eb35dcc43","observation_id":"31aa16e6-0fe5-4ffc-8895-a21d9c8e80c9","resolution":{"observed_at":"2026-05-15T12:17:01.597427Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2605.00078","last_updated":"2026-04-30T14:16:15Z","snapshot_observed_at":"2026-07-06T23:13:33.799847Z","submitted_at":"2026-04-30T14:16:15Z","title":"Being-H0.7: A Latent World-Action Model from Egocentric Videos","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-09T20:48:01.461993Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2605.00078"},"observation_digest":"sha256:4ec9a9057cd643a4655facbfaaf42b821caa10f680abce96a7220837dd1cc715","observation_id":"141045d7-d20e-4e99-be37-c166644b2efb","resolution":{"observed_at":"2026-05-15T12:17:01.597427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2605.10079","last_updated":"2026-05-11T07:01:38Z","snapshot_observed_at":"2026-07-06T23:22:03.830881Z","submitted_at":"2026-05-11T07:01:38Z","title":"SocialDirector: Training-Free Social Interaction Control for Multi-Person Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T03:28:30.471533Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2605.10079"},"observation_digest":"sha256:eeb2d19ea63d22c1362318a4b4885b67d0682717d1fdbdff27970e898993e174","observation_id":"4c9a9d0f-25a6-4b62-8685-10ac1c1ab5f6","resolution":{"observed_at":"2026-05-15T12:17:01.597427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2605.10942","last_updated":"2026-05-11T17:59:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-11T17:59:56Z","title":"HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T03:28:18.730751Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2605.10942"},"observation_digest":"sha256:fdb3f04b249a722d9c5f731457a713ea2a802f8f4aec31d2492bb2e30d718886","observation_id":"b1e1f89d-d7d3-4f70-a098-bf0644911523","resolution":{"observed_at":"2026-05-15T12:17:01.597427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:733efee1877e9a2c429fe806dbf849f6a0a87b375e51657398a92531b5997ba5","observation_id":"f1b5ec9d-cefb-4681-ae82-0a3516090585","resolution":{"observed_at":"2026-05-15T12:17:01.597427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2605.14274","last_updated":"2026-05-14T02:18:58Z","snapshot_observed_at":"2026-08-02T20:54:21.208623Z","submitted_at":"2026-05-14T02:18:58Z","title":"CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T02:42:08.454469Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2605.14274"},"observation_digest":"sha256:8a0aec64b87588b29b0cef4df51a0b82641ae99219549362a93818d0a2bfb818","observation_id":"01d0c9a8-0e14-478a-ac8f-656b4e255c40","resolution":{"observed_at":"2026-05-15T12:17:01.597427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2605.22882","last_updated":"2026-08-03T23:32:29Z","snapshot_observed_at":"2026-08-07T22:09:32.846973Z","submitted_at":"2026-05-20T21:36:44Z","title":"GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T05:34:03.684055Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2605.22882"},"observation_digest":"sha256:a2e9b08b714939629441fda737f9790d378932af88c4f304b864c6a03b62b8a4","observation_id":"23be7d0e-1de1-4756-b3e9-aba1039dceae","resolution":{"observed_at":"2026-05-25T05:36:39.753370Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2605.22882","last_updated":"2026-08-03T23:32:29Z","snapshot_observed_at":"2026-08-07T22:09:32.846973Z","submitted_at":"2026-05-20T21:36:44Z","title":"GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T16:45:15.955954Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2605.22882"},"observation_digest":"sha256:536854a3ee3c6d7a20dae2540b494796812ef0874976cb1052e86cdcc97f7730","observation_id":"77e6370d-6b84-4122-bc2f-f5b22980e142","resolution":{"observed_at":"2026-06-30T16:54:59.421179Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2605.23856","last_updated":"2026-05-22T17:08:37Z","snapshot_observed_at":"2026-07-06T23:33:59.210165Z","submitted_at":"2026-05-22T17:08:37Z","title":"Point Tracking Improves World Action Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-25T03:51:10.921839Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2605.23856"},"observation_digest":"sha256:804d709edad91cb0351bb549c67f0462dbccd3e2b01f95aa55cd318f9428b53d","observation_id":"9b91dbfb-c731-47f9-b735-1f89e1ea9c8d","resolution":{"observed_at":"2026-05-25T03:56:37.114930Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2606.01955","last_updated":"2026-06-01T09:14:51Z","snapshot_observed_at":"2026-08-03T02:17:56.167011Z","submitted_at":"2026-06-01T09:14:51Z","title":"WALL-WM: Carving World Action Modeling at the Event Joints","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T14:15:14.454649Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2606.01955"},"observation_digest":"sha256:75dc9a3d2118adebd3ec9861d62156fe363487cc0df927296cb043472adfa022","observation_id":"2dcceec9-528f-48cb-95d5-9a3bf11fc57e","resolution":{"observed_at":"2026-07-01T23:36:22.454504Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2606.03868","last_updated":"2026-06-02T16:39:23Z","snapshot_observed_at":"2026-07-06T23:44:05.167767Z","submitted_at":"2026-06-02T16:39:23Z","title":"Unified Video-Action Joint Denoising for Dexterous Action and Data Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T10:28:22.430294Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2606.03868"},"observation_digest":"sha256:d57d3912746943900944a278ee57b2c7dee841cb28f780dcd1e0d3fb695f8b3b","observation_id":"4a9f0217-97f0-4ce5-87f6-940280aed52f","resolution":{"observed_at":"2026-07-02T02:56:29.342412Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2606.07089","last_updated":"2026-06-05T09:35:48Z","snapshot_observed_at":"2026-08-03T20:55:19.434948Z","submitted_at":"2026-06-05T09:35:48Z","title":"Dreaming when Necessary: Advancing World Action Models with Adaptive Multi-Modal Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T21:59:35.783793Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2606.07089"},"observation_digest":"sha256:da76ab15e4e0f5c089a0410fef69a13e283195f960c437b5258a0b63763b46d0","observation_id":"1a7302a2-5a9c-4a76-a284-65f387db816a","resolution":{"observed_at":"2026-07-02T17:37:14.372503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2606.08242","last_updated":"2026-06-06T15:58:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-06T15:58:12Z","title":"Light-WAM: Efficient World Action Models with State-Fusion Action Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T19:55:31.100331Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2606.08242"},"observation_digest":"sha256:7065e2f8bb86ea5cc991b2ea633d78f1b0cf1997288ab8a7bdd2cda7f7453d7b","observation_id":"8a97aa7a-dd40-4df9-b000-dc7efa83f257","resolution":{"observed_at":"2026-07-02T21:07:23.975665Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2606.09457","last_updated":"2026-06-24T12:51:19Z","snapshot_observed_at":"2026-08-02T02:13:19.124258Z","submitted_at":"2026-06-08T13:12:56Z","title":"$\\omega$-EVA: Envision, Verify, and Act with Latent Interactive World Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T16:10:02.176202Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2606.09457"},"observation_digest":"sha256:a944f0430e6e74b4a59677441efaef90188d99fae354b9d7c49c0f98c5881852","observation_id":"c2f94f4e-2f61-418e-9306-efffbdd95c89","resolution":{"observed_at":"2026-07-03T02:07:33.688051Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2606.10614","last_updated":"2026-06-09T09:13:36Z","snapshot_observed_at":"2026-08-06T23:53:02.150971Z","submitted_at":"2026-06-09T09:13:36Z","title":"Dexterous Point Policy: Learning Point-based Dexterous Hand Policies from Human Demonstrations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T13:31:04.351106Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2606.10614"},"observation_digest":"sha256:c73eb17a5e854a61bbb91ce48e7054d734fb186310451ac074f74a4349fac0cb","observation_id":"478088c1-682d-40e2-8e20-817b3da14f7c","resolution":{"observed_at":"2026-07-03T04:57:38.569488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2606.11187","last_updated":"2026-06-09T17:59:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T17:59:22Z","title":"Next Forcing: Causal World Modeling with Multi-Chunk Prediction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T13:31:53.905704Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2606.11187"},"observation_digest":"sha256:6099a9cbd62f2dc50e08fd66a3fc698499ccd9de3bfd60d589ee1f70f8d06fbf","observation_id":"0d3362e4-a8f0-4768-90a5-e6f5bf5c60e6","resolution":{"observed_at":"2026-07-03T04:57:38.518497Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:5af026423ad814a739ec9ddf6d006796eac5ef79112d4a06fa69acac6131dedf","observation_id":"62632859-50c4-46c8-a9a4-a012ea57daeb","resolution":{"observed_at":"2026-07-03T14:48:32.776438Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2606.18558","last_updated":"2026-06-17T00:19:00Z","snapshot_observed_at":"2026-07-06T23:53:59.519305Z","submitted_at":"2026-06-17T00:19:00Z","title":"MolmoMotion: Forecasting Point Trajectories in 3D with Language Instruction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T21:27:47.702578Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2606.18558"},"observation_digest":"sha256:ac64142385f30c4ff174398670cb2bf7272c06663130780e8b7f55d17c55ddb0","observation_id":"e2adea06-fa43-4595-8e1d-0cb9c0028732","resolution":{"observed_at":"2026-07-04T00:09:14.763921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2606.20562","last_updated":"2026-06-18T17:59:51Z","snapshot_observed_at":"2026-07-06T23:55:43.830896Z","submitted_at":"2026-06-18T17:59:51Z","title":"MemoryWAM: Efficient World Action Modeling with Persistent Memory","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T17:00:43.138441Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2606.20562"},"observation_digest":"sha256:7cdbd0ba4df51543d23e36f9e6e58eb293f8ce1e8ce817e9fb1330c02eeda64a","observation_id":"33f6e8f4-b452-4434-bb41-8ebf0bfa61c3","resolution":{"observed_at":"2026-07-04T04:29:34.769747Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2606.22136","last_updated":"2026-06-23T09:28:18Z","snapshot_observed_at":"2026-08-06T21:01:23.847051Z","submitted_at":"2026-06-20T16:31:40Z","title":"Wh0: Generative World Models as Scalable Sources of Egocentric Human Hand Manipulation Data","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T11:47:54.951618Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2606.22136"},"observation_digest":"sha256:ea1486f1d8b8d814085bb99f8dbf83b2e7b4acc4885a97f47f33923ca3e914d4","observation_id":"d5b7daab-af32-4d71-bf43-08a8d4e9ca76","resolution":{"observed_at":"2026-07-04T08:19:44.730950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2606.27677","last_updated":"2026-07-12T12:46:30Z","snapshot_observed_at":"2026-08-02T12:54:53.370122Z","submitted_at":"2026-06-26T03:17:39Z","title":"DIM-WAM: World-Action Modeling with Diverse Historical Event Memory","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T04:58:47.490871Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2606.27677"},"observation_digest":"sha256:cbb6fe50afe20e539e38a1f3cb588354e27194b7b9395cbbb02c8e38b8686a6a","observation_id":"e95fa53e-ecb2-4148-bcdf-5d04c3342b9e","resolution":{"observed_at":"2026-06-29T19:03:51.959890Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-14T17:14:54.438474Z","title":"Gen2act: Human video generation in novel scenarios enables generalizable robot manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27677","last_updated":"2026-07-12T12:46:30Z","snapshot_observed_at":"2026-08-02T12:54:53.370122Z","submitted_at":"2026-06-26T03:17:39Z","title":"DIM-WAM: World-Action Modeling with Diverse Historical Event Memory","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T17:14:54.438474Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2606.27677"},"observation_digest":"sha256:bf7770b467dcb76390c60bddd5e191d725ec38b6143cfa60748ba574f39f1c19","observation_id":"ec6cb3d7-6589-49be-9841-9935670ae0cb","resolution":{"observed_at":"2026-07-14T17:14:54.438474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2606.28128","last_updated":"2026-06-26T14:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-26T14:30:18Z","title":"PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T04:34:38.286863Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2606.28128"},"observation_digest":"sha256:e4fbed02e8c54dbee1253140ff81a57e913bec8bcede67c397952c6d35e72f82","observation_id":"e63e8435-b33e-451a-8d72-8e755bde7c74","resolution":{"observed_at":"2026-06-29T20:03:56.930724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2607.06018","last_updated":"2026-07-07T08:58:29Z","snapshot_observed_at":"2026-08-02T17:41:12.664640Z","submitted_at":"2026-07-07T08:58:29Z","title":"RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-08T19:16:06.847356Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2607.06018"},"observation_digest":"sha256:4e8d386a7f79de084a43a75b59aaadbf9f78250070284b49f7e1f0c216a20e17","observation_id":"a898c7f5-e592-43eb-abdd-999f4f0caf33","resolution":{"observed_at":"2026-07-08T19:25:32.471377Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2607.06559","last_updated":"2026-07-07T17:58:15Z","snapshot_observed_at":"2026-07-10T23:18:28.634748Z","submitted_at":"2026-07-07T17:58:15Z","title":"RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-08T02:00:30.551638Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2607.06559"},"observation_digest":"sha256:bfeb0a2d6b252e96221c1a477e466fd43746364a23445a26575c97460b2365a9","observation_id":"6583d759-8629-4502-8b43-2642b36b575a","resolution":{"observed_at":"2026-07-08T02:04:26.178857Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2607.06706","last_updated":"2026-07-07T18:24:09Z","snapshot_observed_at":"2026-08-02T10:54:41.846058Z","submitted_at":"2026-07-07T18:24:09Z","title":"Vision Language Action (VLA) Models for Unmanned Aerial Robotics and Bimanual Manipulation: A Review","version":1},"reference_index":159,"source":"pdf_text","source_observed_at":"2026-07-10T23:01:01.563768Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2607.06706"},"observation_digest":"sha256:807fc19abc1b36532693692b53c90cb302fe341ac5859624f12dde7a22f607db","observation_id":"c55d4e66-9263-4590-a915-deeff2bf9bda","resolution":{"observed_at":"2026-07-10T23:07:47.707668Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2607.06988","last_updated":"2026-07-10T02:22:52Z","snapshot_observed_at":"2026-08-07T16:54:08.238920Z","submitted_at":"2026-07-08T04:23:22Z","title":"WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-09T22:16:31.529359Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2607.06988"},"observation_digest":"sha256:0af00448093db8afc5df3e742fdedc94871b9547554d4a5db2f526a00c469e5d","observation_id":"605362f1-a845-4062-885d-b6bbb6315e23","resolution":{"observed_at":"2026-07-09T22:16:36.361126Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-13T06:48:14.554799Z","title":"Bharadhwaj, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06988","last_updated":"2026-07-10T02:22:52Z","snapshot_observed_at":"2026-08-07T16:54:08.238920Z","submitted_at":"2026-07-08T04:23:22Z","title":"WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T06:48:14.554799Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2607.06988"},"observation_digest":"sha256:2e56a1c8e2010dd6ee72c5cefcab5b09b7d76a073b23c427fdfaa0b8f76f2082","observation_id":"3a6679f0-a287-4fa8-a412-e02198d37e52","resolution":{"observed_at":"2026-07-13T06:48:14.554799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-08-01T20:30:40.895214Z","title":"Gen2act: Human video generation in novel scenarios enables generalizable robot manipulation.arXiv preprint arXiv:2409.16283,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16602","last_updated":"2026-07-21T07:58:44Z","snapshot_observed_at":"2026-08-07T10:51:54.643728Z","submitted_at":"2026-07-18T02:42:27Z","title":"PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action Exploration","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T20:30:40.895214Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2607.16602"},"observation_digest":"sha256:8fbfe0cae85e0e4cc527353182835b2b9931da1ce1005e0862148ce54196cdbc","observation_id":"cbaae70f-e6bf-4b66-8b03-9fb849b55596","resolution":{"observed_at":"2026-08-01T20:30:40.895214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-08-01T11:06:14.571661Z","title":"Gen2Act: Human video generation in novel scenarios enables generalizable robot manipulation.arXiv preprint arXiv:2409.16283, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20033","last_updated":"2026-07-27T11:34:54Z","snapshot_observed_at":"2026-08-04T04:24:48.840920Z","submitted_at":"2026-07-22T11:20:05Z","title":"Robots Acquire Manipulation Skills in Seconds from a Single Human Video","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-01T11:06:14.571661Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2607.20033"},"observation_digest":"sha256:97a97aba0b1a0847566055e49a5487ae4a9d895e19866d12019f33f14cb4cfd6","observation_id":"edce3f62-877b-42f1-9843-747fa3f95dd1","resolution":{"observed_at":"2026-08-01T11:06:14.571661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-31T08:51:31.805127Z","title":"Gen2act: Human video generation in novel scenarios enables generalizable robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T23:11:29.841318Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":1},"reference_index":252,"source":"pdf_text","source_observed_at":"2026-07-31T08:51:31.805127Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:925c26da542d463ee62e3a8f6902bf9716dc207c2434ed23b0c6a3267195c882","observation_id":"b9323eea-7f0d-48c2-a5d7-918efb23c7a3","resolution":{"observed_at":"2026-07-31T08:51:31.805127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-08-04T01:23:12.142924Z","title":"Gen2act: Human video generation in novel scenarios enables generalizable robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T23:11:29.841318Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":233,"source":"pdf_text","source_observed_at":"2026-08-04T01:23:12.142924Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:f42b1e24625c46f5e28402fae779f843d8660600acb3d5ebe721aecf3303b2e2","observation_id":"070101f9-48a4-4fbb-83f0-58a652793d82","resolution":{"observed_at":"2026-08-04T01:23:12.142924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-08-06T00:18:12.003037Z","title":"Gen2act: Hu- man video generation in novel scenarios enables generaliz- ablerobotmanipulation.arXiv preprint arXiv:2409.16283, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01397","last_updated":"2026-08-02T17:25:08Z","snapshot_observed_at":"2026-08-07T22:26:16.887580Z","submitted_at":"2026-08-02T17:25:08Z","title":"SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:12.003037Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2608.01397"},"observation_digest":"sha256:e1b931685ca0368cbfc839c10036ea26c54c2713297631a473cfac9df97c3663","observation_id":"8a9b7339-7976-49c8-9033-5cd791e246db","resolution":{"observed_at":"2026-08-06T00:18:12.003037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-08-05T19:58:40.731403Z","title":"https://benchcad.com/","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03387","last_updated":"2026-08-05T07:43:28Z","snapshot_observed_at":"2026-08-07T22:16:21.994311Z","submitted_at":"2026-08-04T09:37:06Z","title":"RoboReact: Agentic Skill Distillation from Generated Egocentric Videos for Generalizable Whole-Body Manipulation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-05T19:58:40.731403Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2608.03387"},"observation_digest":"sha256:91ac7d6ff821358231d85702b052187183e8961a0a4d106581e53c2743327e20","observation_id":"6a543c22-db01-4fcd-a213-356075d5e2bf","resolution":{"observed_at":"2026-08-05T19:58:40.731403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2409.16283/citation-record","integrity":"/paper/2409.16283/integrity","json":"/paper/2409.16283/citation-record.json","paper":"/paper/2409.16283"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:9c421fcdccb68ada29f2440ba2b7aa7ab5e7beb5110d7e82b65d7c5f13b560ca","observation_id":"4f97b871-d623-43ec-9b5a-a0bc11ef5c90","resolution":{"observed_at":"2026-05-15T12:17:01.334605Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Roboagent: Generalization and efficiency in robot manipulation via semantic augmen- tations and action chunking","venue":null,"work_id":"cf539f96-21ec-42f3-9343-020ac356a037","year":2024},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:87979b224b417d04e43bbf9c75c2ed670223a76eca83fcaba89208203c7c579b","observation_id":"3b93eb2f-c989-4801-af2e-e190efae2707","resolution":{"observed_at":"2026-05-15T12:17:01.481825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":"2403.12945","doi":"10.48550/arxiv.2403.12945","metadata_source":"pith","pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","venue":"cs.RO","work_id":"13253de2-3d89-415c-8c2f-3adb25d4c337","year":2024},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:d8de48f4155c8176aaf919c09998456d057b53fc7de5019d0a937a7d4fafcab1","observation_id":"ba186ead-e92f-4874-8457-a98a5ac5c30b","resolution":{"observed_at":"2026-05-15T12:17:01.462887Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-02T11:48:59.131827Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":"2203.12601","doi":"10.48550/arxiv.2203.12601","metadata_source":"pith","pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","venue":"cs.RO","work_id":"1fb6c1b7-913d-4a89-bbad-842fdb5fca1d","year":2022},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:b05464a4d8b9198748ec62bb9f53cc97e4770dbe2232ebfb36687001fd74978c","observation_id":"1bad00ee-ff0d-48fd-94b7-128f8f959599","resolution":{"observed_at":"2026-05-15T13:26:54.148999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18240","last_updated":"2024-02-01T19:42:05Z","snapshot_observed_at":"2026-07-06T15:10:41.528837Z","submitted_at":"2023-03-31T17:56:33Z","title":"Where are we in the search for an Artificial Visual Cortex for Embodied Intelligence?","version":2},"cited_work":{"arxiv_id":"2303.18240","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.18240","snapshot_observed_at":"2026-07-03T18:08:46.879474Z","title":"Majumdar, K","venue":null,"work_id":"a30a45a3-bdd7-45bf-a4f4-66d48e56bd4a","year":2023},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2303.18240","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:e86b986827052e81c4e315acade59765d7deb5faaf623ca6ce6650fae45cff3c","observation_id":"915ccc8e-caa9-48fe-99e2-fae756108ea1","resolution":{"observed_at":"2026-05-15T12:17:01.472248Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06173","last_updated":"2022-03-11T18:58:10Z","snapshot_observed_at":"2026-08-06T13:06:27.360959Z","submitted_at":"2022-03-11T18:58:10Z","title":"Masked Visual Pre-training for Motor Control","version":1},"cited_work":{"arxiv_id":"2203.06173","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.06173","snapshot_observed_at":"2026-07-08T01:44:26.089441Z","title":"Masked visual pre-training for motor control","venue":"cs.CV","work_id":"87cf1bc9-a17c-4f06-8a24-80a4a1051a0b","year":2022},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2203.06173","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:f3fb94883fc976e4b25e5f19c3b878404cad5559e6c20aaf84f984daaf72376d","observation_id":"89622009-47b5-4a5c-9250-4378c5632986","resolution":{"observed_at":"2026-05-15T12:17:01.477837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12766","last_updated":"2023-02-24T17:29:31Z","snapshot_observed_at":"2026-08-05T20:49:12.236475Z","submitted_at":"2023-02-24T17:29:31Z","title":"Language-Driven Representation Learning for Robotics","version":1},"cited_work":{"arxiv_id":"2302.12766","doi":"10.48550/arxiv.2302.12766","metadata_source":"pith","pith_arxiv_id":"2302.12766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Karamcheti, S","venue":"cs.RO","work_id":"5bd4457e-dc56-4b1e-ac07-f14764ba597e","year":2023},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2302.12766","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:5ed60b21773ebbabc265f29e51982c83635cde45512a293c0fbe0ddbac2f986b","observation_id":"30448461-fdfb-45f4-9876-5fdca78141ef","resolution":{"observed_at":"2026-05-15T12:17:01.343239Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":"b930f303-c54c-473a-96c0-826bedbc6a29","year":2023},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:bdbacf1871195018057a9c09ca39685b35817a58a2f25e044986e4cc75d8c4ba","observation_id":"1d128787-7f65-4e04-8018-f127d2e73f90","resolution":{"observed_at":"2026-05-15T12:17:01.505902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dinobot: Robot manipula- tion via retrieval and alignment with vision foundation models","venue":null,"work_id":"c027e1d4-e5b6-4bc5-93d0-d58c1f925eea","year":2024},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:702450004aa561a3be9260765eb60c49ad6d50054d5dfd98b5bc35329cf19dde","observation_id":"6e107635-096c-4b27-8752-4df6377de08a","resolution":{"observed_at":"2026-05-15T12:17:01.509480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:e1ab9f127b238621f24eebf2c34d5a58be922d645de4de58ecffbb4377e24915","observation_id":"d0a3f88f-dc44-4ec2-908e-15fb29196fa6","resolution":{"observed_at":"2026-05-15T12:17:01.351949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-07-06T16:34:04.003157Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":"2310.10639","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-07-08T02:04:26.192438Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","venue":"cs.RO","work_id":"954b4359-f4ed-4c73-ae5b-f75d486b6fc8","year":2023},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:e87c925a5f86524dd124854a7625b2ffed2f4b65ef84250aff51e38b361f0d70","observation_id":"fed1f86a-8ef4-4aa4-9221-611e5589cb68","resolution":{"observed_at":"2026-05-16T05:54:59.300665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual affordance prediction for guiding robot exploration","venue":null,"work_id":"9c9840ca-8ac5-4a81-a840-c33a24e62cdd","year":2023},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:2833ba1c79e027233fed6ce3e992b07c493627daa4f5417153efb70a5c490b3e","observation_id":"7bf6bd01-1c16-4381-a345-bc3d2381430f","resolution":{"observed_at":"2026-05-15T12:17:01.521635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dall-e-bot: Introducing web-scale diffusion models to robotics","venue":null,"work_id":"3a7505d6-1700-4316-963d-9d7c3a79d5ce","year":2023},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:af7f0ee481788dd1ae472b773840c17e8d662d154fb0ce86f9afe673c253555a","observation_id":"696d368b-c640-40d0-9210-356759a017ca","resolution":{"observed_at":"2026-05-15T12:17:01.525259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards generalizable zero-shot manipulation via translating human interaction plans","venue":null,"work_id":"da6fd747-a1cd-492f-a5e9-2da41cc1feb6","year":2024},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:09f8a37e469056e7fddf27d68bc5b2d41d2c8d6a09be56e15a5c6e8cc2776b6c","observation_id":"d24fed34-43c7-4fbe-8da1-6949036ba947","resolution":{"observed_at":"2026-05-15T12:17:01.529477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01527","last_updated":"2024-08-08T23:18:08Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:56:55Z","title":"Track2Act: Predicting Point Tracks from Internet Videos enables Generalizable Robot Manipulation","version":2},"cited_work":{"arxiv_id":"2405.01527","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.01527","snapshot_observed_at":"2026-07-04T00:59:19.447450Z","title":"Track2act: Predicting point tracks from internet videos enables generalizable robot manipulation","venue":null,"work_id":"88e7a0f8-c0d2-40e5-8449-864ef0385305","year":2024},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2405.01527","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:42a2fb5edc04f5da517af2017787048550d8388595778ffceec586d92a709c29","observation_id":"a301df75-c8b9-42a5-bdcd-b266e91c134f","resolution":{"observed_at":"2026-05-15T12:17:01.361481Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-02T11:56:15.393496Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":"2311.10709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-02T12:36:57.125908Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"7d56a470-9715-47bc-bf18-dec97e1c8fc5","year":2023},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:74efa06cf1538eeee3b6094e6198aa5ce01afe6a7fe109c97bfa2ef2f30dd2a7","observation_id":"12b802e2-f91b-4393-b4ce-c66e0fd20f86","resolution":{"observed_at":"2026-05-15T12:17:01.365911Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-07-06T13:12:59.688989Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":"2205.11487","doi":"10.48550/arxiv.2205.11487","metadata_source":"pith","pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","venue":"cs.CV","work_id":"af16442b-a46f-469d-8818-c37b53a504c7","year":2022},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:012dce9ca29f868cb228e10d3c2f6fc8f5fc058a721b3bce548b5e97cf883c6f","observation_id":"5b89bc29-c0a9-4561-8604-3da481035a2e","resolution":{"observed_at":"2026-05-15T12:17:01.369872Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.677+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.677+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":"2312.14125","doi":"10.48550/arxiv.2312.14125","metadata_source":"pith","pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","venue":"cs.CV","work_id":"5cc3572d-7e2f-4431-ae42-d9282a42a800","year":2023},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:1f7a8ae9fe7db0ffb7ad485ff3e34d300d91f9a05addec423c12b310be75bc66","observation_id":"4c9b4171-7598-425f-a432-73f44bacb461","resolution":{"observed_at":"2026-05-15T17:51:05.830483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00847","last_updated":"2024-05-23T15:00:26Z","snapshot_observed_at":"2026-08-07T03:50:05.904398Z","submitted_at":"2024-02-01T18:38:55Z","title":"BootsTAP: Bootstrapped Training for Tracking-Any-Point","version":2},"cited_work":{"arxiv_id":"2402.00847","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.00847","snapshot_observed_at":"2026-07-04T00:59:19.505966Z","title":"Bootstap: Boot- strapped training for tracking-any-point","venue":null,"work_id":"e871da74-3c80-4569-81d7-7c47cef2c94b","year":2024},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2402.00847","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:9fa1139562f34041031bba4dc205b62c7401e70ceb1b69762600938d01f0b676","observation_id":"c3296676-0b29-49fd-851d-9668b305ccaf","resolution":{"observed_at":"2026-05-15T12:17:01.380972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One-shot visual imitation learning via meta-learning","venue":null,"work_id":"c55b7ee9-cd40-4447-b5ff-865dfff4237f","year":2017},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:c3ac36e01fc3e2d78f0d4de3648f479c76c4f213673f40d33dabe3fc2ec181e4","observation_id":"4da3e78a-1ed9-453c-8c9e-e36291f47e62","resolution":{"observed_at":"2026-05-15T12:17:01.555998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual imitation made easy","venue":null,"work_id":"4fae23a6-58cc-4a31-a261-8da43de8781d","year":2020},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:563797d7a376ed3b852b574f278058e585430673649cd4d20e07861a20b04cc1","observation_id":"bedfeb06-d08f-4294-a5d9-e4cbe913fd77","resolution":{"observed_at":"2026-05-15T12:17:01.560637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning monocular reactive uav control in cluttered natural environments","venue":null,"work_id":"d80bfb82-03b3-4d5e-986d-87e772f21571","year":2013},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:47da756b3dd437ac971bebb4472a70afa258f59b84b7d5bf6c3eb1b736f2b0f3","observation_id":"962859c3-b178-4b08-85be-18cc97dda022","resolution":{"observed_at":"2026-05-15T12:17:01.565517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end learning for lane keeping of self-driving cars","venue":null,"work_id":"edde71f4-c72c-4e99-8734-f7e48decb7e9","year":2017},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:db688dddc21fd932eb52edc6727cb0fd74f47d5a8c4fe7ee0c29008fb2d96837","observation_id":"fbbcf40a-aff2-43b2-9203-c776689e9c3d","resolution":{"observed_at":"2026-05-15T12:17:01.569872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Roboturk: A crowdsourcing platform for robotic skill learning through imitation","venue":null,"work_id":"30158589-94a2-4315-bf06-2e5d7665e32a","year":2018},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:5670c6255a22a9bd2ce5f4c201b3a87a2f5c8a1a315c94a10a0a5439eeeec3d0","observation_id":"702daf53-1701-42cc-9727-dfda05432924","resolution":{"observed_at":"2026-05-15T12:17:01.574405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bc-z: Zero-shot task generalization with robotic imitation learning","venue":null,"work_id":"36f4e0a3-3bd2-4906-b632-d3129d95b210","year":2022},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:9c86504c05f5c1b2f1324b1ac2b06e0b244bb55f6bbe7fff463dacb83fed37a1","observation_id":"0e53352d-3a35-4546-8242-8512a0c39ee3","resolution":{"observed_at":"2026-05-15T12:17:01.578336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":"faa825f0-c6da-4afd-9579-c986d7bc4f07","year":2023},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:791a4fecdbca5fe08bb33798bf2856c98ed4fcd5a451884a475cbe1804d4bd77","observation_id":"451b5ca9-b40e-4b82-a48b-1e5e81e6a3bd","resolution":{"observed_at":"2026-05-15T12:17:01.582255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable deep reinforcement learning for vision-based robotic manipulation","venue":null,"work_id":"ecb08cbb-2b92-44f8-b869-db3c1c1135c3","year":2018},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:7a4e35eb5924713220e33c1132b96068a9e9ac2a95056bace332c7d56d4755a8","observation_id":"6a224b93-d8df-4195-9e8f-7ce3ebabfcc0","resolution":{"observed_at":"2026-05-15T12:17:01.586306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"e2dfad62-eac2-4caf-bef7-8a7044700d18","year":2022},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:367119230bc326833d8955d8717631d39b777f280b1ce29a524662a049ab1483","observation_id":"88f130d4-c547-4af2-884c-8766413511e5","resolution":{"observed_at":"2026-05-15T12:17:01.591657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"32fc83c6-1113-4c18-b98d-87c35b3bea7e","year":2009},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:93acb4aaa6054d66c3f20c0c9114aa0ac8f8367a166f4854aa40172cd8017cc1","observation_id":"1ab5a11d-ce63-4eaf-ad70-27358bb1da6c","resolution":{"observed_at":"2026-05-15T12:17:01.595909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00030","last_updated":"2023-03-07T02:29:59Z","snapshot_observed_at":"2026-08-02T00:17:16.761436Z","submitted_at":"2022-09-30T18:14:07Z","title":"VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training","version":2},"cited_work":{"arxiv_id":"2210.00030","doi":"10.48550/arxiv.2210.00030","metadata_source":"pith","pith_arxiv_id":"2210.00030","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training","venue":"cs.RO","work_id":"022de141-49ac-43d5-9667-e36913ec1950","year":2022},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2210.00030","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:00519297c1f04dabc16f382bfa831dd4bab3a05f50a4c79181fff5957e0e847b","observation_id":"c791f4c9-132e-4936-a2f3-ec9ee5ae04c0","resolution":{"observed_at":"2026-05-15T12:17:01.386002Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03580","last_updated":"2022-08-08T22:32:21Z","snapshot_observed_at":"2026-07-06T12:45:14.351278Z","submitted_at":"2022-03-07T18:26:14Z","title":"The Unsurprising Effectiveness of Pre-Trained Vision Models for Control","version":2},"cited_work":{"arxiv_id":"2203.03580","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03580","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The unsurprising effectiveness of pre- trained vision models for control","venue":null,"work_id":"42440ce4-b5d0-4401-bee7-a2bdc26cfed2","year":2022},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2203.03580","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:7ca668edee6ee75fbee9a742e9d04cb208ba8c55d39cd4c5e15b981717757b83","observation_id":"9b659480-c75f-44e1-92b2-175ace08e773","resolution":{"observed_at":"2026-05-15T12:17:01.390293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"cited_work":{"arxiv_id":"2312.13139","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.13139","snapshot_observed_at":"2026-07-04T21:00:09.556391Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","venue":"cs.RO","work_id":"e92c2c13-4330-45fe-8231-34a6002626bd","year":2023},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2312.13139","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:ae2fefa05da061389e43f3c887191161f050f91927ec3a210a2feccfc6a7cf17","observation_id":"94abe090-7b5a-48b4-9184-c406241bf3a2","resolution":{"observed_at":"2026-05-15T12:17:01.393862Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17139","last_updated":"2024-02-27T02:05:29Z","snapshot_observed_at":"2026-08-04T02:50:42.922408Z","submitted_at":"2024-02-27T02:05:29Z","title":"Video as the New Language for Real-World Decision Making","version":1},"cited_work":{"arxiv_id":"2402.17139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.17139","snapshot_observed_at":"2026-07-02T23:57:27.914181Z","title":"Video as the new language for real-world decision making","venue":null,"work_id":"c0c521da-9575-4981-98c6-a569fbccab98","year":2024},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2402.17139","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:f1c98798e41e40858e13638e78d845bf144e913c88ae2b20bbe792fc64fe539a","observation_id":"cb68f435-9ef9-496f-9a99-9d4e3f324fae","resolution":{"observed_at":"2026-05-15T12:17:01.397994Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06600","last_updated":"2023-04-13T15:06:28Z","snapshot_observed_at":"2026-07-06T15:15:22.209954Z","submitted_at":"2023-04-13T15:06:28Z","title":"Lossless Adaptation of Pretrained Vision Models For Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2304.06600","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.06600","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lossless adaptation of pre- trained vision models for robotic manipulation","venue":null,"work_id":"88ad8705-e1c4-4819-b72e-6419db6db1de","year":2023},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2304.06600","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:54aae3e9dfa38a7a85d0c6365d29f1852e6f24d860ead4b17ff79c94cde33dad","observation_id":"6e114bad-eacc-4fe1-806d-077627ac3e91","resolution":{"observed_at":"2026-05-15T12:17:01.401990Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05749","last_updated":"2023-06-15T17:57:21Z","snapshot_observed_at":"2026-08-04T07:39:34.440491Z","submitted_at":"2022-12-12T07:59:31Z","title":"On Pre-Training for Visuo-Motor Control: Revisiting a Learning-from-Scratch Baseline","version":2},"cited_work":{"arxiv_id":"2212.05749","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05749","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On pre-training for visuo-motor control: Re- visiting a learning-from-scratch baseline","venue":null,"work_id":"f5b4c66b-299e-47cd-9ffd-c35163f87abe","year":2022},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2212.05749","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:26a226523265b7d6ad00f110f77fcddcaef11532b02efe28b6a15cdfb584f902","observation_id":"9e91d310-6ef7-4c52-8155-d01b87350c2c","resolution":{"observed_at":"2026-05-15T12:17:01.405426Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05711","last_updated":"2023-02-16T16:23:31Z","snapshot_observed_at":"2026-07-06T14:29:20.607029Z","submitted_at":"2022-12-12T05:30:08Z","title":"CACTI: A Framework for Scalable Multi-Task Multi-Scene Visual Imitation Learning","version":2},"cited_work":{"arxiv_id":"2212.05711","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05711","snapshot_observed_at":"2026-07-03T06:17:42.050023Z","title":"Mandi, H","venue":null,"work_id":"00e7b2fc-ba57-4156-81ee-a5976ff32439","year":2022},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2212.05711","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:3f415c9d9e42c478d0c80010801a6be7bbc3e5611ad1546457d79d7ac1cfbe25","observation_id":"d4b4610d-f874-4e4d-8bde-0ad1a9df96eb","resolution":{"observed_at":"2026-05-15T12:17:01.409154Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06671","last_updated":"2023-02-22T19:18:28Z","snapshot_observed_at":"2026-07-06T14:51:26.249912Z","submitted_at":"2023-02-13T20:18:25Z","title":"GenAug: Retargeting behaviors to unseen situations via Generative Augmentation","version":2},"cited_work":{"arxiv_id":"2302.06671","doi":"10.48550/arxiv.2302.06671","metadata_source":"arxiv_reference","pith_arxiv_id":"2302.06671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Genaug: Retargeting behaviors to unseen situations via generative augmentation.arXiv preprint arXiv:2302.06671","venue":"arXiv (Cornell University)","work_id":"565773cd-2772-49a0-9530-b0dc8abd41a1","year":2023},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2302.06671","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:4559bddcb6cb754230d6624e4efff237951ddc23e7192fe519559606ad318a88","observation_id":"2eface9f-0b69-46e6-aab5-ff9407666e0b","resolution":{"observed_at":"2026-05-15T12:17:01.412942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11550","last_updated":"2023-02-22T18:47:51Z","snapshot_observed_at":"2026-08-05T16:16:51.134330Z","submitted_at":"2023-02-22T18:47:51Z","title":"Scaling Robot Learning with Semantically Imagined Experience","version":1},"cited_work":{"arxiv_id":"2302.11550","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.11550","snapshot_observed_at":"2026-07-04T03:59:33.605414Z","title":"Scaling Robot Learning with Semantically Imagined Experience","venue":"cs.RO","work_id":"2f271a06-2368-4648-9421-773e412695e6","year":2023},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2302.11550","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:026e7dcee2de3c074325b9352efefface06f4e1b42ab7024cf43061495dc6958","observation_id":"88853033-5351-4e2f-93a6-1eeb3d9c76af","resolution":{"observed_at":"2026-05-17T18:59:10.716066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00951","last_updated":"2024-09-02T05:25:34Z","snapshot_observed_at":"2026-07-06T19:09:06.022484Z","submitted_at":"2024-09-02T05:25:34Z","title":"Semantically Controllable Augmentations for Generalizable Robot Learning","version":1},"cited_work":{"arxiv_id":"2409.00951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00951","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semantically con- trollable augmentations for generalizable robot learn- ing","venue":null,"work_id":"e58f74a0-273c-4edf-ada3-e3ee9607e9a5","year":2024},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2409.00951","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:42cb961ba2d4978076c4c13908904f5009d5c816b35bc1a568a2b9ef6753876d","observation_id":"d2c9663e-4c73-4ba7-b74b-28ccb40ff8d0","resolution":{"observed_at":"2026-05-15T12:17:01.419280Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12422","last_updated":"2023-10-13T05:44:37Z","snapshot_observed_at":"2026-08-06T12:55:15.512516Z","submitted_at":"2023-02-24T02:54:15Z","title":"MimicPlay: Long-Horizon Imitation Learning by Watching Human Play","version":2},"cited_work":{"arxiv_id":"2302.12422","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.12422","snapshot_observed_at":"2026-07-09T22:16:36.400090Z","title":"Mim- icplay: Long-horizon imitation learning by watching hu- man play","venue":"cs.RO","work_id":"f1c0e860-19bf-4217-afb5-13797ab23385","year":2023},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2302.12422","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:a75ef393d5c5266712be0895671b0c6f8a7af605fe7cff2b584e01fa2a1e3c99","observation_id":"70bbd1db-041f-4bd2-b4ac-14488ad25a6f","resolution":{"observed_at":"2026-05-15T12:17:01.422183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Avid: Learning multi-stage tasks via pixel- level translation of human videos","venue":null,"work_id":"c7f13dc0-695f-453b-931b-8fee7e5951f3","year":2019},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:d5f4767eecc7ae5026cea2e9524b6c37329e04cdd0a2445b2e6a2f3c859be2c0","observation_id":"3cf8d654-abd3-400e-9331-bac419315b2b","resolution":{"observed_at":"2026-05-15T12:17:01.551434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning by watching: Physical imitation of manipulation skills from human videos","venue":null,"work_id":"ff491882-387a-4547-878f-62da0fd0a7bf","year":2021},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:0f6c362a4dca72eb6daa009cb88989fcdfa41d621bbfe4ed17d77b133e1b6b84","observation_id":"3b50430a-ba3b-4f55-b2f4-99b805b23cec","resolution":{"observed_at":"2026-05-15T12:17:01.485775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12943","last_updated":"2024-08-27T23:15:11Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:47:37Z","title":"Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers","version":2},"cited_work":{"arxiv_id":"2403.12943","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.12943","snapshot_observed_at":"2026-07-09T22:16:36.381522Z","title":"Vid2robot: End-to-end video-conditioned policy learning with cross-attention transformers","venue":"cs.RO","work_id":"09dec5e4-4840-45a1-ba7f-89d3d2792a01","year":2024},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2403.12943","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:d056037e134fa4d2b74bc994657e480ce06f7bd9506e63f5a4083cf37cc9fd61","observation_id":"1f54d54d-777c-4a64-807e-a2aad2cf201b","resolution":{"observed_at":"2026-05-15T12:17:01.425532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00025","last_updated":"2024-07-12T12:51:00Z","snapshot_observed_at":"2026-07-06T17:09:59.848387Z","submitted_at":"2023-12-28T23:34:43Z","title":"Any-point Trajectory Modeling for Policy Learning","version":3},"cited_work":{"arxiv_id":"2401.00025","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.00025","snapshot_observed_at":"2026-07-10T18:47:31.639635Z","title":"Any-point Trajectory Modeling for Policy Learning","venue":"cs.RO","work_id":"0c843c6a-ce05-4ca4-992b-e25516f490db","year":2023},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2401.00025","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:8676f32fcc70a7c01125beeab7f5b220f17c79224582dcec7464488857ed9c97","observation_id":"9d923a03-5578-4a3a-b4c0-ed998836fb2c","resolution":{"observed_at":"2026-05-16T23:32:51.209901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01977","last_updated":"2023-11-06T05:53:08Z","snapshot_observed_at":"2026-08-07T20:30:49.785912Z","submitted_at":"2023-11-03T15:31:51Z","title":"RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches","version":2},"cited_work":{"arxiv_id":"2311.01977","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.01977","snapshot_observed_at":"2026-07-04T17:09:59.550952Z","title":"Rt-trajectory: Robotic task generalization via hindsight trajectory sketches","venue":null,"work_id":"cfaa2d68-1521-4065-b84f-c32f5a2e061d","year":2023},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2311.01977","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:d14b644bf381e01a33715cccd9dd4145b8cc30895124200e371c880032e220da","observation_id":"c96e3811-4559-41b1-b808-f6cb0002dd61","resolution":{"observed_at":"2026-05-15T12:17:01.433049Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.05877","last_updated":"2022-07-06T17:57:48Z","snapshot_observed_at":"2026-07-06T11:37:52.596961Z","submitted_at":"2021-08-12T17:51:18Z","title":"DexMV: Imitation Learning for Dexterous Manipulation from Human Videos","version":5},"cited_work":{"arxiv_id":"2108.05877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.05877","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dexmv: Imitation learning for dexter- ous manipulation from human videos","venue":null,"work_id":"a6869a8f-40ec-4abf-a24a-44a3b6dcb964","year":2021},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2108.05877","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:1dc7864464e59059b2a70c2a764e915b417aaa92da39548e8f338ba4dcfd435c","observation_id":"64fcfebe-f006-4170-85eb-a28f636074d3","resolution":{"observed_at":"2026-05-15T12:17:01.437100Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videodex: Learning dexterity from internet videos","venue":null,"work_id":"d8b466df-bfd7-49ba-97ba-3329d3591c43","year":null},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:9972dc1f44d9fdc42153e1e92720db5d16f0ff2ad0558f2fdcc4c2884e684052","observation_id":"4245b2aa-722e-4f7a-a76b-1ca923fe1e8b","resolution":{"observed_at":"2026-05-15T12:17:01.513063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Where2act: From pixels to actions for articulated 3d objects","venue":null,"work_id":"5973907e-a8c2-4210-a945-5a80b4fef968","year":2021},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:db4f14bdbdec8d75d04dbf7f33fe28ead9e42902a0d6d0d722f7805b321ca80f","observation_id":"4e1848e7-fb48-4a1f-a269-e490b8e25ee9","resolution":{"observed_at":"2026-05-15T12:17:01.516846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human hands as probes for interactive object understanding","venue":null,"work_id":"f6aa44bb-0b3a-40bc-b32a-a23619598fad","year":2022},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:1d5f924dbfa6f12d171846f7d3d91f0c29cce8a47df4c5b7cb9070a8a5d4b6c4","observation_id":"1d3fa5f2-3831-49e3-98b4-7cb33c6eba2e","resolution":{"observed_at":"2026-05-15T12:17:01.533627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Affordances from human videos as a versatile repre- sentation for robotics","venue":null,"work_id":"4c5d5913-682c-438a-9921-daf47f918aff","year":2023},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:22bf6ff06d91eb964ed1e2c5e6854ed26ab39bb36721b92d0a55431787c8efcd","observation_id":"91261a19-8a5c-4e5b-b19a-1bf4baf0218c","resolution":{"observed_at":"2026-05-15T12:17:01.537571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Joint hand motion and interaction hotspots prediction from egocentric videos","venue":null,"work_id":"ad367549-0d45-4b85-ae19-d43b2ad395c8","year":2022},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:cfcbbf76a88c34e0220f1f284941d28331b7cc771bfc9acca3c273218d024529","observation_id":"a5966486-76eb-450b-b99d-79fb33993a1a","resolution":{"observed_at":"2026-05-15T12:17:01.542481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11439","last_updated":"2024-09-23T08:22:04Z","snapshot_observed_at":"2026-07-06T17:18:24.209069Z","submitted_at":"2024-01-21T09:39:11Z","title":"General Flow as Foundation Affordance for Scalable Robot Learning","version":2},"cited_work":{"arxiv_id":"2401.11439","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.11439","snapshot_observed_at":"2026-07-04T00:59:20.351948Z","title":"General flow as foundation affordance for scalable robot learning","venue":null,"work_id":"381d4337-f34d-42ae-b383-a2e863d0e96e","year":2024},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2401.11439","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:6e291956c750df1229f241a9e565222f3b2a1c6bf37ab536ecc2218b8662d81b","observation_id":"0e72634c-d6a0-4311-8398-3e1dea8e9aec","resolution":{"observed_at":"2026-05-15T12:17:01.441350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human-to-robot imitation in the wild","venue":null,"work_id":"66058a69-8632-4bae-8496-0d03d6ae5f9e","year":2022},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:9dc9cc420dfc927d0280820032988ee5e2c6672f4ce4ebad5ed590aa5dc76b32","observation_id":"becc446e-6b9d-4e36-91f0-d29dac873279","resolution":{"observed_at":"2026-05-15T12:17:01.489583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning uni- versal policies via text-guided video generation","venue":null,"work_id":"2a769e7f-dd84-4f39-be0b-06e43fdd472b","year":2024},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:cab21321909eb6176700bffc050bba3676126c0e9613db559c304367d61162e7","observation_id":"2b69c09b-b1ef-4666-b09b-fd3893a9cedb","resolution":{"observed_at":"2026-05-15T12:17:01.493353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-04T07:35:11.914654Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":"2406.16862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-07-08T02:04:26.253123Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":"cs.RO","work_id":"45d8eed6-8b6f-40b3-99c2-eb10a736919a","year":2024},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:1c287061d2af7e491acd405de690b9a9677283685499291ba608f89a5c0982ce","observation_id":"7bf51a50-cdb3-450e-b276-1f093362f7a4","resolution":{"observed_at":"2026-05-15T12:17:01.445669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12957","last_updated":"2025-04-03T10:12:23Z","snapshot_observed_at":"2026-08-05T18:47:38.188906Z","submitted_at":"2024-07-17T18:59:56Z","title":"R+X: Retrieval and Execution from Everyday Human Videos","version":2},"cited_work":{"arxiv_id":"2407.12957","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.12957","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Papagiannis, N","venue":null,"work_id":"d807b706-9059-482a-8753-6284b077fe7f","year":2024},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2407.12957","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:25a09a0dec6b669d881f92e4e5900549aca09cc3ab221f18e6ebfbde81f3b7fc","observation_id":"900bbbef-4de8-4dec-ab25-df54be801184","resolution":{"observed_at":"2026-05-15T12:17:01.449995Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"6c3d2a68-60c3-4b02-b0ef-69cb74db34e0","year":2022},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:e2f9904bb3490f7b31cbbdae35a6dbfe1c8b459de0718791cef2ef63c10ec4e1","observation_id":"a06c4e4c-ec49-4a0d-9d53-a46f67e4747c","resolution":{"observed_at":"2026-05-15T12:17:01.546960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tap-vid: A benchmark for tracking any point in a video","venue":null,"work_id":"4d822770-ea49-4bcc-8adc-e9465f559741","year":2022},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:8d50156473c96fcf855e4b65e73797a104fe58135823c3e544ba3c939d6480de","observation_id":"6d351fc8-c2ce-42c3-b269-b3351e08da37","resolution":{"observed_at":"2026-05-15T12:17:01.497655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:33f9d7b3f171179d2850601052e8da995aed3655766f8f974b17039d2307ec77","observation_id":"7bb7d616-0b54-4b64-8b57-ec4ccfe51c8a","resolution":{"observed_at":"2026-05-15T12:17:01.453650Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07635","last_updated":"2024-10-01T13:15:53Z","snapshot_observed_at":"2026-08-05T15:59:10.206778Z","submitted_at":"2023-07-14T21:13:04Z","title":"CoTracker: It is Better to Track Together","version":3},"cited_work":{"arxiv_id":"2307.07635","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.07635","snapshot_observed_at":"2026-07-04T04:09:35.241753Z","title":"Co- tracker: It is better to track together","venue":null,"work_id":"9adcbb8b-e11d-42be-85be-0061a3bf7152","year":2024},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2307.07635","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:924f64260c4509b93b420143e9bcee5de5ba53bea89114f941ed683f455756ab","observation_id":"456b8d1e-b1a5-4096-9054-ee170a717df0","resolution":{"observed_at":"2026-05-15T12:17:01.458795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dense optical tracking: connecting the dots","venue":null,"work_id":"e154c2a9-84ed-4598-b5d0-756c755ab8a1","year":2024},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:3ec0e397e90cb9e124179fa6f18c538000cc63963025664d8134dbfe949a8425","observation_id":"0876b1eb-637b-4417-b8e9-5e2d9a722a20","resolution":{"observed_at":"2026-05-15T12:17:01.501918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":29,"verified_fuzzy":28},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 70 inbound Pith citation observations for arXiv:2409.16283."}