{"as_of":"2026-08-07T11:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:be94c9ad1154fd0bbc33530be2c0032c8742f6612a01d9b1bba890aebf303167","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:11:17.990150Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06332/citation-record","integrity":"/paper/2608.06332/integrity","json":"/paper/2608.06332/citation-record.json","paper":"/paper/2608.06332"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T05:11:17.594402Z","title":"π 0: A vision- language-action flow model for general robot control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.594402Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:10e8c147bad500f112c522cefc380e2e1651038907c2869a171df223df0a2cff","observation_id":"b3c1590b-7162-40e3-a853-2548c2fbc433","resolution":{"observed_at":"2026-08-07T05:11:17.594402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-08-07T05:11:17.604459Z","title":"π ∗ 0.6: A vla that learns from experience,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.604459Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:39a32e76e16071fabd7cbded1e4eebb60a0653f3648240deda06f8160b970511","observation_id":"f3a19400-cf9c-4586-b656-e8548313dd0c","resolution":{"observed_at":"2026-08-07T05:11:17.604459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-05T18:18:04.172934Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15483","snapshot_observed_at":"2026-08-07T05:11:17.610357Z","title":"π 0.7: A steer- able generalist robotic foundation model with emergent capabilities,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.610357Z"},"links":{"cited_paper":"/paper/2604.15483","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:0e3f94308c2f886999889f37b31848c3c5caa36a40f08bf5f42b5428c4f9299a","observation_id":"5fd2d64c-35f1-4c47-8f22-cc542e4bbec8","resolution":{"observed_at":"2026-08-07T05:11:17.610357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-07T05:11:17.616274Z","title":"π 0.5: A vision-language-action model with open-world generalization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.616274Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:fa14e2bd0f230cd2ac35191c26f1d617f1a48ccfb175092e3a018b494d55a688","observation_id":"a51a16cb-a0d6-483a-8409-c898457337e3","resolution":{"observed_at":"2026-08-07T05:11:17.616274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-07T05:11:17.622778Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.622778Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:fe52b9b0948e800b928235a910d797a79715a0a852645bbac99cfa13f3540de3","observation_id":"6bfad3f2-9f34-4e94-ab6f-f6f87bbcd5a2","resolution":{"observed_at":"2026-08-07T05:11:17.622778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-02T07:15:58.798604Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-07T05:11:17.628322Z","title":"Gemini robotics: Bringing ai into the physical world,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.628322Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:726909a23a469045a7b18910bd882d7214a88cb63e1d8b6e93b263db1c458952","observation_id":"7763ba59-9128-4887-b808-8d049e92a5ef","resolution":{"observed_at":"2026-08-07T05:11:17.628322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-02T21:37:08.464741Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.19710","snapshot_observed_at":"2026-08-07T05:11:17.634768Z","title":"Posevla: Universal pose pretraining for generalizable vision- language-action policies,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.634768Z"},"links":{"cited_paper":"/paper/2602.19710","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:a77fe38ce250a8287edea264d3753422be8d0399b1a7f3d32b11db4cf809939c","observation_id":"debb4867-1ec5-4d65-ac42-eeedc4ffc602","resolution":{"observed_at":"2026-08-07T05:11:17.634768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:20.117198Z","title":"Dreamvla: a vision-language-action model dreamed with comprehensive world knowledge,","venue":null,"work_id":"5c9e2339-b993-46f5-9bdd-d73feb0d8e4d","year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.639789Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:f729346f6b74cd931b783297b64b138819d6e6d58da34f46036f31c221658cb1","observation_id":"474621e8-ffaf-44d8-88e0-404d9d07dc06","resolution":{"observed_at":"2026-08-07T05:11:20.124763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-08-07T05:11:17.644815Z","title":"Causal world modeling for robot control,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.644815Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:4c133509a4725c966d7b607e1820926dd83185c2cbbe4c764d4307982877a381","observation_id":"3904f0db-495c-4051-9593-514b82273844","resolution":{"observed_at":"2026-08-07T05:11:17.644815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-08-07T05:11:17.651486Z","title":"World action models are zero- shot policies,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.651486Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:6b86fc8d4ea795d439051bcf1c0b47b196e8f5853501e144e80c604ccfe8e2ac","observation_id":"252a8911-3062-4e30-a32e-8ea75c06dd6a","resolution":{"observed_at":"2026-08-07T05:11:17.651486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.16391","last_updated":"2026-03-27T17:20:10Z","snapshot_observed_at":"2026-07-06T23:03:43.854612Z","submitted_at":"2026-03-27T17:20:10Z","title":"Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.16391","snapshot_observed_at":"2026-08-07T05:11:17.656989Z","title":"Dis- entangled robot learning via separate forward and inverse dynamics pretraining,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.656989Z"},"links":{"cited_paper":"/paper/2604.16391","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:9efd23c8359a06b0ff90d82eef3d7cfc2f0585159a9384df7eb8c7f0129ce5cc","observation_id":"1a3694ce-4ac7-40f3-9869-fb8aa9271f21","resolution":{"observed_at":"2026-08-07T05:11:17.656989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-07-06T22:49:23.750692Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-08-07T05:11:17.662393Z","title":"Fast-wam: Do world action models need test-time future imagination?","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.662393Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:705909c8aa8984deebf46a99369d0fe2860692881c348db61411693ed2c943c1","observation_id":"274cf5f1-2df4-4f45-9a0c-b4300f79d817","resolution":{"observed_at":"2026-08-07T05:11:17.662393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.03827","last_updated":"2026-05-25T08:44:07Z","snapshot_observed_at":"2026-08-07T03:52:23.114381Z","submitted_at":"2025-10-04T14:56:40Z","title":"LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.03827","snapshot_observed_at":"2026-08-07T05:11:17.668619Z","title":"Libero-pro: Towards robust and fair evaluation of vision-language-action models beyond memorization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.668619Z"},"links":{"cited_paper":"/paper/2510.03827","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:f0b6b253abfc4267d434aec2fe5c1d202a303c37aa3112346b02459c3ab2e6e1","observation_id":"db22e7d6-5501-4104-aa74-41f1b1a8d369","resolution":{"observed_at":"2026-08-07T05:11:17.668619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-07-06T22:32:42.381894Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-08-07T05:11:17.673796Z","title":"Libero-plus: In-depth robustness analysis of vision- language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.673796Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:7f04a114490c9e6348c1445e50706e14039fda5f1d5f54c32210933fb34ffca1","observation_id":"f4aaf29f-d340-49a8-8d5a-4c5506dcef75","resolution":{"observed_at":"2026-08-07T05:11:17.673796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-08-07T05:11:17.681017Z","title":"Robotwin 2.0: A scalable data generator and benchmark with strong domain randomization for robust bimanual robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.681017Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:95c6205df2cb7cfd28ddaca0e59ef015aaab973590092f81e40f78cc047b8d26","observation_id":"3579ca27-3fb3-401a-a797-651b54f99b76","resolution":{"observed_at":"2026-08-07T05:11:17.681017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.17846","last_updated":"2026-06-17T17:06:39Z","snapshot_observed_at":"2026-08-01T08:00:11.218777Z","submitted_at":"2026-06-16T12:14:39Z","title":"Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.17846","snapshot_observed_at":"2026-08-07T05:11:17.686150Z","title":"Qwen-robotmanip technical report: Alignment unlocks scale for robotic manipulation foundation models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.686150Z"},"links":{"cited_paper":"/paper/2606.17846","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:b8a5e74f1d35fac8fb699b6e4616add7a0620aba402506d60163eea98a62ba01","observation_id":"ca2363f2-ee95-4de9-a150-5722fb4947f1","resolution":{"observed_at":"2026-08-07T05:11:17.686150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13515","snapshot_observed_at":"2026-08-07T05:11:17.691160Z","title":"Maskwam: Unifying mask prompting and prediction for world-action models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.691160Z"},"links":{"cited_paper":"/paper/2606.13515","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:585788bed1944ba8ccbe476d6064147f1fedcda1bb1d20415a0a71d7106ce078","observation_id":"04b6c163-2a80-4367-a190-1ccbe7ed3311","resolution":{"observed_at":"2026-08-07T05:11:17.691160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10125","last_updated":"2026-03-01T08:24:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-11T09:13:10Z","title":"Ctrl-World: A Controllable Generative World Model for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10125","snapshot_observed_at":"2026-08-07T05:11:17.696014Z","title":"Ctrl-World: A control- lable generative world model for robot manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.696014Z"},"links":{"cited_paper":"/paper/2510.10125","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:5f4c95355a5561b152524b0ea688f50de881fc2c6e7fd5e466e6d4d852f92dd1","observation_id":"d40e0fc6-062b-4f56-b5c5-6f0975c049c7","resolution":{"observed_at":"2026-08-07T05:11:17.696014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:20.093427Z","title":"IRASim: A fine-grained world model for robot manipulation,","venue":null,"work_id":"0f118065-1f12-4bfa-a4ed-7a4cd15b31be","year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.700583Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:3fa2243c1187e335c198c0d20c03b7c6cd0bdf392bcb5ebc1d5f289749d46054","observation_id":"466d0343-4f37-456c-aa83-6601baeaf043","resolution":{"observed_at":"2026-08-07T05:11:20.101037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19017","last_updated":"2025-05-25T07:41:39Z","snapshot_observed_at":"2026-08-06T03:07:18.946160Z","submitted_at":"2025-05-25T07:41:39Z","title":"WorldEval: World Model as Real-World Robot Policies Evaluator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19017","snapshot_observed_at":"2026-08-07T05:11:17.705904Z","title":"WorldEval: World model as real-world robot policies evaluator,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.705904Z"},"links":{"cited_paper":"/paper/2505.19017","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:2c710cb720c20e91343c117cfe0fdb1a36409a481b3d27f8f62b35887f79c90c","observation_id":"1efbc45b-6309-4498-9073-605d916260f6","resolution":{"observed_at":"2026-08-07T05:11:17.705904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.712503Z","title":"WorldGym: World model as an environment for policy evaluation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.712503Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:1cb7c7695a5afae3b485302dea499ab3852b7b29777ffdf2175e3134e622b0f5","observation_id":"10c29778-2a76-49a8-a449-42eaa6be5d4c","resolution":{"observed_at":"2026-08-07T05:11:17.712503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.718054Z","title":"Interactive world simulator for robot policy training and evaluation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.718054Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:df40d2497373db95c39ae7f3dbc23105e48d33a0e5f41bada52e466dcef67c93","observation_id":"a4688c2d-8124-43c9-abcd-0885f16a2871","resolution":{"observed_at":"2026-08-07T05:11:17.718054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:20.070624Z","title":"World Models - David Ha, J ¨urgen Schmidhuber","venue":null,"work_id":"41ea05c1-30ce-4a93-ab81-acdb65483816","year":null},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.726140Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:5b9f8c5d42f69ea7a8b3d7ac20270c01ff28adabaa653401b698719bdbe381d7","observation_id":"f6fd4601-167a-4dab-bccb-c03d44332628","resolution":{"observed_at":"2026-08-07T05:11:20.076916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:20.041890Z","title":"Hafner, T","venue":null,"work_id":"4e39ddda-c4e7-4deb-8207-919499a3c548","year":null},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.732395Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:415e8daef8da9b2c06db60b0bd9ce5183b5cfaf5bc4295368d0dc4d2766c0f80","observation_id":"bb782729-114b-429f-8e8c-0b5cfa977969","resolution":{"observed_at":"2026-08-07T05:11:20.048968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:20.012354Z","title":null,"venue":null,"work_id":"731926f8-a0f1-4324-8262-4d7625c8f697","year":null},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.739120Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:b47b4136e70cb75184302c82ac619903df65e2eeba4fff2708a757a337e831a9","observation_id":"e6c78d16-a765-4c55-927f-467ad3d227d7","resolution":{"observed_at":"2026-08-07T05:11:20.019825Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.748919Z","title":"Genie: Generative interactive environments,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.748919Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:c802da96b6be3cbb1dc1976461536a7bac3fb324b2d2aa0fb02ce3732a759571","observation_id":"42c8384e-44dc-4019-8fb3-3355106f403e","resolution":{"observed_at":"2026-08-07T05:11:17.748919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-07T05:11:17.757751Z","title":"V-jepa 2: Self- supervised video models enable understanding, prediction and plan- ning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.757751Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:65b0ce3f4ebfe530e60f7a2541801bce4c7f081d297563c43e22894827d8521f","observation_id":"831b2afe-299f-43aa-a172-c960198c1d77","resolution":{"observed_at":"2026-08-07T05:11:17.757751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:19.958464Z","title":"Agarwal, A","venue":null,"work_id":"fcf11063-577f-434c-be72-610f216a9fc9","year":null},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.764869Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:9933eb16f56a58c0bed7dee77b76f47c2a79f64c2904101d4523f3607e8059c1","observation_id":"870dbbd3-3a69-4319-b599-4b876652d7ba","resolution":{"observed_at":"2026-08-07T05:11:19.966354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15840","last_updated":"2026-05-08T06:37:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:35:54Z","title":"Large Video Planner Enables Generalizable Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15840","snapshot_observed_at":"2026-08-07T05:11:17.770649Z","title":"[Online]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.770649Z"},"links":{"cited_paper":"/paper/2512.15840","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:7086788a9e5368a1f97556af3eb4127fad43be5652608dd12d587e0d7f723d74","observation_id":"3b1be4ce-656f-41ae-899c-4ead8ad32996","resolution":{"observed_at":"2026-08-07T05:11:17.770649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:19.932471Z","title":null,"venue":null,"work_id":"39636c79-03e3-45de-ac8b-a3e10571c573","year":null},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.781509Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:4398d51639d551749a732fb13591678e71684e081a7c7c25b09242d52b533ecb","observation_id":"6171344a-c19b-471b-a0b4-bd09e53733e3","resolution":{"observed_at":"2026-08-07T05:11:19.940991Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.788447Z","title":"ivideogpt: Interactive videogpts are scalable world models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.788447Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:7f252442080999a61b6b0476322c95469a67b17ae1af155b5bf7e080e9ff9332","observation_id":"e819d89a-b37a-43e1-be7a-ebde16e6bce9","resolution":{"observed_at":"2026-08-07T05:11:17.788447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.795654Z","title":"Evaluating gemini robotics policies in a veo world simulator,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.795654Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:7218c60b12af3a9a661521e606bdbf11b1fbd99b0780c2795b490d1111f05dfa","observation_id":"530dc5a3-2cb8-41b0-ba17-abd46064ea77","resolution":{"observed_at":"2026-08-07T05:11:17.795654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06114","snapshot_observed_at":"2026-08-07T05:11:17.804072Z","title":"Learning interactive real-world simulators,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.804072Z"},"links":{"cited_paper":"/paper/2310.06114","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:9c2a012d78c7100f52d2565ec6250f3b0a3c8d03b7c90d5bc992fb7ddea314ca","observation_id":"4155f45b-5150-4905-ab74-6f1f1797ea4d","resolution":{"observed_at":"2026-08-07T05:11:17.804072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07288","last_updated":"2026-05-08T05:54:33Z","snapshot_observed_at":"2026-07-06T23:19:41.053744Z","submitted_at":"2026-05-08T05:54:33Z","title":"Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07288","snapshot_observed_at":"2026-08-07T05:11:17.810535Z","title":"Sword: Style-robust world models as simulators via dynamic latent bootstrapping for vla policy post-training,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.810535Z"},"links":{"cited_paper":"/paper/2605.07288","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:e44b14ebab3dbbaa7766578ea02cb899f2bc86b67b24ebe47d63c0abf464eff3","observation_id":"b6b144a6-4949-4c75-adf5-f0a2cb03c398","resolution":{"observed_at":"2026-08-07T05:11:17.810535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.13977","last_updated":"2026-06-27T16:11:05Z","snapshot_observed_at":"2026-08-02T23:23:50.481908Z","submitted_at":"2026-02-15T03:48:20Z","title":"WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.13977","snapshot_observed_at":"2026-08-07T05:11:17.824972Z","title":"Wovr: World models as reliable simulators for post-training vla policies with rl,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.824972Z"},"links":{"cited_paper":"/paper/2602.13977","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:1fe182521423e6c38df2d601cdc4791390f8e5a8563dc58ffcffd0445c6b63f2","observation_id":"bbc74074-8a62-4382-a261-7ddb222e8ee3","resolution":{"observed_at":"2026-08-07T05:11:17.824972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.830315Z","title":"Wmpo: World model-based policy optimization for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.830315Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:a104afd87756bad03e4ab32cc6be7cafa0950e6fb4d5e31d82f7e5d03818784e","observation_id":"35cfe258-3b13-492d-8991-1a0170f92534","resolution":{"observed_at":"2026-08-07T05:11:17.830315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09723","last_updated":"2025-05-14T18:30:53Z","snapshot_observed_at":"2026-07-06T21:24:01.607451Z","submitted_at":"2025-05-14T18:30:53Z","title":"EnerVerse-AC: Envisioning Embodied Environments with Action Condition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09723","snapshot_observed_at":"2026-08-07T05:11:17.835311Z","title":"EnerVerse-AC: Envisioning embodied environments with action con- dition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.835311Z"},"links":{"cited_paper":"/paper/2505.09723","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:f7aa05d4043a31f4708aee03f23dd10bb5c572c962687eab6bb3ed8f6b92d198","observation_id":"4511fb73-d591-4176-b44c-15fc8dfa2bf5","resolution":{"observed_at":"2026-08-07T05:11:17.835311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27491","last_updated":"2026-05-26T16:23:05Z","snapshot_observed_at":"2026-07-31T01:49:07.107998Z","submitted_at":"2026-05-26T16:23:05Z","title":"GE-Sim 2.0: A Roadmap Towards Comprehensive Closed-loop Video World Simulators for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2605.27491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.27491","snapshot_observed_at":"2026-08-07T05:11:18.646220Z","title":"GE-Sim 2.0: A Roadmap Towards Comprehensive Closed-loop Video World Simulators for Robotic Manipulation","venue":"cs.RO","work_id":"f7650954-a9f9-4dc6-9cd3-29580a8406ac","year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.840402Z"},"links":{"cited_paper":"/paper/2605.27491","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:57a48cc465ac65b053c23c04a2181e840579f1f7046883edfe8256d257286782","observation_id":"914a044b-f939-4326-9c76-3e5a03392f9f","resolution":{"observed_at":"2026-08-07T05:11:18.651607Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:19.859754Z","title":"Precise action-to-video generation through visual action prompts,","venue":null,"work_id":"1442ee5d-1415-4c61-8d81-6b9cbe02f105","year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.847265Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:37199f5ea939f8c5cf980fac9d00832cdd5201ebc6caa924ebc104695c08d18f","observation_id":"1ffa2ac4-f8ba-43d4-809c-87cb14b0b42a","resolution":{"observed_at":"2026-08-07T05:11:19.869356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.04463","last_updated":"2026-06-04T13:11:48Z","snapshot_observed_at":"2026-08-02T11:02:18.016581Z","submitted_at":"2026-06-03T05:16:41Z","title":"OSCAR: Omni-Embodiment Action-Conditioned World Model for Robotics","version":2},"cited_work":{"arxiv_id":"2606.04463","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.04463","snapshot_observed_at":"2026-08-07T05:11:18.613389Z","title":"OSCAR: Omni-Embodiment Action-Conditioned World Model for Robotics","venue":"cs.RO","work_id":"81de9bd4-ee30-43a2-bc4c-687a06dda2b2","year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.854274Z"},"links":{"cited_paper":"/paper/2606.04463","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:7805664e2fa82c9946618efe3ccd44153eaae4b810af003bae84033b3b92c0d0","observation_id":"35881728-cc8a-4fb7-9e51-4ef9be56320d","resolution":{"observed_at":"2026-08-07T05:11:18.620843Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.859738Z","title":"BridgeV2W: Bridging video generation models to embodied world models via embodiment masks,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.859738Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:d8b408ac13182796ea15e30fec09a17abfd4624d7a8d082fcbd3c882f72f3b72","observation_id":"50b1cc17-0b56-4d89-8119-eca4b6066bd1","resolution":{"observed_at":"2026-08-07T05:11:17.859738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.864519Z","title":"Kinema4d: Kinematic 4d world modeling for spatiotemporal embodied simula- tion,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.864519Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:488076d327de4506669799c2f4952bf16a945ce9c873c0d840378bd1af91da3e","observation_id":"3cbdfa84-c976-422d-8e5a-3f085be1fa6e","resolution":{"observed_at":"2026-08-07T05:11:17.864519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:19.832255Z","title":"Wan-move: Motion-controllable video generation via latent trajectory guidance,","venue":null,"work_id":"471e0865-3dd8-4ada-9cbe-629594e6445a","year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.868750Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:f575ec80ce904832c340f5251ef61c7ab969be5ce1b403f94f08985a98a59bfd","observation_id":"45711f35-90af-43a3-9c67-3d486039be46","resolution":{"observed_at":"2026-08-07T05:11:19.838537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11839","last_updated":"2025-08-03T09:06:58Z","snapshot_observed_at":"2026-08-04T14:15:13.344742Z","submitted_at":"2024-11-18T18:58:03Z","title":"RoboGSim: A Real2Sim2Real Robotic Gaussian Splatting Simulator","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11839","snapshot_observed_at":"2026-08-07T05:11:17.872884Z","title":"Robogsim: A real2sim2real robotic gaussian splatting simulator,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.872884Z"},"links":{"cited_paper":"/paper/2411.11839","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:aeed49677aca12df64df59df649822a214cb7dbf65a1f5c3b3a8be7140a149dd","observation_id":"8f86cc58-db33-49df-9c7e-baf89670324b","resolution":{"observed_at":"2026-08-07T05:11:17.872884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:19.802079Z","title":"High-fidelity simulated data generation for real-world zero-shot robotic manipulation learning with gaussian splatting,","venue":null,"work_id":"f0a0d9d1-9abd-441d-af73-e323d137e04a","year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.879658Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:2bddcc07f10f1d44dae7f12369fffd7affd097a343c6b988111d0c4a5fd94d0f","observation_id":"cd3a864e-192b-427b-9fae-27b49a3c43d7","resolution":{"observed_at":"2026-08-07T05:11:19.812478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13175","last_updated":"2025-04-17T17:59:43Z","snapshot_observed_at":"2026-08-06T15:49:25.486853Z","submitted_at":"2025-04-17T17:59:43Z","title":"Novel Demonstration Generation with Gaussian Splatting Enables Robust One-Shot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13175","snapshot_observed_at":"2026-08-07T05:11:17.886294Z","title":"Novel demonstration generation with gaussian splatting enables ro- bust one-shot manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.886294Z"},"links":{"cited_paper":"/paper/2504.13175","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:b85eecd79432f7d5486d63079098da5afe41ab37782bd11d4753ff5d247e73c6","observation_id":"87e8238a-5a44-4796-afee-303df3aa357c","resolution":{"observed_at":"2026-08-07T05:11:17.886294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.01773","last_updated":"2026-04-15T17:13:09Z","snapshot_observed_at":"2026-08-03T04:29:49.820139Z","submitted_at":"2025-12-01T15:15:04Z","title":"IGen: Scalable Data Generation for Robot Learning from Open-World Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.01773","snapshot_observed_at":"2026-08-07T05:11:17.893599Z","title":"Igen: Scalable data generation for robot learning from open-world images,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.893599Z"},"links":{"cited_paper":"/paper/2512.01773","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:efc92915fb1952bae664ea4cbeaebfc8b11593ad524c25fe57dbc6afe4e462e3","observation_id":"7fd1e8af-f8e1-4d31-bdd4-c9ac6e41649e","resolution":{"observed_at":"2026-08-07T05:11:17.893599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.898251Z","title":"Roboengine: Plug-and-play robot data augmentation with semantic robot segmen- tation and background generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.898251Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:e2358663c2cd846e508a93d947b9444659fd2255cadccb739a2bcf15215f2674","observation_id":"5f1f3f87-a1b2-4946-96cc-f6ca8b125fd3","resolution":{"observed_at":"2026-08-07T05:11:17.898251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.11797","last_updated":"2026-07-06T16:12:36Z","snapshot_observed_at":"2026-08-07T04:27:57.624555Z","submitted_at":"2025-12-12T18:59:45Z","title":"AnchorDream: Repurposing Video Diffusion for Embodiment-Aware Robot Data Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.11797","snapshot_observed_at":"2026-08-07T05:11:17.903025Z","title":"Anchordream: Repurposing video dif- fusion for embodiment-aware robot data synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.903025Z"},"links":{"cited_paper":"/paper/2512.11797","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:ee3ac709e6d20d0c9249b3b136272e3fabf9379096571f2a6af13eb4a7072db5","observation_id":"3ef0a90f-e8fe-42f6-82f9-453a3c8da551","resolution":{"observed_at":"2026-08-07T05:11:17.903025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-08-07T10:59:37.696746Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-08-07T05:11:17.907762Z","title":"Cosmos-transfer1: Conditional world generation with adaptive multimodal control,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.907762Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:a68a23d24e9c28c8bcd69ac7594d881be10301a006c9918ead632ecf3fb89d6c","observation_id":"a03fb650-5bff-4705-b7c1-4543145f788a","resolution":{"observed_at":"2026-08-07T05:11:17.907762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06949","last_updated":"2026-02-06T18:49:43Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T18:49:43Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.06949","snapshot_observed_at":"2026-08-07T05:11:17.912736Z","title":"Dream- Dojo: A generalist robot world model from large-scale human videos,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.912736Z"},"links":{"cited_paper":"/paper/2602.06949","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:e73507e459bea563f90aaadcdc009fa4f0523980c056916e617377ee65f1636e","observation_id":"06fa865d-1d02-4759-a6ec-42c3d7527766","resolution":{"observed_at":"2026-08-07T05:11:17.912736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12705","last_updated":"2025-06-17T22:33:35Z","snapshot_observed_at":"2026-07-06T21:26:01.534136Z","submitted_at":"2025-05-19T04:55:39Z","title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12705","snapshot_observed_at":"2026-08-07T05:11:17.917459Z","title":"Dreamgen: Unlocking generaliza- tion in robot learning through video world models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.917459Z"},"links":{"cited_paper":"/paper/2505.12705","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:b11006612c295d3f9c46d597e3d6dd68f4c3f3d9f72d1366e6e9477e5a1ba0b2","observation_id":"5b765615-2839-4146-8567-c720baeb93a1","resolution":{"observed_at":"2026-08-07T05:11:17.917459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:19.751579Z","title":null,"venue":null,"work_id":"08e68ae7-bbea-4792-ade9-c7c9300ad137","year":null},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.921893Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:40bcdbc18d807f5a0ddfb61f34b13dea5213865c73c8b171d0b81b6cd54bec9f","observation_id":"c686bb2d-a2d3-47e7-9adb-7c3090e1d244","resolution":{"observed_at":"2026-08-07T05:11:19.757981Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T05:11:17.926316Z","title":"Wan: Open and advanced large-scale video generative models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.926316Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:3539b65c76f7cb41b50afa1c3f93f5555c206340d7840f63722ea257d6ff4165","observation_id":"aea54a54-7f52-4346-9c5e-0c73fc65c0e5","resolution":{"observed_at":"2026-08-07T05:11:17.926316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:19.731555Z","title":"Self forcing: Bridging the train-test gap in autoregressive video diffusion,","venue":null,"work_id":"76fcb3d7-1c35-40aa-8d11-e08ee1c00857","year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.931131Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:c7eb3d906809eca7538c238c064c01db74151b490398f1eab06164a5f058b8f7","observation_id":"7c52a9ad-cbb8-4aad-803e-0179768028ef","resolution":{"observed_at":"2026-08-07T05:11:19.737577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T05:11:17.935956Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.935956Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:ab89e6b9575a6ab3f4e72050afa2b9ce27e43fc57dfc40f7f38dca3ad43b01cf","observation_id":"8ea7eb8b-fbd3-4b9b-9949-13b9b1965d24","resolution":{"observed_at":"2026-08-07T05:11:17.935956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.940525Z","title":"WorldArena: A unified benchmark for evaluating perception and functional utility of embodied world models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.940525Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:fb5d145a0dabdb6372dd9c78389ab0173706251122d7db0220dd1378f0e3369b","observation_id":"27b636e4-6861-418f-82a7-fdaf63314761","resolution":{"observed_at":"2026-08-07T05:11:17.940525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.945280Z","title":"Image quality assessment: from error visibility to structural similarity,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.945280Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:c7617be4dc7c849434c7d5262a7c218ec48590ded8237c892ff018fd937ada40","observation_id":"5e132b18-83cb-4a3d-90a8-ead660623db4","resolution":{"observed_at":"2026-08-07T05:11:17.945280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:19.696055Z","title":"The unreasonable effectiveness of deep features as a perceptual metric,","venue":null,"work_id":"d5afcc2a-b3ce-4831-8d78-4696b608c02e","year":2018},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.950096Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:9ff7af6557b78e0ebd0024cfb07be8c3ffa8ab524c91c4f1fdcfad310c478dba","observation_id":"4cce9cc0-31c5-4c0f-b706-e640fdc8a4b6","resolution":{"observed_at":"2026-08-07T05:11:19.703609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.954386Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.954386Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:95a248194ca529dd64634f3da121de1b8588ac3de7edb9bbfb040297184dc001","observation_id":"f30d3a87-2b19-4709-8ccc-5da2d8e21184","resolution":{"observed_at":"2026-08-07T05:11:17.954386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-07T05:11:17.958781Z","title":"Towards accurate generative models of video: A new metric & challenges,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.958781Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:afc82b06bc6e5e651542a293db4a0b50df4a2be0a465874bdf5cb9fea9906c3a","observation_id":"aedda6da-ee0d-4a4f-a02c-2a8dfdcf8e17","resolution":{"observed_at":"2026-08-07T05:11:17.958781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:19.656914Z","title":"Adding conditional control to text-to-image diffusion models,","venue":null,"work_id":"a1d200de-93bc-47b2-9d2e-5eaf8e3969bb","year":2023},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.971304Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:cfd2a31f1a49cba8bcd841da1abb6fbb938e84f4fa01cfcda45fe58018f53c4f","observation_id":"ef2b976c-b85a-4313-87b6-897a96a2b1f1","resolution":{"observed_at":"2026-08-07T05:11:19.664560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-07T05:11:17.976493Z","title":"Qwen3-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.976493Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:c4dc3d65197fbcb211ea1aad081d8cd48df57fde944d3412ef33aa57724ced3c","observation_id":"d3dfbd5e-ed53-423f-ae54-108891286054","resolution":{"observed_at":"2026-08-07T05:11:17.976493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T05:11:17.981086Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.981086Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:1f10fe016814ffd4474547988be6eb61a871c278226c776c88127836dde559a6","observation_id":"a3725577-0d46-4b91-b0b6-0c38e96bde01","resolution":{"observed_at":"2026-08-07T05:11:17.981086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:19.633254Z","title":"Introducing our latest image generation model in the API,","venue":null,"work_id":"296c55f3-94de-4499-9a77-76b3dc3971ef","year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.985725Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:c56e183968669ffdcff791bf834652c3d3d42828bfd340d11536172df805df2d","observation_id":"caf14684-d9b4-424b-8063-674dcc8406aa","resolution":{"observed_at":"2026-08-07T05:11:19.641811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-07T05:11:17.990150Z","title":"Qwen-image technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.990150Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:1fe75594c228c0e404e756d4c8b215c98b8bc16b20a15e5093229f9f05a4e3a0","observation_id":"9d5cc391-3755-40eb-9256-3a2231f6e657","resolution":{"observed_at":"2026-08-07T05:11:17.990150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T10:46:22.704526Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":2,"verified_fuzzy":12},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2608.06332."}