{"as_of":"2026-08-23T13:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4d43edb188612865066940ebbc167a93d5084df8f4911fc5e68becc8c562f74e","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T16:00:12.029377Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06558/citation-record","integrity":"/paper/2607.06558/integrity","json":"/paper/2607.06558/citation-record.json","paper":"/paper/2607.06558"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"Cosmos world foundation model platform for physical ai.arXiv preprint arXiv:2501.03575,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:92ac583bfca117adf617f6dfce61ed4c4e0de03e2979cac76ba1a7b903d7e565","observation_id":"053ba62d-ee32-4687-a1f1-fdf9cbe4275e","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"World simulation with video foundation models for physical ai.arXiv preprint arXiv:2511.00062,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:a432c181adc813799610c1529ee9f3ef7d0aedfd5e120bc42f065e221aedb7b4","observation_id":"4adbea7a-87ca-4f24-88db-2f9708cd9bd4","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-08-15T13:40:01.739055Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"V-jepa 2: Self-supervised video models enable understanding, prediction and planning.arXiv preprint arXiv:2506.09985,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:005833019f2ffd14c6050fc4f9c3c25fa9e5fbc1f869bfa304b83bb0fa363592","observation_id":"8aa45704-a5d1-431c-8922-6b5b68f0f6d3","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:569a68458360181b9d22dfddb3f7fa06aec42b1180d0fb5209756d382ffc7862","observation_id":"ad819841-ef1a-466d-8be8-ca58cd922a62","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:0a14f810a6de2309ce9897490b91143511e14a7e87a6a672964d208994623df1","observation_id":"cde56e8c-116c-47f8-83f2-a4f1dedc0e75","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"Lome: Learning human-object manipulation with action-conditioned egocentric world model.arXiv preprint arXiv:2603.27449,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:cf201f4910da81015d46b09b76709a8612bd043da18c1e0831e4ccc50af67df9","observation_id":"d589563d-cdd3-4603-a2c3-94be59fc6e70","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"World models can leverage human videos for dexterous manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:497b6e9410a6712088a07bd16c8496c11570be38fd702f17e216520755d5df68","observation_id":"93dcc281-fa5f-4ca7-bbd3-da068ac687cc","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.11606","last_updated":"2026-06-24T16:15:02Z","snapshot_observed_at":"2026-08-20T09:56:37.343062Z","submitted_at":"2026-03-12T06:59:44Z","title":"Articulat3D: Reconstructing Articulated Digital Twins From Monocular Videos with Geometric and Motion Constraints","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.11606","snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"Articulat3d: Reconstructing articulated digital twins from monocular videos with geometric and motion constraints","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"cited_paper":"/paper/2603.11606","citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:d598b625016b2643a7802427457a72a7f59244c33c0083eac243ca0285085ae6","observation_id":"253afc3b-dd08-49e0-a4ba-f5331e113fd7","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-08-18T07:04:58.690133Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"World models.arXiv preprint arXiv:1803.10122, 2(3):440,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:216cf12f511b89ff2b44042181b5427e7d716cb3d76b0d2731a616b21a88864a","observation_id":"b46a4bfb-85c4-4f4c-83fc-475a53909500","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.01001","last_updated":"2026-07-01T11:45:08Z","snapshot_observed_at":"2026-08-14T09:05:46.723245Z","submitted_at":"2026-04-01T15:00:46Z","title":"EgoSim: Egocentric World Simulator for Embodied Interaction Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.01001","snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"Egosim: Egocentric world simulator for embodied interaction generation.arXiv preprint arXiv:2604.01001,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"cited_paper":"/paper/2604.01001","citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:c37aa7ccc41ba19f6ec4d6860bb918df16f4f52b575b84d2a5394367800506b8","observation_id":"9fb6b553-b25d-418a-ac95-9bb7ce5247e6","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11709","last_updated":"2026-03-09T06:44:42Z","snapshot_observed_at":"2026-08-12T03:35:51.024147Z","submitted_at":"2025-05-16T21:34:47Z","title":"EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11709","snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"Egodex: Learning dexterous manipulation from large-scale egocentric video.arXiv preprint arXiv:2505.11709,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"cited_paper":"/paper/2505.11709","citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:022f3adbc281af6dd47b0e13a5d8890f562473815fcc11f1f682b3fca7baf6ba","observation_id":"2119797b-6cc3-4330-8beb-13c1c96716a8","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-15T15:02:59.826496Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"Self forcing: Bridging the train-test gap in autoregressive video diffusion.arXiv preprint arXiv:2506.08009,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:215778687d54d9e58c026b379b4a1eb88e8499eea72fa028d4a7818128ab59f1","observation_id":"0cb9fb28-c565-4bf7-a9d0-3edb61117ac4","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"arXiv preprint arXiv:2504.16054,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:c8b75f72a40c37467716659add07526d6da55fbf25e26e010df99dd6c6fcf791","observation_id":"14642aeb-958f-43fd-92e2-cdd707d0d540","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"Pyramidal flow matching for efficient video generative modeling.arXiv preprint arXiv:2410.05954,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:417be40011ebfb5e9382228267ed5343019b634b8a3c4285be4a529cd2dd715a","observation_id":"5ed8c0bb-b795-4052-8ea5-6608473382d7","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:890c77d77cd2fb8a7d1adbb9997994876b9d9d19997b63fe070175cdac92ff9b","observation_id":"5bc81340-dc37-4102-8bc0-b26db949aef8","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:eaadb80ebf0949c224c63ba18c802ebc97462e2dd18b2fe9e3d79234fd8f3ea6","observation_id":"eb16110b-7d78-427c-8b25-ed0f66a3b659","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09976","last_updated":"2025-08-13T17:43:34Z","snapshot_observed_at":"2026-08-16T10:24:50.531684Z","submitted_at":"2025-08-13T17:43:34Z","title":"Masquerade: Learning from In-the-wild Human Videos using Data-Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09976","snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"Masquerade: Learning from in-the-wild human videos using data-editing.arXiv preprint arXiv:2508.09976, 2025a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"cited_paper":"/paper/2508.09976","citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:7c41066d4ae76a5dec74a9f5f6993c437a2d5deeebb8470e3d85d8f226ea870b","observation_id":"acd2032f-1747-450d-b3df-4351ab9e95c9","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"Egocontrol: Controllable egocentric video generation via 3d full-body poses.arXiv preprint arXiv:2511.18173,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:50c3ec3d3cf57d57d29bed3ec475a515b152356f7a367ab6ac322479f0a1abae","observation_id":"a8d5cb5d-5219-4c24-9d3d-7944eb7b17e4","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:d840cc12594c4117bfa7e27f0cc16971b663b386948bdc51b2fb7c433653ba5d","observation_id":"bbcb3589-5263-42b3-8278-29e7d28401b1","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"Mitty: Diffusion-based human-to-robot video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:bf09f32978df4e2b822cf476649ff38db6b8a8ec1319fb45810d7d7fd4bb00a2","observation_id":"23517047-6ef8-4d64-b1d3-f604f2ac5c2d","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"Playerone: Egocentric world simulator","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:c3402f8b686051cd0384d3d639718a345d9bc5caa8b1e075a8e72adab05d0064","observation_id":"e8f70862-8913-42de-9a61-e64b9efe76bb","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:c34473fd2d057b2db36c0795ef01cc135dfa0e9beb2108b27377c2af61e7fb4d","observation_id":"f74a65e2-5779-49e9-96bf-0570a455d491","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"Generated reality: Human-centric world simulation using interactive video generation with hand and camera control.arXiv preprint arXiv:2602.18422,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:6514ed9318cb0e8fb3840102c41be4dcf14e9620eb99828e182d07296fbd69ef","observation_id":"864c364a-f638-4966-bb37-baa7ae2f4ee2","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"X-humanoid: Robotize human videos to generate humanoid videos at scale.arXiv preprint arXiv:2512.04537,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:3fd3e8b2180885e332fa2fdda1b6a766b916fc0eccb84edf6ea47d462e7081ca","observation_id":"d29ed85c-b51b-485f-b983-b95a0d59ac34","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:7103e10b3f5b4d3e7cbf47cf1fd875614a2d0f619cc67d2dcdf1bf90a8f20b55","observation_id":"363633e3-4301-47dc-8170-86a64b935e6b","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02833","last_updated":"2025-05-05T17:59:03Z","snapshot_observed_at":"2026-08-19T19:56:45.362691Z","submitted_at":"2025-05-05T17:59:03Z","title":"TWIST: Teleoperated Whole-Body Imitation System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02833","snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"Twist: Teleoperated whole-body imitation system.arXiv preprint arXiv:2505.02833,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"cited_paper":"/paper/2505.02833","citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:85c16837cc2b1eb2d1e12ebf4719808c9bba5bc8c84a176cec897aedc9f2d49d","observation_id":"08dd2b80-9d09-4751-821e-7769725df999","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17872","last_updated":"2024-09-10T01:27:28Z","snapshot_observed_at":"2026-08-19T13:49:35.545537Z","submitted_at":"2024-05-28T06:48:02Z","title":"HFGS: 4D Gaussian Splatting with Emphasis on Spatial and Temporal High-Frequency Components for Endoscopic Scene Reconstruction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17872","snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"Hfgs: 4d gaussian splatting with emphasis on spatial and temporal high-frequency components for endoscopic scene reconstruction.arXiv preprint arXiv:2405.17872,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"cited_paper":"/paper/2405.17872","citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:eac6b2cac37851b7968b4a67fc3b0241a73b1fc6b9782a47628116d21a43a6d4","observation_id":"cc7ab96b-b693-4ba4-afc3-f23bbafed6cd","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19463","last_updated":"2025-05-26T03:37:12Z","snapshot_observed_at":"2026-08-17T20:42:51.591673Z","submitted_at":"2025-05-26T03:37:12Z","title":"SMAP: Self-supervised Motion Adaptation for Physically Plausible Humanoid Whole-body Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19463","snapshot_observed_at":"2026-07-14T16:00:12.029377Z","title":"Smap: Self- supervised motion adaptation for physically plausible humanoid whole-body control.arXiv preprint arXiv:2505.19463, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:12.029377Z"},"links":{"cited_paper":"/paper/2505.19463","citing_paper":"/paper/2607.06558"},"observation_digest":"sha256:b7eaa584fdc1cda3ca769b4dad1597e055aced890845cf0aea703e49fa2f12f3","observation_id":"1fe157c1-4741-458e-9bc5-f59cc6f67325","resolution":{"observed_at":"2026-07-14T16:00:12.029377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.06558","last_updated":"2026-07-12T13:53:14Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T19:00:18.476219Z","submitted_at":"2026-07-07T17:58:11Z","title":"RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2607.06558."}