{"as_of":"2026-08-04T14:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c32c564a233a0b5bccf8bb3f5c447d161b82a011185616e81a25ffe3d5e4264b","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-02T23:56:39.865433Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T05:16:53.011837Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T13:19:51.035539Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"cited_work":{"arxiv_id":"2605.01896","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.01896","snapshot_observed_at":"2026-07-04T13:19:51.035539Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","venue":"cs.CV","work_id":"851b3bf1-9553-466f-a9ff-58f265b6f368","year":2026},"citing_paper":{"arxiv_id":"2606.26916","last_updated":"2026-06-25T11:53:27Z","snapshot_observed_at":"2026-07-07T00:01:10.711037Z","submitted_at":"2026-06-25T11:53:27Z","title":"PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-26T05:16:53.011837Z"},"links":{"cited_paper":"/paper/2605.01896","citing_paper":"/paper/2606.26916"},"observation_digest":"sha256:99b68a8ced8f1c52df9d7454aa5c0e817920441e1c1719cf2520414160dc52f1","observation_id":"b06947b8-23d3-4f84-9b9a-4efe674d0959","resolution":{"observed_at":"2026-07-04T13:19:51.036949Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.01896/citation-record","integrity":"/paper/2605.01896/integrity","json":"/paper/2605.01896/citation-record.json","paper":"/paper/2605.01896"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.204875Z","title":"Proceedings of the 3rd International Workshop on Rich Media With Generative AI, ACM (2025) 1","venue":null,"work_id":"f34b4d17-fb3b-4226-ae25-f98af8cf5bcc","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:12967566f12d5196297e6f93aa24d6d65c8f4f89478573d9733d86bc56619f7e","observation_id":"8c4b3368-2e7e-443e-82d8-574ec1cd9ea5","resolution":{"observed_at":"2026-07-05T17:31:22.207281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":"2506.09985","doi":"10.48550/arxiv.2506.09985","metadata_source":"pith","pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-07-11T02:27:49.493432Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","venue":"cs.AI","work_id":"a9c28401-f16a-4933-89f0-788e2f94e52b","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:1158130ff85c6c1b4124fbf874d35ff27e50bb2c611511c77f903f32a80e0bd3","observation_id":"8c3c0d46-2af4-40b7-92b5-d9299b936c3b","resolution":{"observed_at":"2026-07-02T23:57:27.889960Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.183593Z","title":"Advances in Neural Information Processing Systems37, 24081–24125 (2024) 4, 5","venue":null,"work_id":"7d06b5c4-78a1-4047-b6b9-06d845937738","year":2024},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:c2e68e819be3db9dc39fce5910f146c98b078f37d5454bf238315f29717a39de","observation_id":"81b96c12-5d7d-4832-9ac5-7adee8e2471c","resolution":{"observed_at":"2026-07-05T17:31:22.186154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01103","last_updated":"2025-06-01T17:58:36Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:58:36Z","title":"DeepVerse: 4D Autoregressive Video Generation as a World Model","version":1},"cited_work":{"arxiv_id":"2506.01103","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01103","snapshot_observed_at":"2026-07-03T00:57:30.505107Z","title":"Deepverse: 4d autoregressive video generation as a world model","venue":null,"work_id":"a5aaa78b-144b-44a1-a69f-12709eb9a483","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2506.01103","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:bc8ec32c877c4fd6af2d337f20fe67efd0e9ceb0cf954c4e3d5211884549653e","observation_id":"b048413b-4703-4966-b837-44b9b060478c","resolution":{"observed_at":"2026-07-02T23:57:27.850200Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.217708Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":"76c6c0ac-cbc4-4bf0-9c36-e488113c9d87","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:2f9b3d759aeb103f32ca8654b3d60eb18e318ca34e8a269d8d855b76dce9656f","observation_id":"ef9fdfa1-6f09-40a9-aacd-c0b4f6bbafe3","resolution":{"observed_at":"2026-07-05T17:31:22.219922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13154","last_updated":"2025-08-18T17:59:55Z","snapshot_observed_at":"2026-07-31T09:01:37.844229Z","submitted_at":"2025-08-18T17:59:55Z","title":"4DNeX: Feed-Forward 4D Generative Modeling Made Easy","version":1},"cited_work":{"arxiv_id":"2508.13154","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.13154","snapshot_observed_at":"2026-07-08T02:04:26.158592Z","title":"4dnex: Feed-forward 4d generative modeling made easy","venue":"cs.CV","work_id":"ad4eb9e0-280f-4afa-aec7-73f914c5dada","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2508.13154","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:423dffd43b3bb8174ee346f332be7ec3289929986be370defc26732ee9f075d0","observation_id":"579803c9-6f1d-4c43-91c6-21b837ecb1a1","resolution":{"observed_at":"2026-07-02T23:57:27.836478Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08027","last_updated":"2026-04-23T21:02:30Z","snapshot_observed_at":"2026-07-30T08:49:18.908938Z","submitted_at":"2024-11-12T18:56:58Z","title":"LLMPhy: Parameter-Identifiable Physical Reasoning Combining Large Language Models and Physics Engines","version":3},"cited_work":{"arxiv_id":"2411.08027","doi":"10.48550/arxiv.2411.08027","metadata_source":"pith","pith_arxiv_id":"2411.08027","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"LLMPhy: Parameter-Identifiable Physical Reasoning Combining Large Language Models and Physics Engines","venue":"cs.LG","work_id":"0c14a600-1adb-4c1e-915e-1f7f5605d4b0","year":2024},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2411.08027","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:2199923d4489292bf4283a37bf0967cebecf3dc6952a402f6b7aa5b40c8a3f8d","observation_id":"cfd476e8-64a1-449c-b0b6-4002a1964e6f","resolution":{"observed_at":"2026-07-02T23:57:27.884639Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.154481Z","title":"URL: https://oasis-model","venue":null,"work_id":"ba573c4b-8bd1-4155-a79b-f7c45f6b4739","year":2024},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:3748244efa13c3ea8f437113b723a35b4ae44679553cd9dbdd52fa4c2f9fecf4","observation_id":"16a0e8cc-8836-4443-bbf3-b3e6f6b1d546","resolution":{"observed_at":"2026-07-05T17:31:22.156482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.142365Z","title":null,"venue":null,"work_id":"a9b54f07-3bdd-43dc-bd44-c90ccf06e83b","year":2010},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:232d2d466da5a58f6b69a12aa1d58ad3c5135b8d248065befdb42481b2f0d6ec","observation_id":"d1b6e760-6972-4ed9-95b0-804f3c9ecc2f","resolution":{"observed_at":"2026-07-05T17:31:22.144644Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.179115Z","title":"Advances in Neural Information Processing Systems37, 91560–91596 (2024) 1","venue":null,"work_id":"21129b6c-ffb2-4e8f-a1e9-4a6a27cde4cc","year":2024},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:f5f09bc6c809651f73af0c2606684f64b83c76b5daa2e4341c7222f2a1842e21","observation_id":"29c39a25-47de-4e12-a230-810c1c2cfdc1","resolution":{"observed_at":"2026-07-05T17:31:22.181661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-07-31T21:36:45.596575Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":"1803.10122","doi":"10.48550/arxiv.1712.00409","metadata_source":"pith","pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-07-11T00:07:43.018139Z","title":"World Models","venue":"cs.LG","work_id":"07227eee-8445-4c98-bce4-c6a6fd5ed907","year":2018},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:5e4b3a9c066585f1eb7372aef8fb0a77c50a851749feeff733f67ceeca558ca7","observation_id":"961ad75d-00ea-4d21-919c-151c442086c5","resolution":{"observed_at":"2026-07-02T23:57:27.871866Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13009","last_updated":"2026-04-07T11:37:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-18T15:28:53Z","title":"Matrix-game 2.0: An open-source real-time and streaming interactive world model","version":4},"cited_work":{"arxiv_id":"2508.13009","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.13009","snapshot_observed_at":"2026-07-09T07:56:04.730683Z","title":"Matrix-game 2.0: An open-source real-time and streaming interactive world model","venue":"cs.CV","work_id":"492a2d34-e672-45fb-8f54-c720d2dfae5a","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2508.13009","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:853dee8dd1a91740f3fcdd9c4797b21f3d820b925ff812eebcf93b917ef7d76b","observation_id":"a1889bb7-857e-4e50-a879-5f0a64659e33","resolution":{"observed_at":"2026-07-02T23:57:27.811276Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.214089Z","title":"Advances in neural information processing systems33, 6840–6851 (2020) 1","venue":null,"work_id":"ed81620d-5bab-41ac-b632-04def04f9436","year":2020},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:5ae688264d13c46b9aad9dca65e8cb33a5fb9c1e1d4fd9e15cee4876b8c1484f","observation_id":"52ffbd6f-cd5a-453e-987f-cd469ff81c59","resolution":{"observed_at":"2026-07-05T17:31:22.216666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.190525Z","title":"In: International Conference on Machine Learning","venue":null,"work_id":"bd5153cf-4d8e-412f-89d5-57955a61cf42","year":2023},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:e648367f766031c59b7f3f5a728ff3b5862082477964dfb3bcf900ca4dec7fe4","observation_id":"fabfaf09-0c74-485d-8489-d5998ec7854a","resolution":{"observed_at":"2026-07-05T17:31:22.193283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17080","last_updated":"2023-09-29T09:20:37Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T09:20:37Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2309.17080","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17080","snapshot_observed_at":"2026-07-10T11:47:02.949785Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","venue":"cs.CV","work_id":"313484e6-a442-4522-8e19-d07e502844a8","year":2023},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2309.17080","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:ed5f6af5a5ffdef8c2c5bd0528662b96b2885cc40ac939a5ef9b5c7d537d8049","observation_id":"721ed95e-5286-4734-a5cb-2b258d6903b4","resolution":{"observed_at":"2026-07-02T23:57:27.902745Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.194148Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":"0388e86d-c618-4f58-9486-6552ded029af","year":2005},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:648aafbf715600c1d055c35d3141bea6fa77dd9a7f39d17f124b7e10b3e5525c","observation_id":"e79db412-d805-4d9c-b1a5-bea832a1d79b","resolution":{"observed_at":"2026-07-05T17:31:22.196333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.171782Z","title":"ACM Transactions on Graphics (TOG)44(6), 1–15 (2025) 2, 4","venue":null,"work_id":"df962c42-54e6-4f4c-a55e-14ae93284f00","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:0e6f0a53fe799aab412401ecba599eb921943f161cf4a24f9f68bc5432a54863","observation_id":"77af5a1f-d2b3-4504-83f1-d1c83da860b1","resolution":{"observed_at":"2026-07-05T17:31:22.175011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":"2506.08009","doi":"10.48550/arxiv.2506.08009","metadata_source":"pith","pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-07-11T01:07:45.231019Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","venue":"cs.CV","work_id":"53e58ef9-7932-4b83-b757-34ac14db3e0f","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:e9d8b4d1aa2285c990d054128f0f6d6cc9d214e753939a57fc41177049481c32","observation_id":"d6831395-87f5-447f-ae13-daa5a933fc9f","resolution":{"observed_at":"2026-07-02T23:57:27.917885Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-07-06T21:40:02.335215Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"cited_work":{"arxiv_id":"2506.09229","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09229","snapshot_observed_at":"2026-07-03T11:08:03.362718Z","title":"arXiv preprint arXiv:2506.09229 (2025) 2, 4, 7, 8","venue":null,"work_id":"23f5a4e3-be5d-4234-823b-217c6fa1b457","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2506.09229","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:8f9ec951858b0d7ceb20ca547ce61cd3426b7eba0b7ec7e60623c56e811094bf","observation_id":"e8bcbbe9-8751-4278-abd6-76fd8212487c","resolution":{"observed_at":"2026-07-02T23:57:27.892610Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.11673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T10:58:02.941800Z","title":"arXiv preprint arXiv:2412.11673 (2024)","venue":null,"work_id":"5b6c491d-7881-4abf-9a0e-4c8ed1595d21","year":2024},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:458fd487fd6260f202176f3c9efe80985ba9e4cc4e330ff148ab9c6d9d6ee9f0","observation_id":"245c330c-a734-4f6f-9b36-b0be66ed5122","resolution":{"observed_at":"2026-07-02T23:57:27.887021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.197462Z","title":"Advances in Neural Information Processing Systems37, 89834–89868 (2024) 4","venue":null,"work_id":"800fd4e1-c57f-4957-a27e-d144b1631d4c","year":2024},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:db7a3b16f1e9ff46dded9419dd10f475aee0202fd2fe1ee39ec771277a8d1b2b","observation_id":"5ee74a63-e93a-4d30-9f4d-1b1187feb07a","resolution":{"observed_at":"2026-07-05T17:31:22.200148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-07-11T01:07:45.135143Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:b9b10e652f7050051c3889f41016699e9b5c17f696482f7841fd1c48639ee5cf","observation_id":"13a13f52-b2b9-44e5-9a54-dd0b4a34351c","resolution":{"observed_at":"2026-07-02T23:57:27.907794Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:26:03.857113Z","title":"In: International conference on machine learning","venue":null,"work_id":"0cda0197-6ede-458b-84cf-e3463959770b","year":null},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:71bbf308b2160982d885c6961f23f31178dffb5b9a75859e89d153db606d342d","observation_id":"07cad770-5ab8-42fc-9d5e-74945155b4ce","resolution":{"observed_at":"2026-07-05T17:31:22.166903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.168408Z","title":null,"venue":null,"work_id":"06d67327-5318-45cf-be57-d7360619b73e","year":2019},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:76fb1b596ee03a6b2e4334fef880434aca5fd346747d0d6b0b2029ffd5a8900b","observation_id":"8aba3b19-c2bf-422d-9d61-f82eec3c4288","resolution":{"observed_at":"2026-07-05T17:31:22.170846Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:edc46ad4864b120456aa6fb5beaf5f8d146acebcb8201544d47b342530ada923","observation_id":"abcaa948-8913-4c45-9735-94c1b44736ba","resolution":{"observed_at":"2026-07-02T23:57:27.897575Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":"2209.03003","doi":"10.48550/arxiv.2209.03003","metadata_source":"pith","pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-07-10T17:37:26.212817Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","venue":"cs.LG","work_id":"a1989e1b-d66d-4533-be3a-fb9c5fd62290","year":2022},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:7952d3c7db971270edb43ce605066a0e36a06ca532d88612c081de05eedb040f","observation_id":"55beb807-b9de-4f37-b79a-cb641e158126","resolution":{"observed_at":"2026-07-02T23:57:27.920232Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T22:49:29.244251+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T22:49:29.244251+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15720","last_updated":"2025-08-21T16:57:33Z","snapshot_observed_at":"2026-07-06T22:16:15.447310Z","submitted_at":"2025-08-21T16:57:33Z","title":"WorldWeaver: Generating Long-Horizon Video Worlds via Rich Perception","version":1},"cited_work":{"arxiv_id":"2508.15720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15720","snapshot_observed_at":"2026-07-03T14:28:32.182919Z","title":"arXiv preprint arXiv:2508.15720 , year=","venue":null,"work_id":"83fd282b-79f8-4859-912e-9f1a620322a8","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2508.15720","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:54d05e185c60c9db9611a53771221856d35910984e5e6ad8abf21ba3d2a26bfa","observation_id":"165d0f4e-c3d6-4621-98f9-e5c9a7de1574","resolution":{"observed_at":"2026-07-02T23:57:27.831413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.03104","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T23:57:27.864890Z","title":"arXiv preprint arXiv:2510.03104 (2025) 2, 4","venue":null,"work_id":"3b4da0ae-522a-40b4-8bc5-43ae27923d24","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:68593fa09ed03afa532b10301a64088e5bb0f645ad3a95aa4c8fff0990b0fdec","observation_id":"f13de194-e6aa-4da3-831d-a8a0d413d012","resolution":{"observed_at":"2026-07-02T23:57:27.866731Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:b73c9299bb81c47435eb7236d7e8c431c5e50ef4cb70e6721b082a9f5c0b8e15","observation_id":"ca22bd48-8b2f-43cc-8b6b-0ace4623e5c8","resolution":{"observed_at":"2026-07-02T23:57:27.913034Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.187195Z","title":"URL: https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/ (2025) 1, 4","venue":null,"work_id":"75ddebcd-aee9-407a-8f78-1468710470e7","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:557ec1e25bb981943a994163921d1ba0b99c9009db5913e8e5ebd8a1f3dc320c","observation_id":"90d9f500-73d9-4be9-8e94-aed7fb809064","resolution":{"observed_at":"2026-07-05T17:31:22.189550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.157495Z","title":null,"venue":null,"work_id":"4c75c343-0dcc-4e47-9308-eae15fc4477d","year":2023},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:17a1e630542c0cf3a6cf0eb6e85c6233ddbbfe02da62e3c1ecad93ad0e476560","observation_id":"41c726b4-13ca-4e61-877e-b65b3507b5aa","resolution":{"observed_at":"2026-07-05T17:31:22.159499Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.07313","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:58:58.439948Z","title":"arXiv preprint arXiv:2510.07313 (2025)","venue":null,"work_id":"a9c7d963-ec81-43eb-adaf-14a8635eeea7","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:5f2fc5359c81d06f196a2b84b90dbf30352cf14752afb66c966f719d35d07ade","observation_id":"1a510f4b-6676-4fb4-81d5-1073b85ecb3e","resolution":{"observed_at":"2026-07-02T23:57:27.895216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18072","last_updated":"2024-10-23T17:56:11Z","snapshot_observed_at":"2026-07-06T19:38:35.617923Z","submitted_at":"2024-10-23T17:56:11Z","title":"WorldSimBench: Towards Video Generation Models as World Simulators","version":1},"cited_work":{"arxiv_id":"2410.18072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.18072","snapshot_observed_at":"2026-07-08T07:14:45.281301Z","title":"Worldsimbench: Towards video generation models as world simulators","venue":"cs.CV","work_id":"fb0a629d-b02d-49d2-9009-af5192360e0b","year":2024},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2410.18072","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:ddcebaa64e2c331385fa508d0e8d8e3acecab114c1b85cf2754b7f9435a3167e","observation_id":"b6334d7d-f5bd-4cc7-8fd8-928cbeea3341","resolution":{"observed_at":"2026-07-02T23:57:27.856576Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.176007Z","title":"In: International conference on machine learning","venue":null,"work_id":"f3c645c9-4c56-4184-9a12-a2c2e44ad8dd","year":2021},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:47f45d879fae37e7647a56fafc378b085c1afab31aac2adc933603d92f9d0018","observation_id":"002bb7aa-47bf-4735-a5fc-07a24fc34430","resolution":{"observed_at":"2026-07-05T17:31:22.178199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:148148d4036a86c803f1430f60d6f0ca176e7a15305f73ea933c23d2b85074e5","observation_id":"0d394dd0-917a-4984-9021-542b0e0d63c5","resolution":{"observed_at":"2026-07-02T23:57:27.927604Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.208251Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"df27a06e-1f7f-4bd0-be93-14983a0ba444","year":2022},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:8a93b94d666e90be7c6fe44cc06be3d499eb6587cf067f2f15facf5e751f51d8","observation_id":"bb32773c-3889-4717-895d-37ce5eceb954","resolution":{"observed_at":"2026-07-05T17:31:22.210259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20523","last_updated":"2025-03-26T13:11:35Z","snapshot_observed_at":"2026-07-06T20:59:00.415760Z","submitted_at":"2025-03-26T13:11:35Z","title":"GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2503.20523","doi":"10.48550/arxiv.2511.09057","metadata_source":"pith","pith_arxiv_id":"2503.20523","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving","venue":"cs.CV","work_id":"1339e674-d09b-48b4-8e6f-efe55dcab22e","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2503.20523","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:e075f81b9ad820053d33ed6f907c47dc15f35f536e2fc95bb5ec22cc7cf35875","observation_id":"19dc11d3-2859-4f34-a692-3dee7fefa261","resolution":{"observed_at":"2026-07-02T23:57:27.821747Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":"2508.10104","doi":"10.1055/a-2487-1252","metadata_source":"pith","pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DINOv3","venue":"cs.CV","work_id":"c8b07deb-8fe7-4e18-9620-f3569d3529ce","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:031a1eec6784f204a62ca4f8f52b4193b8cd7ceb508f86646ed64583e6e8bc29","observation_id":"9a68f8b6-04ce-4b5d-b718-21b84b9c8d21","resolution":{"observed_at":"2026-07-02T23:57:27.882251Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06764","last_updated":"2025-07-24T03:58:47Z","snapshot_observed_at":"2026-07-06T20:34:11.407726Z","submitted_at":"2025-02-10T18:44:25Z","title":"History-Guided Video Diffusion","version":2},"cited_work":{"arxiv_id":"2502.06764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.06764","snapshot_observed_at":"2026-07-08T03:24:28.724863Z","title":"History-Guided Video Diffusion","venue":"cs.LG","work_id":"7822dfb2-a168-4080-8673-2dfafbe1a2ab","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2502.06764","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:08de0f27f4194869a492b3827dae13c1fe12d82b5cf553444c1e9356b8bb6d6c","observation_id":"772a0fc2-c6f2-490b-969f-216e194fd766","resolution":{"observed_at":"2026-07-02T23:57:27.814132Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.18414","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T23:57:27.837768Z","title":"U-repa: Aligning diffusion u-nets to vits","venue":null,"work_id":"371c7caa-d9d9-4291-a7b7-b3125dd8d19c","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:39867149d41a647e0e442dacf5340b91f70ced5ca33a7f791e23c6c7db56a3e0","observation_id":"45ec1105-9765-4fcd-8633-7a67ff17fc1c","resolution":{"observed_at":"2026-07-02T23:57:27.840448Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":"1812.01717","doi":"10.48550/arxiv.1812.01717","metadata_source":"pith","pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","venue":"cs.CV","work_id":"72f42543-17d5-49aa-ba5a-25d67ffbb88a","year":2018},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:259485e08ac841f55ade234568a260c9e5135d6aacc9f2da9c7004bbf3755aaa","observation_id":"2947dde1-9bae-4068-8951-eb976d099be4","resolution":{"observed_at":"2026-07-02T23:57:27.852710Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-07-06T19:06:23.640089Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":"2408.14837","doi":"10.48550/arxiv.2408.14837","metadata_source":"pith","pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-07-10T18:57:31.670802Z","title":"Diffusion Models Are Real-Time Game Engines","venue":"cs.LG","work_id":"3f074579-63c2-40bf-b5c8-c6a8c39d9319","year":2024},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:ece2555f8bfc1cb1d72b6783b8454a5fd0dcc7c6c587f8cce282024189a3a58a","observation_id":"df4857d4-9714-4b5e-ae6a-829feedd2037","resolution":{"observed_at":"2026-07-02T23:57:27.900051Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:ca18711f9466fe10e77ea41abb5af18f1edc629cd36af22f0ef4602079b04443","observation_id":"a56a3f20-9075-4b4e-b477-85b240e4a839","resolution":{"observed_at":"2026-07-02T23:57:27.828238Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.09676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:56:04.737468Z","title":"Spatialvid: A large-scale video dataset with spatial annotations.arXiv preprint arXiv:2509.09676, 2025a","venue":null,"work_id":"fa42660a-b999-4c7f-80c9-2b72151c3399","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:5bd011f65cad7c00b0c4a4ad865dde2feaddcdd0d1574e08f0ffe2ffbfc9f359","observation_id":"015b2e87-e4ab-4650-b284-59d97ed7b0a0","resolution":{"observed_at":"2026-07-02T23:57:27.931051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.201382Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":"b0e5a486-40b6-471f-bef7-c2f87b320707","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:680bd77d5083f15c313944d0b4f7e3d44ddc80a7921fa753f526e58b1e4737b0","observation_id":"8c678ac9-0059-4779-abd1-9f2d5f1c37cb","resolution":{"observed_at":"2026-07-05T17:31:22.203697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.221098Z","title":"IEEE transactions on image processing 13(4), 600–612 (2004) 11","venue":null,"work_id":"0191a2c0-372c-4cb7-8f45-7b27c74e1a3d","year":2004},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:8d60e14718fb083459f09d73b03911d39167f463c671c454e8d13f7e6f69d1a0","observation_id":"a155b283-2218-4850-9066-817fa20cbdb4","resolution":{"observed_at":"2026-07-05T17:31:22.223632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07982","last_updated":"2026-05-05T14:55:01Z","snapshot_observed_at":"2026-08-04T10:05:27.686733Z","submitted_at":"2025-07-10T17:55:08Z","title":"Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling","version":2},"cited_work":{"arxiv_id":"2507.07982","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.07982","snapshot_observed_at":"2026-07-07T14:33:54.305490Z","title":"Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling","venue":"cs.CV","work_id":"7c214f4a-d3ff-48e7-bd13-043eb9c139cb","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2507.07982","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:8989cc341778fcac65ffd153aac61226d44f9eea0baa559add82110ab6bc379a","observation_id":"89c631ad-c3c7-4c5f-8eeb-f103b5195d80","resolution":{"observed_at":"2026-07-02T23:57:27.922659Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.12369","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:19:13.356094Z","title":"arXiv preprint arXiv:2504.12369 , year=","venue":null,"work_id":"7159175f-77a7-43d9-8dc3-54bda91b0e0b","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:39d7594beccc4f7172e8d193aebc68b1dff8bbf18c3f4d3e400cc0ac1cd4b1c5","observation_id":"6fb69925-a0a0-43c6-a349-d17a6294520c","resolution":{"observed_at":"2026-07-02T23:57:27.910598Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.07316","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:58:33.630078Z","title":"Pixel-perfect depth with semantics-prompted diffusion transformers.arXiv preprint arXiv:2510.07316, 2025a","venue":null,"work_id":"02c6a27f-e182-4a76-889d-da59a75412ea","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:dc14d591345d05f589e9f5048bb232c4e95195c3d977c60e2b06a545ed22da05","observation_id":"d15c71d8-514b-4a5e-8b14-294303f31870","resolution":{"observed_at":"2026-07-02T23:57:27.933570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.139197Z","title":"In: International Conference on Machine Learning","venue":null,"work_id":"4de8b53e-85c1-4bc7-a766-a91092bc40ea","year":2023},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:18364ffea1f32a205d1e0881dbba2e693f6191489a423d757f8f505cd2eba875","observation_id":"066d2acb-eb48-426e-88ef-1c7ec9e4f0eb","resolution":{"observed_at":"2026-07-05T17:31:22.141214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.145965Z","title":"Advances in Neural Information Processing Systems37, 21875–21911 (2024) 2, 3, 4, 7, 9, 10, 11, 12, 15","venue":null,"work_id":"db4c02c6-e8c5-4803-ba9d-e8d2faed4712","year":2024},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:897a36b4bee560d2cd337d95341da014d50c38f24dc4dd3ad10a435debae4847","observation_id":"65faefb7-0699-42b9-9295-a268527dd94f","resolution":{"observed_at":"2026-07-05T17:31:22.148428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"cited_work":{"arxiv_id":"2310.06114","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.06114","snapshot_observed_at":"2026-07-04T17:09:59.117795Z","title":"Learning Interactive Real-World Simulators","venue":"cs.AI","work_id":"16f38691-7ab6-4e23-bba5-6b656579e579","year":2023},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2310.06114","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:9685ee480546cb370ce4ef0df48913e91e02f8b0004da47e8874eac51fefeb99","observation_id":"22667131-2698-4e39-bf24-1622af43da4f","resolution":{"observed_at":"2026-07-02T23:57:27.878918Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17139","last_updated":"2024-02-27T02:05:29Z","snapshot_observed_at":"2026-08-04T02:50:42.922408Z","submitted_at":"2024-02-27T02:05:29Z","title":"Video as the New Language for Real-World Decision Making","version":1},"cited_work":{"arxiv_id":"2402.17139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.17139","snapshot_observed_at":"2026-07-02T23:57:27.914181Z","title":"Video as the new language for real-world decision making","venue":null,"work_id":"c0c521da-9575-4981-98c6-a569fbccab98","year":2024},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2402.17139","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:2589fcd64068f8103738f7c40bf45c96463ba30a14310da069253b2267089e14","observation_id":"16b3b3ec-13db-46c2-b9a2-84c7af644737","resolution":{"observed_at":"2026-07-02T23:57:27.915621Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-07-11T00:07:42.878250Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:90623afc5a8cb07d4d0e4712cc77f628fab3a4d9bfd98b38fbed50c809be6480","observation_id":"16c89200-14bc-410e-bf2a-517831081b45","resolution":{"observed_at":"2026-07-02T23:57:27.863725Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.160393Z","title":"In: RSS 2025 Workshop: Mobile Manipulation: Emerging Opportunities{\\&}Con- temporary Challenges (2025) 4","venue":null,"work_id":"3f2c3247-0249-4a7c-b450-1d380e559d44","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:93323e975c212f8bc062ff64e0318ba98e8beae6debe67888ab66e7f1cc84e0f","observation_id":"1e71acb3-c509-4b6e-b028-1ca3acea4c95","resolution":{"observed_at":"2026-07-05T17:31:22.162537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.135813Z","title":"In: CVPR (2025) 4","venue":null,"work_id":"4b3eeca9-a379-4bef-9647-6bf1fb5af56f","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:ed984365c523350d9b1432a6f8ffa642d1a4fe8d33ca5de558e13330f8c9b3d5","observation_id":"1e19d1fe-6548-48b4-ad6b-c9a91d735ac4","resolution":{"observed_at":"2026-07-05T17:31:22.137895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.07979","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:29:45.281191Z","title":"Visual representation alignment for multimodal large language models","venue":null,"work_id":"b85964c9-7e58-4217-8066-98a33cb0b1de","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:2f59511fb65f81628588d68ea2f46888349875b760270f69005a90a2d0ed60ea","observation_id":"604b4393-89b0-4dd0-80e3-59990c0a952f","resolution":{"observed_at":"2026-07-02T23:57:27.843983Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.08325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T23:57:27.874423Z","title":"Gamefactory: Creating new games with generative interactive videos","venue":null,"work_id":"43f64828-bf0d-429a-9107-a0a4192c46ca","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:be7af27e60eb1e08d335b6b61bb5febaa9359abe990d8577eaef617d3b119c0e","observation_id":"f87eac1d-a842-433b-b357-4fe221651a40","resolution":{"observed_at":"2026-07-02T23:57:27.875984Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":"2410.06940","doi":"10.48550/arxiv.2410.06940","metadata_source":"pith","pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-07-10T08:36:59.774135Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","venue":"cs.CV","work_id":"1aff8ef8-079b-4afe-9e6a-148e6fd08e6a","year":2024},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:e868d55ca2c10bb9b43033b8b535564a50be8c3548cb5df761a95eca67ec9a34","observation_id":"99e33726-fbba-4588-819d-aa1209f538a8","resolution":{"observed_at":"2026-07-02T23:57:27.869426Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.211145Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":"e2733501-8a67-4939-b230-097a2972fd1e","year":2018},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:ca8d7203946345a9dcbff05123054f5672fa60e327d3658c3655f3573e36e0c3","observation_id":"133aa9b7-5b50-49dd-8e31-7eb46622d838","resolution":{"observed_at":"2026-07-05T17:31:22.213161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:1473142dede870e6d550720c46efc3a7a71a98fc1e134000c5e279059383b2ab","observation_id":"cfba5c5f-3f70-4db3-a916-26d354c6e17d","resolution":{"observed_at":"2026-07-02T23:57:27.925208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20995","last_updated":"2025-04-29T17:59:30Z","snapshot_observed_at":"2026-07-06T21:16:36.894196Z","submitted_at":"2025-04-29T17:59:30Z","title":"TesserAct: Learning 4D Embodied World Models","version":1},"cited_work":{"arxiv_id":"2504.20995","doi":"10.48550/arxiv.2504.20995","metadata_source":"pith","pith_arxiv_id":"2504.20995","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2504.20995 (2025)","venue":"cs.CV","work_id":"3a971c23-d9fe-4291-9743-6a2b015ce29b","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2504.20995","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:9eb113f6f985af5b5f851f3d99c4d7dec0793b396ab23824f8cf53c480a71a4b","observation_id":"57c266b1-ed0e-47ba-966c-c51feb0cb975","resolution":{"observed_at":"2026-07-02T23:57:27.847549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.09817","last_updated":"2018-05-24T17:58:02Z","snapshot_observed_at":"2026-07-06T06:41:05.545426Z","submitted_at":"2018-05-24T17:58:02Z","title":"Stereo Magnification: Learning View Synthesis using Multiplane Images","version":1},"cited_work":{"arxiv_id":"1805.09817","doi":"10.1145/3197517.3201323","metadata_source":"pith","pith_arxiv_id":"1805.09817","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Stereo Magnification: Learning View Synthesis using Multiplane Images","venue":"cs.CV","work_id":"f6abb68f-df5c-4569-af1b-9ede43a44468","year":2018},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/1805.09817","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:99782e3a262a5bb9fec5a8bcaf3940a90339833031a8233fd5dd1b8acbfdf622","observation_id":"a850ea57-30e7-4ac6-a81e-7fb31ae08b30","resolution":{"observed_at":"2026-07-02T23:57:27.825294Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.12201","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T02:27:45.680254Z","title":"Omniworld: A multi-domain and multi-modal dataset for 4d world modeling","venue":null,"work_id":"a2a9311e-9a5a-4a48-947d-c1f5e4eddd0b","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:104a48e5f35c9bc0229df40dfd0b01237a4a308136f925a6bef95a32410a00ed","observation_id":"9fd9cd23-4d78-4374-95c3-6c7bcb577864","resolution":{"observed_at":"2026-07-02T23:57:27.905387Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:22.149735Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"446fd6aa-08b2-4cfe-895d-05f032b98202","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:71a6294c656dcd7207fe161d2f790a5b9483767a39bb85fbfe4e903ac6057795","observation_id":"3381d885-ce7b-4b1e-900b-682b9d9311ff","resolution":{"observed_at":"2026-07-05T17:31:22.153423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2405.03520","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T17:08:43.481619Z","title":"Is sora a world simulator? A comprehensive survey on general world models and beyond","venue":null,"work_id":"f526770c-7d5c-4195-8ce8-7b910df8004b","year":2024},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:b8f6d00d5288491de0144c76894458f96c20d55983f352e17a8f17c618c1207d","observation_id":"66d3ea46-9a82-4ace-9628-db3227b8c675","resolution":{"observed_at":"2026-07-02T23:57:27.817748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":28,"parse_uncertain":0,"unresolved":3,"verified_exact":13,"verified_fuzzy":22},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 1 inbound Pith citation observation for arXiv:2605.01896."}