{"as_of":"2026-08-10T22:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:61e7049131d7ea9f721b13b65b0dd29644a47d027ea70ec29ca83137e3a03717","coverage":[{"denominator":120,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T05:06:52.022607Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07408/citation-record","integrity":"/paper/2608.07408/integrity","json":"/paper/2608.07408/citation-record.json","paper":"/paper/2608.07408"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-10T05:06:51.699806Z","title":"Cosmos 3: Omnimodal world models for physical ai.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.699806Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:0322157d4855cf285e0ca52643c456f0ac4dfb4f502aaa5dd61ea4f22ff85662","observation_id":"91dddf21-8cd7-473a-a03a-66e3ae65cbcf","resolution":{"observed_at":"2026-08-10T05:06:51.699806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06205","last_updated":"2025-05-13T14:11:59Z","snapshot_observed_at":"2026-08-07T03:18:17.365096Z","submitted_at":"2024-10-08T17:07:01Z","title":"Round and Round We Go! What makes Rotary Positional Encodings useful?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06205","snapshot_observed_at":"2026-08-10T05:06:51.704237Z","title":"Round and round we go! what makes rotary positional encodings useful? InInternational Conference on Learning Representations (ICLR), 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.704237Z"},"links":{"cited_paper":"/paper/2410.06205","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:3bbb0c58fe29e04b04dafa571f9fc485faa3e6e99a4b36162e5bf679426fa5f3","observation_id":"7528a57e-f4fd-4f91-afb6-ee3666f0aa7e","resolution":{"observed_at":"2026-08-10T05:06:51.704237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.03159","last_updated":"2026-07-23T22:35:14Z","snapshot_observed_at":"2026-08-02T12:34:11.019179Z","submitted_at":"2026-06-02T05:11:05Z","title":"NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation","version":2},"cited_work":{"arxiv_id":"2606.03159","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.03159","snapshot_observed_at":"2026-08-10T05:06:56.401302Z","title":"NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation","venue":"cs.CV","work_id":"548f4bce-8347-4c16-8fba-df5ade7aaf54","year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.707884Z"},"links":{"cited_paper":"/paper/2606.03159","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:9a1f563fbdc3cc0599aab805c894a5bff2f38ab1b02217f00f0915ed85777f1a","observation_id":"a8f3e74f-95e1-41ce-9902-adf2a33ca7dc","resolution":{"observed_at":"2026-08-10T05:06:56.404991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-10T05:06:51.711233Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.711233Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:e626e70155153d94643bdcf1e2242962007b783d92bf5cca2e149ad49f454b62","observation_id":"5d95ce7c-d24c-4c40-9d2a-26901cf9f142","resolution":{"observed_at":"2026-08-10T05:06:51.711233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21489","last_updated":"2026-05-21T21:50:17Z","snapshot_observed_at":"2026-08-02T14:20:11.088817Z","submitted_at":"2026-05-20T17:59:52Z","title":"Variance Reduction for Expectations with Diffusion Teachers","version":2},"cited_work":{"arxiv_id":"2605.21489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.21489","snapshot_observed_at":"2026-08-10T05:06:56.377038Z","title":"Variance Reduction for Expectations with Diffusion Teachers","venue":"cs.LG","work_id":"39608073-51f4-4080-8e00-5705cfb40914","year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.714636Z"},"links":{"cited_paper":"/paper/2605.21489","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:1b7ac78f67722c256d3c51976a92e4c2657ff7c618a94aea712c9af85c3d8e5f","observation_id":"c47d67ba-feee-4af2-ab43-c0b46352b11f","resolution":{"observed_at":"2026-08-10T05:06:56.381256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.718099Z","title":"Token merging: Your ViT but faster","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.718099Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:a3d1f9838117b0486b09ce3a10630de2e27f204ae52bd6d406baf58862470652","observation_id":"d29b49ed-1b39-413e-a48e-73f7cd861f3c","resolution":{"observed_at":"2026-08-10T05:06:51.718099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.721638Z","title":"Recurrentmemorytransformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.721638Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:fa2365d1c8d1b2ee459b2f49f5e2f8d8ea88e24c3223f0c67d38dd66a34b7199","observation_id":"c4c3c9d2-ba07-46f1-9448-e4fe74264f76","resolution":{"observed_at":"2026-08-10T05:06:51.721638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.724686Z","title":"Mixture of contexts for long video generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.724686Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:e5c028c4c9e1eb6bb17370e2607bd84e66456edd06b7c4b28ebbe364f2c1778d","observation_id":"fe7ebef4-6ad7-4617-bf71-6a922bc30e3e","resolution":{"observed_at":"2026-08-10T05:06:51.724686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.727509Z","title":"PyramidKV: Dynamic KV cache compression based on pyramidal information funneling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.727509Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:8c20899f872904e40b834303fafd3b2ccace0d51d5ce4dbea066abb3c1491d8f","observation_id":"8f8f6f4e-e63a-4705-8c2c-04581997312a","resolution":{"observed_at":"2026-08-10T05:06:51.727509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.730698Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.730698Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:411a28bcfbef4963c7818b3b55d7c849be88fee3eb5c6de041c8381bd1355f0d","observation_id":"66121e07-549e-442d-9b59-46cfcd0d5f47","resolution":{"observed_at":"2026-08-10T05:06:51.730698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.733972Z","title":"Past- and future-informed kv cache policy with salience estimation in autoregressive video diffusion.arXiv preprint arXiv:2601.21896, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.733972Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:cd8c3b02629d997cc3439cbe86882fbf35bf41412b17e6f8a974369b9b8e7875","observation_id":"72569696-3196-41d8-a983-122bbe4ae8d2","resolution":{"observed_at":"2026-08-10T05:06:51.733972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06939","last_updated":"2026-04-13T17:35:53Z","snapshot_observed_at":"2026-07-06T22:55:20.208897Z","submitted_at":"2026-04-08T11:03:22Z","title":"Grounded Forcing: Bridging Time-Independent Semantics and Proximal Dynamics in Autoregressive Video Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.06939","snapshot_observed_at":"2026-08-10T05:06:51.737173Z","title":"Grounded forcing: Bridging time-independent semantics and proximal dynamics in autoregressive video synthesis.arXiv preprint arXiv:2604.06939, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.737173Z"},"links":{"cited_paper":"/paper/2604.06939","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:6e652dbc91c66b7602786826bec0e60ddb9a27b41f07bb9b919f3bee6ecc99df","observation_id":"1ffda83b-fb20-41b7-af03-d9bafca2f1e2","resolution":{"observed_at":"2026-08-10T05:06:51.737173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-10T05:06:51.740643Z","title":"Extending context window of large language models via positional interpolation.arXiv preprint arXiv:2306.15595, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.740643Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:27ee11e5d57ec7f1fac7c6d1e4844590151c4da0e09cd9d8d684c7f1e77568dd","observation_id":"fc86cc5f-0460-4489-9718-5e58d3fe3b02","resolution":{"observed_at":"2026-08-10T05:06:51.740643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.744146Z","title":"Context forcing: Consistent autoregressive video generation with long context.arXiv preprint arXiv:2602.06028, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.744146Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:675020dc487a426d6364d7582eb1b650c68860809276b63403ba28bed2b8bc4d","observation_id":"64a0907e-d5ff-458c-bdeb-997c74c5484a","resolution":{"observed_at":"2026-08-10T05:06:51.744146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21996","last_updated":"2026-05-28T06:02:27Z","snapshot_observed_at":"2026-08-07T13:15:36.558064Z","submitted_at":"2025-05-28T05:55:44Z","title":"VRAG: Learning World Models for Interactive Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21996","snapshot_observed_at":"2026-08-10T05:06:51.747413Z","title":"Learning world models for interactive video generation.arXiv preprint arXiv:2505.21996, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.747413Z"},"links":{"cited_paper":"/paper/2505.21996","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:6257c582a8acf06511ea441c3b49d63521086ea0884cfcf9b1278dde84e8ed5f","observation_id":"6baf39b6-e159-4933-80e4-39e35ece8d5b","resolution":{"observed_at":"2026-08-10T05:06:51.747413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.751167Z","title":"FINCH: Prompt-guided key-value cache compression for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.751167Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:3d32578fd7ca5b2f75eb6c6389de33a001d794bd2bbab8b4574d3270e27baaa1","observation_id":"634e47f8-392f-448a-aff0-da0d87426578","resolution":{"observed_at":"2026-08-10T05:06:51.751167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.754420Z","title":"Lol: Longer than longer, scaling video generation to hour.arXiv preprint arXiv:2601.16914, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.754420Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:bedfb56176b738d992e053db671b26e4e635c128e843e57e171075a8d6cc8056","observation_id":"cbd6ee8d-35dc-491d-8390-ac9135b57c4f","resolution":{"observed_at":"2026-08-10T05:06:51.754420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.02283","last_updated":"2025-10-02T17:55:42Z","snapshot_observed_at":"2026-08-09T17:36:50.125769Z","submitted_at":"2025-10-02T17:55:42Z","title":"Self-Forcing++: Towards Minute-Scale High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.02283","snapshot_observed_at":"2026-08-10T05:06:51.757833Z","title":"Self-Forcing++: Towards minute-scale high-quality video generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.757833Z"},"links":{"cited_paper":"/paper/2510.02283","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:cd50c6f1ac11acee0f802d2fdef4ac89b2fc383736071063a62fc8889311e96c","observation_id":"19f274db-1514-4a23-8140-2e0eacc5720d","resolution":{"observed_at":"2026-08-10T05:06:51.757833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.02860","last_updated":"2019-06-02T21:21:48Z","snapshot_observed_at":"2026-07-06T07:25:48.468658Z","submitted_at":"2019-01-09T18:28:19Z","title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.02860","snapshot_observed_at":"2026-08-10T05:06:51.761506Z","title":"Le, and Ruslan Salakhutdinov","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.761506Z"},"links":{"cited_paper":"/paper/1901.02860","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:2694908516f6eccac68511bb2dd52612d67914624a1159f1f266453c9487374e","observation_id":"40a1ac60-fc60-45cb-8c83-9d9ada4bd0cf","resolution":{"observed_at":"2026-08-10T05:06:51.761506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.765198Z","title":"Oasis: A universe in a transformer.https://oasis-model.github.io, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.765198Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:e28280f637bbf2ad83af74e0fb56035de55949e628db351d0c8654728a73f60b","observation_id":"ea1c6f51-d05b-4b31-96ce-bb17f324f423","resolution":{"observed_at":"2026-08-10T05:06:51.765198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.768499Z","title":"WorldScore: A unified evaluation benchmark for world generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.768499Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:617062c1a50b1a036273834bd7ba86a540f370d52b6fa7bd4cd3778dbd57fdf1","observation_id":"f437397a-bae7-430f-8b66-5650f628291b","resolution":{"observed_at":"2026-08-10T05:06:51.768499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.771607Z","title":"A unified framework for approximating and clustering data","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.771607Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:6d50a55a67eb23b48eb3130c098e5ec8b70a212e5a1c831a867f64c67a6666b6","observation_id":"f019ce2e-f743-4eb5-89d2-ca3c65e8642a","resolution":{"observed_at":"2026-08-10T05:06:51.771607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.775432Z","title":"Memcam: Memory- augmented camera control for consistent video generation.arXiv preprint arXiv:2603.26193, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.775432Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:3bc731e1ca140750b762f0da79ee9e03c69d4f13f30666df2c4001e39ca6608e","observation_id":"03483878-b4e0-499b-81bd-85e31a3f7192","resolution":{"observed_at":"2026-08-10T05:06:51.775432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18719","last_updated":"2024-05-30T17:51:53Z","snapshot_observed_at":"2026-08-08T13:23:50.253213Z","submitted_at":"2024-05-29T02:57:15Z","title":"Contextual Position Encoding: Learning to Count What's Important","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18719","snapshot_observed_at":"2026-08-10T05:06:51.778667Z","title":"Contextual position encoding: Learning to count what’s important.arXiv preprint arXiv:2405.18719, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.778667Z"},"links":{"cited_paper":"/paper/2405.18719","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:87f5b021373ec248c812f048ea2ecd1bfa28ccb46188aa6dcada98e06099d990","observation_id":"e3736da0-d508-4182-964d-a81e8e3f08e5","resolution":{"observed_at":"2026-08-10T05:06:51.778667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.781948Z","title":"Genie 3: A new frontier for world models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.781948Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:81bf48e6160cc926a0e9b9a5cd90f2e3b7de1fd4784074b09b1a50f4f5e44cca","observation_id":"a6f6d7e9-d04d-43b0-b90f-1d8a30699903","resolution":{"observed_at":"2026-08-10T05:06:51.781948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.784638Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.784638Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:45daa2408f354f68dd91f90e7170631d957492ef0b9610dcc07f6c3e84b07539","observation_id":"45dba7e6-fa47-460a-947d-89942018d259","resolution":{"observed_at":"2026-08-10T05:06:51.784638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19325","snapshot_observed_at":"2026-08-10T05:06:51.787420Z","title":"Long-context autoregressive video modeling with next-frame prediction.arXiv preprint arXiv:2503.19325, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.787420Z"},"links":{"cited_paper":"/paper/2503.19325","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:8a02dd898aead57c894643c1fe2ce880d9dce8d6808843f3ba742e3e82a1571a","observation_id":"5b919a9d-fe83-4fc2-966b-325295ad91bb","resolution":{"observed_at":"2026-08-10T05:06:51.787420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18215","last_updated":"2026-04-21T16:05:42Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:00:17Z","title":"Memorize When Needed: Decoupled Memory Control for Spatially Consistent Long-Horizon Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.18215","snapshot_observed_at":"2026-08-10T05:06:51.790280Z","title":"Memorize when needed: Decoupled memory control for spatially consistent long-horizon video generation.arXiv preprint arXiv:2604.18215, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.790280Z"},"links":{"cited_paper":"/paper/2604.18215","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:208a10ace5ccfc5f3d6ffbea217afe3bccb1afa3c33ca8c7d0e031e902631fe2","observation_id":"6e8384ef-1551-4dec-8358-f5370072c761","resolution":{"observed_at":"2026-08-10T05:06:51.790280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.793059Z","title":"Recurrent world models facilitate policy evolution","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.793059Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:90453494132fd037bf3f5ce91b4bb402fabfd4bd44e33f6192e17d984584b0b9","observation_id":"d25dd89a-6b4d-4c51-b4aa-3497b5ac48b2","resolution":{"observed_at":"2026-08-10T05:06:51.793059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.795696Z","title":"Mastering diverse control tasks through world models.Nature, 640:647–653, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.795696Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:a30a107d5c1146ae9b98d39bae227a4ba7ac422b55b01541d7c2fd585c45257a","observation_id":"52bc8748-c20a-4621-be85-6e16b6584354","resolution":{"observed_at":"2026-08-10T05:06:51.795696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12665","last_updated":"2025-06-03T17:18:23Z","snapshot_observed_at":"2026-08-07T18:09:46.801825Z","submitted_at":"2025-02-18T09:11:51Z","title":"A$^2$ATS: Retrieval-Based KV Cache Reduction via Windowed Rotary Position Embedding and Query-Aware Vector Quantization","version":2},"cited_work":{"arxiv_id":"2502.12665","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.12665","snapshot_observed_at":"2026-08-10T05:06:55.942533Z","title":"A$^2$ATS: Retrieval-Based KV Cache Reduction via Windowed Rotary Position Embedding and Query-Aware Vector Quantization","venue":"cs.CL","work_id":"fe339f44-c37f-44fb-a1e9-227a8ede709e","year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.798489Z"},"links":{"cited_paper":"/paper/2502.12665","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:0623f91799c503bfdc690affa9c0dcf3d1b249be0b7fd14fcd36f1287c0161e1","observation_id":"d3ed0f70-18c3-4768-826a-8056568bb32c","resolution":{"observed_at":"2026-08-10T05:06:55.948862Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13009","last_updated":"2026-04-07T11:37:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-18T15:28:53Z","title":"Matrix-game 2.0: An open-source real-time and streaming interactive world model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13009","snapshot_observed_at":"2026-08-10T05:06:51.801289Z","title":"Matrix-game 2.0: An open-source, real-time, and streaming interactive world model.arXiv preprint arXiv:2508.13009, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.801289Z"},"links":{"cited_paper":"/paper/2508.13009","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:fd45f1698423f86fc7024b5b5587f32cce336be4350f9477e840086f786f3bb4","observation_id":"613f3692-f94d-4567-af19-01e552b5d47d","resolution":{"observed_at":"2026-08-10T05:06:51.801289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14773","last_updated":"2025-04-16T13:38:58Z","snapshot_observed_at":"2026-08-09T14:37:44.086189Z","submitted_at":"2024-03-21T18:27:29Z","title":"StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14773","snapshot_observed_at":"2026-08-10T05:06:51.804256Z","title":"StreamingT2V: Consistent, dynamic, and extendable long video generation from text","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.804256Z"},"links":{"cited_paper":"/paper/2403.14773","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:61cfaca6ddb040f9699837dbacb10e6d69a5b08e258be8345e9e92126251a6b6","observation_id":"1ecc7a16-0e7d-4c3a-91e9-62594a23f9c8","resolution":{"observed_at":"2026-08-10T05:06:51.804256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13298","last_updated":"2024-07-16T04:54:56Z","snapshot_observed_at":"2026-07-06T17:47:30.518562Z","submitted_at":"2024-03-20T04:47:13Z","title":"Rotary Position Embedding for Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13298","snapshot_observed_at":"2026-08-10T05:06:51.807153Z","title":"Rotary position embedding for vision transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.807153Z"},"links":{"cited_paper":"/paper/2403.13298","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:881d7ce35bf6eb8318c09c09401b2ba71477499cde650833a2c8e0b07ccd4332","observation_id":"22778dbf-972b-4f61-a063-b0dcb288ae08","resolution":{"observed_at":"2026-08-10T05:06:51.807153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.810004Z","title":"RELIC: Interactive video world model with long-horizon memory.arXiv preprint arXiv:2512.04040, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.810004Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:86960547d13bb30f98de68e62145be5e4ef1950ba9f4b5735d0bcae5c87555e6","observation_id":"d5056227-bf25-4709-829e-8880f2b2cb0b","resolution":{"observed_at":"2026-08-10T05:06:51.810004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17739","last_updated":"2025-07-14T04:23:36Z","snapshot_observed_at":"2026-08-10T13:01:13.628884Z","submitted_at":"2024-12-23T17:44:01Z","title":"Fourier Position Embedding: Enhancing Attention's Periodic Extension for Length Generalization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17739","snapshot_observed_at":"2026-08-10T05:06:51.812677Z","title":"Fourier position embedding: Enhancing attention’s periodic extension for length generalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.812677Z"},"links":{"cited_paper":"/paper/2412.17739","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:e87dd9f1b806e4ea26bcf6f0582fa3b19a21f3a25ccedfb9c2ac9867e3458f91","observation_id":"bfa75425-95e9-4cc8-95a2-268522f777dc","resolution":{"observed_at":"2026-08-10T05:06:51.812677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.815893Z","title":"Vid2World: Crafting video diffusion models to interactive world models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.815893Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:008a7a041af895a9b0f94646ebc35e77fb73b7f398878229231963a6cf4398a1","observation_id":"578fb85c-1927-4c6b-b32e-f9ebd635c0e0","resolution":{"observed_at":"2026-08-10T05:06:51.815893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-08-10T05:06:51.818857Z","title":"Self forcing: Bridging the train-test gap in autoregressive video diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.818857Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:c608d6cff9a5bc7512aed7aba10c5f7e036cefc8c26683e3fc73f6924f82d22f","observation_id":"a7b5482e-334b-40b0-9d81-117133e1dfaa","resolution":{"observed_at":"2026-08-10T05:06:51.818857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07852","last_updated":"2022-11-02T00:35:56Z","snapshot_observed_at":"2026-08-08T13:23:08.347838Z","submitted_at":"2022-03-11T23:44:33Z","title":"Block-Recurrent Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07852","snapshot_observed_at":"2026-08-10T05:06:51.822520Z","title":"Block-recurrent transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.822520Z"},"links":{"cited_paper":"/paper/2203.07852","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:58dc6b5b139b7e43597fc48f65428d75d7263705092a9189f3d21b5ac12e1ea2","observation_id":"c161ec1f-f0c5-4703-939c-b9dcdc7b853a","resolution":{"observed_at":"2026-08-10T05:06:51.822520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.825902Z","title":"Transformers are RNNs: Fast autore- gressive transformers with linear attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.825902Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:91dfb6a4965f1cc59dd4fa8c09ff1f8b070b32bc8384cf16a7e6a5e2cafe07aa","observation_id":"ee220334-8634-4eca-a680-40f0eee0b7e0","resolution":{"observed_at":"2026-08-10T05:06:51.825902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19466","last_updated":"2023-11-06T19:48:10Z","snapshot_observed_at":"2026-07-06T15:35:41.522547Z","submitted_at":"2023-05-31T00:29:55Z","title":"The Impact of Positional Encoding on Length Generalization in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19466","snapshot_observed_at":"2026-08-10T05:06:51.829142Z","title":"The impact of positional encoding on length generalization in transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.829142Z"},"links":{"cited_paper":"/paper/2305.19466","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:274c824068a87f1c5979cc37be8093d74b39d428b4fd1c09c65bbfb14fb6816d","observation_id":"8f2611ed-07eb-4757-83a6-b167dacfe868","resolution":{"observed_at":"2026-08-10T05:06:51.829142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.832659Z","title":"Jay Kuo, and Peter A","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.832659Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:c2272f1f3d5ebe859dc3fc3c563b02e3e39684dd79b7640275157aa31d8fd267","observation_id":"1962a171-d7bb-4c8a-979f-14fbaf6a2575","resolution":{"observed_at":"2026-08-10T05:06:51.832659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.835834Z","title":"Robust nonnegative matrix factorization using l21-norm","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.835834Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:5a335b6a411a34f1b25231b477f29a26881be4c8effdf4c7fedb43f6f4c511ac","observation_id":"b421cdb8-9622-4ef8-b681-bbcdd47326a1","resolution":{"observed_at":"2026-08-10T05:06:51.835834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.839051Z","title":"Lee and H","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.839051Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:63f24aa67a1b15e9db4816d8721d223fa609d8e7575b87afcebd380a7dce3a52","observation_id":"88b6d623-057b-4204-9a35-ba8d372a4def","resolution":{"observed_at":"2026-08-10T05:06:51.839051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.17196","last_updated":"2026-04-30T15:40:24Z","snapshot_observed_at":"2026-07-06T22:33:34.164422Z","submitted_at":"2025-10-20T06:17:57Z","title":"Understanding and Improving Length Generalization in Hierarchical Sparse Attention Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.17196","snapshot_observed_at":"2026-08-10T05:06:51.842394Z","title":"Understanding and improving length generalization in hierarchical sparse attention models.arXiv preprint arXiv:2510.17196, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.842394Z"},"links":{"cited_paper":"/paper/2510.17196","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:c2d235515e42954827316a81a0184014490dccf9b4011c990647daaa92dae6c7","observation_id":"383659e2-0643-4ac9-824d-9b509bfdda14","resolution":{"observed_at":"2026-08-10T05:06:51.842394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.07775","last_updated":"2026-05-03T01:49:14Z","snapshot_observed_at":"2026-07-30T09:22:37.641917Z","submitted_at":"2026-02-08T02:16:02Z","title":"Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.07775","snapshot_observed_at":"2026-08-10T05:06:51.845827Z","title":"Rolling sink: Bridging limited-horizon training and open-ended testing in autoregressive video diffusion.arXiv preprint arXiv:2602.07775, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.845827Z"},"links":{"cited_paper":"/paper/2602.07775","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:45635259e47801517327670edf1a918640e049dceeca4dcd2d62886223cd305c","observation_id":"905facbf-630e-4981-9740-9d27a14b048c","resolution":{"observed_at":"2026-08-10T05:06:51.845827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.849683Z","title":"Train short, inference long: Training-free horizon extension for autoregressive video generation.arXiv preprint arXiv:2602.14027, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.849683Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:9543d8de12685ca80b78af4d9733fe2d2d788b5b68c79518b7930c5739282dbe","observation_id":"6723b123-bdad-46d4-bdbb-9b27cc723b67","resolution":{"observed_at":"2026-08-10T05:06:51.849683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.853092Z","title":"PackCache: A training-free acceleration method for unified autoregressive video generation via compact KV-cache.arXiv preprint arXiv:2601.04359, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.853092Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:9fc180b2fc21adb00c213f8ef9604ab5a55b2900f926a42934023d8e50a0024a","observation_id":"7e76c29e-770c-49e0-a061-6c12c4a6f8b7","resolution":{"observed_at":"2026-08-10T05:06:51.853092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10103","last_updated":"2026-04-28T08:33:18Z","snapshot_observed_at":"2026-07-06T22:58:47.599383Z","submitted_at":"2026-04-11T08:54:07Z","title":"Long-Horizon Streaming Video Generation via Hybrid Attention with Decoupled Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10103","snapshot_observed_at":"2026-08-10T05:06:51.856531Z","title":"Long-horizon streaming video generation via hybrid attention with decoupled distillation.arXiv preprint arXiv:2604.10103, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.856531Z"},"links":{"cited_paper":"/paper/2604.10103","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:04846d74f9aab7d8c0160a0fd8635dd2046dde5586148d4f4d77b89cbd9172e9","observation_id":"02f61ce5-176a-42d0-b586-cf9e55dc44fb","resolution":{"observed_at":"2026-08-10T05:06:51.856531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.860251Z","title":"Cameras as relative positional encoding","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.860251Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:db3f13ab01944a6641ae2038ad34890a6b0b9bdc6c660e7b902372dbdfca543d","observation_id":"bb0d9e24-d699-45a6-ac54-f152584b9165","resolution":{"observed_at":"2026-08-10T05:06:51.860251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18903","last_updated":"2025-08-14T14:03:30Z","snapshot_observed_at":"2026-08-10T10:39:31.441499Z","submitted_at":"2025-06-23T17:59:56Z","title":"VMem: Consistent Interactive Video Scene Generation with Surfel-Indexed View Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18903","snapshot_observed_at":"2026-08-10T05:06:51.863744Z","title":"VMem: Consistent interactive video scene generation with surfel-indexed view memory","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.863744Z"},"links":{"cited_paper":"/paper/2506.18903","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:75285f0d12e2cd114d307e73d7190df29ef21ebfe39becb229326e92cad1c3f5","observation_id":"de891703-bf83-4994-a4e0-ab76812214f2","resolution":{"observed_at":"2026-08-10T05:06:51.863744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.866780Z","title":"Stable video infinity: Infinite-length video generation with error recycling.arXiv preprint arXiv:2510.09212, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.866780Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:722e57c285ab0c9c01bbbda325f1cb085d8896432a88dc262c4f73b59aec0e3e","observation_id":"32182234-1248-4cdc-bd14-87e95f0bce03","resolution":{"observed_at":"2026-08-10T05:06:51.866780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-07T22:57:56.263839Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-10T05:06:51.869780Z","title":"SnapKV:LLMknowswhatyouarelookingforbeforegeneration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.869780Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:b2b32ef1e57244268616a1ef81c031520f04ad6125d31cd97ab76c96ba51edea","observation_id":"94be4b49-5b3b-4c47-9e14-b5e75d728040","resolution":{"observed_at":"2026-08-10T05:06:51.869780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22976","last_updated":"2026-05-08T04:02:37Z","snapshot_observed_at":"2026-08-02T20:46:05.777520Z","submitted_at":"2025-05-29T01:28:57Z","title":"LoopNav: Benchmarking Spatial Consistency in World Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22976","snapshot_observed_at":"2026-08-10T05:06:51.873150Z","title":"Toward memory-aided world models: Benchmarking via spatial consistency.arXiv preprint arXiv:2505.22976, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.873150Z"},"links":{"cited_paper":"/paper/2505.22976","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:31834271b5ff307ff08f0eaa2baf246bfa81069511b95f32fabe3c779f7b6507","observation_id":"562e98e3-2e84-4069-9556-a10cd7445178","resolution":{"observed_at":"2026-08-10T05:06:51.873150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25161","last_updated":"2025-09-29T17:57:14Z","snapshot_observed_at":"2026-08-09T09:15:39.740119Z","submitted_at":"2025-09-29T17:57:14Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.25161","snapshot_observed_at":"2026-08-10T05:06:51.876309Z","title":"Rolling forcing: Autoregressive long video diffusion in real time","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.876309Z"},"links":{"cited_paper":"/paper/2509.25161","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:1e317c2d3d6e51d0afa57f7e355d95b9ffc19a9e0346faeac0088b5e6b5ab838","observation_id":"9329cf75-9c5e-4d92-8c27-a520c49578a8","resolution":{"observed_at":"2026-08-10T05:06:51.876309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-10T05:06:51.879558Z","title":"KIVI: A tuning-free asymmetric 2-bit quantization for KV cache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.879558Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:b22d297e89ec57c86363faf82e57db5fdad2d93ead1d149f45c32e1722d44cd4","observation_id":"5e2835f8-be93-4c5a-acbf-5a5e80310f76","resolution":{"observed_at":"2026-08-10T05:06:51.879558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.882731Z","title":"JacNet: Learning functions with structured Jacobians","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.882731Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:f3f72b6c05c109a12558daaa962f61dc4d92d352dbbc9bcf3d205085560f3cb4","observation_id":"f941b651-7c6a-4d9e-be46-daeada6be491","resolution":{"observed_at":"2026-08-10T05:06:51.882731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12754","last_updated":"2022-08-26T16:07:14Z","snapshot_observed_at":"2026-07-06T13:45:53.490825Z","submitted_at":"2022-08-26T16:07:14Z","title":"Task Selection for AutoML System Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12754","snapshot_observed_at":"2026-08-10T05:06:51.885612Z","title":"Task selection for AutoML system evaluation.arXiv preprint arXiv:2208.12754, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.885612Z"},"links":{"cited_paper":"/paper/2208.12754","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:b428496f18d294d06c5a9fa2266b9f994be18107de14a738fe67e9c54d4ecc3c","observation_id":"552639f3-182c-4464-b22a-91d52fc77809","resolution":{"observed_at":"2026-08-10T05:06:51.885612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.888849Z","title":"ATT3D: Amortized text-to-3D object synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.888849Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:dd6718e3241b65c5adb989be5e76a3e00348afb30d78b9422ed963bf684d650a","observation_id":"9525ee8d-21fe-4950-9617-1cc7aa81e211","resolution":{"observed_at":"2026-08-10T05:06:51.888849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.891520Z","title":"Flow caching for autoregressive video generation.arXiv preprint arXiv:2602.10825, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.891520Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:16bc0e695b1203c889580d7b33ef234d02429a514299180143061810facd6bc2","observation_id":"710479b7-ebba-4f2e-a7f6-96d07dceb05c","resolution":{"observed_at":"2026-08-10T05:06:51.891520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04921","last_updated":"2026-04-06T17:58:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-06T17:58:42Z","title":"TriAttention: Efficient Long Reasoning with Trigonometric KV Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.04921","snapshot_observed_at":"2026-08-10T05:06:51.894378Z","title":"TriAttention: Efficient long reasoning with trigonometric KV compression.arXiv preprint arXiv:2604.04921, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.894378Z"},"links":{"cited_paper":"/paper/2604.04921","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:3e58887e4a6a4e13d052d17821d669e4f56539040562915ce2281cd9ba505939","observation_id":"db742686-b706-49a0-b81c-697c9cdfe559","resolution":{"observed_at":"2026-08-10T05:06:51.894378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.897344Z","title":"PackForcing: Short video training suffices for long video sampling and long context inference.arXiv preprint arXiv:2603.25730, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.897344Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:dbff79d60d18b89aefffcf8607dea050fc2c9b6361f946ee69364f7354c218a5","observation_id":"5a383fa8-5c2d-4d8f-aa09-a6fae5d36853","resolution":{"observed_at":"2026-08-10T05:06:51.897344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16300","last_updated":"2023-11-20T01:16:17Z","snapshot_observed_at":"2026-08-04T15:01:39.394740Z","submitted_at":"2023-05-25T17:53:42Z","title":"Landmark Attention: Random-Access Infinite Context Length for Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16300","snapshot_observed_at":"2026-08-10T05:06:51.900992Z","title":"Landmark attention: Random-access infinite context length for trans- formers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.900992Z"},"links":{"cited_paper":"/paper/2305.16300","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:1feb3de2d7123a38e8d0ba2c4bf1e9f396b3d82188291a059932d61f75f04bea","observation_id":"4d4e19e2-0b8a-485f-8a01-00bd839a6c22","resolution":{"observed_at":"2026-08-10T05:06:51.900992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-02T14:27:24.212588Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07143","snapshot_observed_at":"2026-08-10T05:06:51.904460Z","title":"Leave no context behind: Efficient infinite context transformers with Infini-attention.arXiv preprint arXiv:2404.07143, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.904460Z"},"links":{"cited_paper":"/paper/2404.07143","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:cc76812cbdfa5eb354f69e2fde7d0d6fdef602348aac92f1ac62ed3cd094f002","observation_id":"a788e2bf-48d1-495e-8bb0-e2821e928d0a","resolution":{"observed_at":"2026-08-10T05:06:51.904460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.908045Z","title":"KVPress: A compression library for transformer KV caches.https://github.com/NVIDIA/kvpress, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.908045Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:b91cdc5204ab4e03cc9f443a60e57e7b2af0faed0bc3d92e281e6777fa091a86","observation_id":"f7d0633f-ef88-46a1-8be5-ae07b9b18d9f","resolution":{"observed_at":"2026-08-10T05:06:51.908045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02473","last_updated":"2026-07-22T11:47:21Z","snapshot_observed_at":"2026-08-10T04:00:25.183173Z","submitted_at":"2025-12-02T07:06:23Z","title":"WorldPack: Dynamic Frame Compression for Long-context Video World Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02473","snapshot_observed_at":"2026-08-10T05:06:51.911350Z","title":"WorldPack: Compressed memory improves spatial consistency in video world modeling.arXiv preprint arXiv:2512.02473, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.911350Z"},"links":{"cited_paper":"/paper/2512.02473","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:d4f3b52a87201ed821216c0b49b297473fa8d30c2fd2ca16f2e771161014fd18","observation_id":"866ad531-9c4e-4db8-952d-3b7609f609b1","resolution":{"observed_at":"2026-08-10T05:06:51.911350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-10T05:06:51.914934Z","title":"YaRN: Efficient context window extension of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.914934Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:891eba57fc7c969dcc96bd157432a598162e2fc3937279b426fcb0ea9db43753","observation_id":"e412048b-faec-4d7f-921a-bd699312e06b","resolution":{"observed_at":"2026-08-10T05:06:51.914934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.918609Z","title":"Long-context state-space video world models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.918609Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:1c2d575a9a047ea0aa5acca54317cb259c09cc15422e8ce028c543974d063f16","observation_id":"56cb717b-9da6-449f-b17c-be8f860716db","resolution":{"observed_at":"2026-08-10T05:06:51.918609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.921685Z","title":"Smith, and Mike Lewis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.921685Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:8691ad91974054eca742b906849ac8b1a664ebd3b48fc294bea1b52d7a0a4386","observation_id":"79e8cde5-5f8c-425a-ac7c-ea83f84bc309","resolution":{"observed_at":"2026-08-10T05:06:51.921685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.924869Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.924869Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:0a695124fdc8241e11bcc3bfe49d4dfd965c95c987bb01cb3aaec500bd16fd16","observation_id":"1443c73a-8bf6-4d74-96cb-d73da9750e97","resolution":{"observed_at":"2026-08-10T05:06:51.924869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.928398Z","title":"Rae, Anna Potapenko, Siddhant M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.928398Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:6440f2c76475e1af25e87a4e7dd5e7643cbde7d1a316da2695aa0b05660fb8ed","observation_id":"930ccfba-f3f9-4bc8-a89a-01a40f5b13ea","resolution":{"observed_at":"2026-08-10T05:06:51.928398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04621","last_updated":"2025-05-07T17:59:38Z","snapshot_observed_at":"2026-08-07T22:23:35.494972Z","submitted_at":"2025-05-07T17:59:38Z","title":"Score Distillation Sampling for Audio: Source Separation, Synthesis, and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04621","snapshot_observed_at":"2026-08-10T05:06:51.931568Z","title":"Score distillation sampling for audio: Source separation, synthesis, and beyond","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.931568Z"},"links":{"cited_paper":"/paper/2505.04621","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:701a4079e822648fd7893b18b5c40ea189c77e0d71da69b94b1bbc6a7be243bc","observation_id":"0aefec3a-6ed3-4e7c-b7a2-edc059d454c3","resolution":{"observed_at":"2026-08-10T05:06:51.931568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.935154Z","title":"Fast autoregressive video diffusion and world models with temporal cache compression and sparse attention.arXiv preprint arXiv:2602.01801, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.935154Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:12bd602d5bd823560cde8cfba0a3349ea4f53d2fbf13f140cf1f395afdb1cbe7","observation_id":"53088a46-4a55-42aa-bd86-9a3623203d8b","resolution":{"observed_at":"2026-08-10T05:06:51.935154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.938252Z","title":"LongRoPE2: Near-lossless LLM context window scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.938252Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:fd1ac6476032ebc3047069a4065d52d52bdab03b700534e7d7a24ced8b0b4a67","observation_id":"97763b1a-405f-4127-8696-1a6dd8e498d4","resolution":{"observed_at":"2026-08-10T05:06:51.938252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06764","last_updated":"2025-07-24T03:58:47Z","snapshot_observed_at":"2026-08-07T11:01:49.684719Z","submitted_at":"2025-02-10T18:44:25Z","title":"History-Guided Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06764","snapshot_observed_at":"2026-08-10T05:06:51.941856Z","title":"History-guided video diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.941856Z"},"links":{"cited_paper":"/paper/2502.06764","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:4e5dfbf6c4367c2aa2bdadcd3cd79b2885cfb232d1c30ca906179acec45d866b","observation_id":"219c96eb-d2b2-44d7-ad62-c753a18d971a","resolution":{"observed_at":"2026-08-10T05:06:51.941856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23274","last_updated":"2024-12-03T00:28:32Z","snapshot_observed_at":"2026-07-06T19:42:25.742756Z","submitted_at":"2024-10-30T17:54:56Z","title":"Multi-student Diffusion Distillation for Better One-step Generators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23274","snapshot_observed_at":"2026-08-10T05:06:51.945440Z","title":"Multi-student diffusion distillation for better one-step generators","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.945440Z"},"links":{"cited_paper":"/paper/2410.23274","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:9e60ca51ed81ee36fb9eda3a250759bc6d0e242ededea1c0172d40071c9a6c2f","observation_id":"8722fe6f-b7dc-4e9d-9be1-807e6a546a3b","resolution":{"observed_at":"2026-08-10T05:06:51.945440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.948895Z","title":"Composition of memory experts for diffusion world models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.948895Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:86b325de35847b7d84f83788c8299b6e2d0e3196c753e3efd4fe13e9cd535f3e","observation_id":"bb5f8c81-180b-4a75-aa0e-09ae3ecb1078","resolution":{"observed_at":"2026-08-10T05:06:51.948895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.951728Z","title":"RoFormer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.951728Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:257410c4a9165576ad9f37089cfe2506efb08eaaad9aeb78383f4ca5056effa9","observation_id":"22efbd61-f2aa-4b2c-b95f-ab977bbe44dc","resolution":{"observed_at":"2026-08-10T05:06:51.951728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.14614","last_updated":"2026-06-09T16:18:08Z","snapshot_observed_at":"2026-08-03T16:11:09.055651Z","submitted_at":"2025-12-16T17:22:46Z","title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.14614","snapshot_observed_at":"2026-08-10T05:06:51.954581Z","title":"WorldPlay: Towards long-term geometric consistency for real-time interactive world modeling.arXiv preprint arXiv:2512.14614, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.954581Z"},"links":{"cited_paper":"/paper/2512.14614","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:6f6c4f91b4973e7584820a033af5527b8ae13642b3651e7d56462a90ccf0da14","observation_id":"2ced6be5-c8ec-446c-b8be-33feb282cf57","resolution":{"observed_at":"2026-08-10T05:06:51.954581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.957468Z","title":"Learning to (learn at test time): RNNs with expressive hidden states","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.957468Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:3e6d3e5aa096c29b47018eff79b98d7f9b4e25740ce9da718173cc34d48cb6c7","observation_id":"dcb9b390-15dd-4de5-96cd-15fd81384c7e","resolution":{"observed_at":"2026-08-10T05:06:51.957468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10554","last_updated":"2022-12-20T18:56:20Z","snapshot_observed_at":"2026-08-09T00:51:36.452647Z","submitted_at":"2022-12-20T18:56:20Z","title":"A Length-Extrapolatable Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10554","snapshot_observed_at":"2026-08-10T05:06:51.960146Z","title":"A length-extrapolatable transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.960146Z"},"links":{"cited_paper":"/paper/2212.10554","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:eaac09b0a87ad457c85874690837ee0e2ad2742c4c7c7453df7e894504b08d50","observation_id":"0e61fcb2-60a9-41fe-b00d-cac9563f47a0","resolution":{"observed_at":"2026-08-10T05:06:51.960146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20540","last_updated":"2026-01-28T12:37:01Z","snapshot_observed_at":"2026-08-03T01:29:14.204066Z","submitted_at":"2026-01-28T12:37:01Z","title":"Advancing Open-source World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20540","snapshot_observed_at":"2026-08-10T05:06:51.963230Z","title":"Advancing open-source world models.arXiv preprint arXiv:2601.20540, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.963230Z"},"links":{"cited_paper":"/paper/2601.20540","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:bfd3abc8fcb6572f3661565506566113a2404db31dc2ccc45e83a3eef896b482","observation_id":"924e2455-efe2-417e-a089-a8c83e870d69","resolution":{"observed_at":"2026-08-10T05:06:51.963230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.966146Z","title":"KeepKV: Achieving periodic lossless KV cache compression for efficient LLM inference","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.966146Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:187b10355274f4ca3b532bb56a4f75c2640fb495d19d4e4a89a39be412c6bf21","observation_id":"df4eb73f-d4b9-4344-aaf1-80db9dbf98d8","resolution":{"observed_at":"2026-08-10T05:06:51.966146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.968987Z","title":"Diffusion models are real-time game engines","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.968987Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:28b54737e82bf1b232f1b048e9bbf1c26251b641fb9b08702339d6c0647aa8fa","observation_id":"a5e1beab-7c38-4a85-8e41-2c2aa5a3315e","resolution":{"observed_at":"2026-08-10T05:06:51.968987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.971985Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.971985Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:6163b95f4e7a44a39a099ad375969dda9aebecb5a230a8c4bd14ae2930419c73","observation_id":"c6859384-b193-442f-9602-689ba0412c20","resolution":{"observed_at":"2026-08-10T05:06:51.971985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.974974Z","title":"Fast transformers with clustered attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.974974Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:c8d2d8b83591a5848d4f50b82b31adbb55f2d1852826a67835fe93cfd4e07e5e","observation_id":"878363cd-acd2-4c73-8f18-0e636e4ee5fd","resolution":{"observed_at":"2026-08-10T05:06:51.974974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-10T05:06:51.977937Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.977937Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:a8ed3b31c5ec4d495a84bf8506159d4b21f567d654c592c6221ae541c7d975d9","observation_id":"140f24d8-7ecf-4516-941f-a07656c5dd05","resolution":{"observed_at":"2026-08-10T05:06:51.977937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13476","last_updated":"2024-11-26T09:46:25Z","snapshot_observed_at":"2026-08-05T12:30:14.699982Z","submitted_at":"2024-11-20T17:22:31Z","title":"When Precision Meets Position: BFloat16 Breaks Down RoPE in Long-Context Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13476","snapshot_observed_at":"2026-08-10T05:06:51.980988Z","title":"When precision meets position: BFloat16 breaks down RoPE in long-context training.Transactions on Machine Learning Research (TMLR), 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.980988Z"},"links":{"cited_paper":"/paper/2411.13476","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:8e8f3b667712b0356781548a90a6ae6af4fa2e8b11669014b551cdb42edf9c5a","observation_id":"a1dd92ba-2805-4c71-b625-635ae12b24d6","resolution":{"observed_at":"2026-08-10T05:06:51.980988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-10T05:06:51.983926Z","title":"Li, Madian Khabsa, Han Fang, and Hao Ma","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.983926Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:ee4e04cf010112760dd1d894c2b28e0db53776cd212427e507b646b1ed54d85e","observation_id":"50d18257-3043-4ec0-a6c0-2fd075c40d31","resolution":{"observed_at":"2026-08-10T05:06:51.983926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09595","last_updated":"2024-11-14T17:08:23Z","snapshot_observed_at":"2026-08-08T05:29:13.481798Z","submitted_at":"2024-11-14T17:08:23Z","title":"LLaMA-Mesh: Unifying 3D Mesh Generation with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09595","snapshot_observed_at":"2026-08-10T05:06:51.987484Z","title":"LLaMA-Mesh: Unifying 3D mesh generation with language models.arXiv preprint arXiv:2411.09595, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.987484Z"},"links":{"cited_paper":"/paper/2411.09595","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:76deffb46c2017936cb8706b1ae48e48bb2e1f39127003e3de731d2cc1978d34","observation_id":"44e33ebc-3b39-4e69-bb25-391ef2aca2a3","resolution":{"observed_at":"2026-08-10T05:06:51.987484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.991027Z","title":"Bovik, Hamid R","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.991027Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:f5ea79a1313de17612e4a372652fe2f5e72e6bcf542856407dd13c5711ef7347","observation_id":"81426352-910e-48fa-85ad-b2c179e619bd","resolution":{"observed_at":"2026-08-10T05:06:51.991027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08995","last_updated":"2026-04-13T03:48:38Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:00:09Z","title":"Matrix-Game 3.0: Real-Time and Streaming Interactive World Model with Long-Horizon Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08995","snapshot_observed_at":"2026-08-10T05:06:51.994602Z","title":"Matrix-game 3.0: Real-time and streaming interactive world model with long-horizon memory.arXiv preprint arXiv:2604.08995, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.994602Z"},"links":{"cited_paper":"/paper/2604.08995","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:5c35cd78a1f530163f7e3b0c566507b8775566abceb9063400e6cd01b8a3e4bb","observation_id":"c11f2c74-cb6f-4071-8458-ab4a9998adef","resolution":{"observed_at":"2026-08-10T05:06:51.994602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-08-10T05:06:51.998314Z","title":"VideoRoPE: What makes for good video rotary position embedding? In International Conference on Machine Learning (ICML), 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.998314Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:b9d229d6ba5590fb991cfed85d2766699d09bc942f734a7f23acfc9f3c4c701b","observation_id":"bf6b92ab-aa87-4a59-8ff8-96e0a87c7b1b","resolution":{"observed_at":"2026-08-10T05:06:51.998314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-08-10T05:06:52.002085Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:52.002085Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:6bb42a95adb4b02485c06d3737aea86de556fc1719a4f69e55b55a5865cb8e15","observation_id":"45019931-55ad-42dd-9581-576a360adc4c","resolution":{"observed_at":"2026-08-10T05:06:52.002085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:52.005790Z","title":"Corgi: Cached memory guided video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:52.005790Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:144f7cc61219f6f2530c18892112a6f20708fee32dc49f9cd4ee86b115faa8d4","observation_id":"2a0e4fff-a6e0-4dda-822e-60fcaf2c95d5","resolution":{"observed_at":"2026-08-10T05:06:52.005790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:52.009046Z","title":"Motion attribution for video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:52.009046Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:c092c3fbcd15c72b07d157ac023a849681a88ecf016fb7e0e532166ff80f5bc3","observation_id":"7563504e-80c6-4111-a504-757d267ce84f","resolution":{"observed_at":"2026-08-10T05:06:52.009046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:52.012470Z","title":"Rabe, DeLesley Hutchins, and Christian Szegedy","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:52.012470Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:8b32e1d9ee86159834885930ef4ec18d898bb798748a822601fe9327f3644109","observation_id":"9dff48ed-dcf2-486a-93ee-30cedd49be66","resolution":{"observed_at":"2026-08-10T05:06:52.012470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:52.015881Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:52.015881Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:f4a2003f17af8c8dca73888c46c9f832410ef96bbc2baede23b45125f993196b","observation_id":"fc0d617b-5107-4687-b585-3c4dbbe1e106","resolution":{"observed_at":"2026-08-10T05:06:52.015881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-08-10T05:06:52.019067Z","title":"DuoAttention: Efficient long-context LLM inference with retrieval and streaming heads","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:52.019067Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:0aad4a25bd43c684f739f25d8e276d7c292bab1557ffad7bf8495000ee6bbe1e","observation_id":"a7be016b-15e7-4e9c-a3dd-2d7e75e1965e","resolution":{"observed_at":"2026-08-10T05:06:52.019067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:52.022607Z","title":"WorldMem: Long-term consistent world simulation with memory","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:52.022607Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:0a49e885b81530a062039bb407f7a895cdabd30f99dde7b3208492e81bdfd376","observation_id":"b9d48c43-e88a-44e5-9b91-b8019f21f757","resolution":{"observed_at":"2026-08-10T05:06:52.022607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T22:13:34.260315Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":97,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":120},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 120 outbound references and 0 inbound Pith citation observations for arXiv:2608.07408."}