{"as_of":"2026-08-07T01:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4665f8596fc97a4b1f0664a75c53e8b3411c8fc6e0d0669bee837c8d0bcc0ba0","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T05:30:56.140465Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T06:35:29.083742Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.31734","snapshot_observed_at":"2026-08-01T06:35:29.083742Z","title":"Memlearner: Learning to query context memory for video world models.arXiv preprint arXiv:2606.31734,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21848","last_updated":"2026-07-27T16:34:17Z","snapshot_observed_at":"2026-08-06T23:24:08.189322Z","submitted_at":"2026-07-23T22:33:52Z","title":"Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T06:35:29.083742Z"},"links":{"cited_paper":"/paper/2606.31734","citing_paper":"/paper/2607.21848"},"observation_digest":"sha256:d7423c22a069ad73c10f52208f3fee23e5ff7791d5a1d7f6685c3a1b4c2491d6","observation_id":"32357189-8840-4fc4-92d5-5f079e1f3ae0","resolution":{"observed_at":"2026-08-01T06:35:29.083742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.31734/citation-record","integrity":"/paper/2606.31734/integrity","json":"/paper/2606.31734/citation-record.json","paper":"/paper/2606.31734"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"cited_work":{"arxiv_id":"2505.13211","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.13211","snapshot_observed_at":"2026-07-10T01:46:41.063877Z","title":"MAGI-1: Autoregressive Video Generation at Scale","venue":"cs.CV","work_id":"25e8bd3d-e51c-43ae-8126-4ea6ecdb3321","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2505.13211","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:f6bb6ebc29b5b3ec647dc89617ce68e80d43a80e9f6eb5cc6514e6e0d05ed137","observation_id":"d8c796a4-132c-4d00-9fa2-4fd248f67f1f","resolution":{"observed_at":"2026-07-01T10:25:41.913503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:26:37.778059Z","title":"Advances in neural information processing systems35, 23716– 23736 (2022)","venue":null,"work_id":"69f2f773-ab2f-4b5b-8afc-2c3de2311c88","year":2022},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:29aac68c0212f18125645559888b1b339ff6673d9c11ef0f894e72f89b054fa0","observation_id":"a7317523-9916-46a6-a70a-de4ea7b69bee","resolution":{"observed_at":"2026-07-06T21:32:57.157923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"cited_work":{"arxiv_id":"2507.02001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02001","snapshot_observed_at":"2026-07-02T02:26:27.039487Z","title":"Tem- poral chain of thought: Long-video understanding by thinking in frames","venue":null,"work_id":"f4531883-2365-44de-8e73-b52bed9292cb","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2507.02001","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:a5bfe29783ce525308af7cb2dca4fcfe5103de4487939a17c507a02fb5c74d9e","observation_id":"18343c31-284e-4b4d-bcea-e216b7bff1d3","resolution":{"observed_at":"2026-07-01T10:25:41.855643Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":"2506.09985","doi":"10.48550/arxiv.2506.09985","metadata_source":"pith","pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","venue":"cs.AI","work_id":"a9c28401-f16a-4933-89f0-788e2f94e52b","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:5cd8b3d508cd6806bdb40c7d44039bc8701eca5b9a392445f5d8f650c5c76e22","observation_id":"c4a367f4-f10c-4e9d-8bd4-12721e2f95bb","resolution":{"observed_at":"2026-07-01T10:25:41.906075Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11647","last_updated":"2025-07-09T08:09:06Z","snapshot_observed_at":"2026-07-06T20:52:55.699004Z","submitted_at":"2025-03-14T17:59:31Z","title":"ReCamMaster: Camera-Controlled Generative Rendering from A Single Video","version":2},"cited_work":{"arxiv_id":"2503.11647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.11647","snapshot_observed_at":"2026-07-04T16:29:56.626897Z","title":"ReCamMaster: Camera-Controlled Generative Rendering from A Single Video, March 2025","venue":null,"work_id":"468e39a2-8f08-49d5-b3a6-92df4205b5f3","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2503.11647","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:0eaa4a8e518d951d5a494fb56a15b253798316dcd1c971f151959e1d03cf553b","observation_id":"10e80f2b-a20f-46ef-b919-bdd34158fde6","resolution":{"observed_at":"2026-07-01T10:25:41.908158Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:57.148912Z","title":"Yu et al","venue":null,"work_id":"b2b96378-77a2-40db-9780-98e19ea94189","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:97608f271b399679c2ac823e167ff9d5905f3fe664740abea94cf4cf12bea2e5","observation_id":"f5639ada-9b07-40f7-9a3d-e245feec0764","resolution":{"observed_at":"2026-07-06T21:32:57.150219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-07-06T18:10:57.647004Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2405.04233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-07-04T19:50:11.362384Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":"c2c10794-bc91-4c9f-9ed4-32fdb1cc4c19","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:5f63f5f9d7d19fad95fcb1f93f77ae24e247385323f6f7f1b28a931e1a65768a","observation_id":"23814f50-bb84-46bd-bfab-beb691e994f2","resolution":{"observed_at":"2026-07-01T10:25:41.915950Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:47:43.527375Z","title":"Advances in neural information processing systems33, 1877–1901 (2020)","venue":null,"work_id":"d3989dc9-b4bc-415a-a124-8d7743ff12c4","year":1901},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:30bde9994d5b0308de8c2c0e02fa5c9410422277c50e0e7ce41dfb8774741500","observation_id":"78791b75-3313-4bd5-ab33-f70ab5e57118","resolution":{"observed_at":"2026-07-06T21:32:57.168179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:57.170583Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":"06236040-02bb-4e59-aca4-512123b668e7","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:f5c9e0f660559c514b017f09bbded87a1f7fdbf75b729a36716ce3a9b148255e","observation_id":"ac3e153b-5d67-49c9-952a-95897ad4d431","resolution":{"observed_at":"2026-07-06T21:32:57.175612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:57.168779Z","title":"In: arXiv (2025)","venue":null,"work_id":"9c1edcc8-7a59-46d3-baad-5ef2e2ab2318","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:2f4c91e9e592fb4a15d97e4fed35d02530d2c4bc91f723e614a9c39d69ee791f","observation_id":"da3f998c-412c-47bc-8cd9-61226e1631d6","resolution":{"observed_at":"2026-07-06T21:32:57.170029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01392","last_updated":"2024-12-10T01:32:23Z","snapshot_observed_at":"2026-08-06T12:36:01.385451Z","submitted_at":"2024-07-01T15:43:25Z","title":"Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion","version":4},"cited_work":{"arxiv_id":"2407.01392","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.01392","snapshot_observed_at":"2026-07-10T01:46:41.061392Z","title":"M., Du, Y ., Simchowitz, M., Tedrake, R., and Sitzmann, V","venue":"cs.LG","work_id":"e7d25a8e-cc3d-4006-adb8-b4430c78e47f","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2407.01392","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:0d226007dc8f238631a4c93accd9cc72ad4b79044a95319b3aa450f5da5927ce","observation_id":"9a926ef8-df17-4961-bc3d-caf26cc92a50","resolution":{"observed_at":"2026-07-01T10:25:41.905323Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21996","last_updated":"2026-05-28T06:02:27Z","snapshot_observed_at":"2026-08-02T19:46:18.834219Z","submitted_at":"2025-05-28T05:55:44Z","title":"VRAG: Learning World Models for Interactive Video Generation","version":4},"cited_work":{"arxiv_id":"2505.21996","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21996","snapshot_observed_at":"2026-07-04T12:49:53.226691Z","title":"VRAG: Learning World Models for Interactive Video Generation","venue":"cs.CV","work_id":"57a65211-475e-412c-a72b-f0519db0d0cb","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2505.21996","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:13de39487c83e4b47126e034ff21b659e7af1807552ec34620c54c15497e5409","observation_id":"75c8dab1-c976-4b09-922f-1389cc1c5fa0","resolution":{"observed_at":"2026-07-01T10:25:41.910723Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.02283","last_updated":"2025-10-02T17:55:42Z","snapshot_observed_at":"2026-08-02T07:40:05.046770Z","submitted_at":"2025-10-02T17:55:42Z","title":"Self-Forcing++: Towards Minute-Scale High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":"2510.02283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.02283","snapshot_observed_at":"2026-07-08T13:14:53.231711Z","title":"Self-Forcing++: Towards Minute-Scale High-Quality Video Generation","venue":"cs.CV","work_id":"3b83d5f5-6929-46ae-9de2-7c32af3c7346","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2510.02283","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:e25aaf76c819ec761e3631637192d159eda6e5c1e0f971c0f240e7a58e34e483","observation_id":"2e29b78c-b609-4728-83b4-357d09374928","resolution":{"observed_at":"2026-07-01T10:25:41.903498Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-07-31T17:39:49.561332Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:d665786801be96da21e45e327c3cbf8d831a11e08be3f557958ea4108b79c1dc","observation_id":"c98223a1-3a5a-450e-be53-536016f92f0f","resolution":{"observed_at":"2026-07-01T10:25:41.921325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:57.160561Z","title":"In: Proceedings of the European Conference on Computer Vision (ECCV) (2018)","venue":null,"work_id":"44f9f292-9a19-49c1-8d19-57330c993905","year":2018},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:e79cd7e5319b2fec0aee29c20f90cafdd8e6ba3390421f6159b40f9996a1d732","observation_id":"9fb31033-1492-4bf4-bd9f-847bddc84627","resolution":{"observed_at":"2026-07-06T21:32:57.163093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:57.164586Z","title":null,"venue":null,"work_id":"1a624cc7-9404-42cf-b009-59dd8ec82458","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:fd7e294a052d5b136ce3c1136af6c6a2a734e6b55752912cfb89bebd05647f17","observation_id":"b199cec6-ad40-408a-9f81-9d756eafff11","resolution":{"observed_at":"2026-07-06T21:32:57.165957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:56.374383Z","title":null,"venue":null,"work_id":"5068f7b6-b0e9-4eb6-9929-9dd8933c6a43","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:fc2b03c9ff67ae1263d742a5be3015ceb9230cb654d2bffb514eea5b7d02f860","observation_id":"9d0de4d9-f4e4-46ca-9ee1-936be45d5336","resolution":{"observed_at":"2026-07-06T21:32:56.378054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:54def3aa4e6888905ac0cb2d2d46a2f10a0197bdbf22f860a05938edece53603","observation_id":"c999d9ed-8cc8-44a0-9c0c-b14696254935","resolution":{"observed_at":"2026-07-01T10:25:41.898990Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:55.770380Z","title":"In: ICLR (2025)","venue":null,"work_id":"1f1763d1-6a3a-4e9b-908d-c9e362dd1f71","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:dafec55bad1cc2d7e2784cffa38b585ab6a4a1f8c3ee0895053689d4cc160e7f","observation_id":"84cba3e3-b30b-4ead-9651-679b279b5dae","resolution":{"observed_at":"2026-07-06T21:42:55.781411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"cited_work":{"arxiv_id":"2503.19325","doi":"10.48550/arxiv.2503.19325","metadata_source":"pith","pith_arxiv_id":"2503.19325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","venue":"cs.CV","work_id":"9700bbdc-df42-461a-81fa-b29ffe683326","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2503.19325","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:a9b3fb30ceb9070b885777d36a5e03bb74eeb2f16fdb0d1c765050e60bcf965c","observation_id":"54ef385e-cd60-4df5-b5f5-ebede4a10af2","resolution":{"observed_at":"2026-07-01T10:25:41.883012Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-03T15:12:54.197163Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":"2503.10589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-07-04T08:59:42.126868Z","title":"Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, et al","venue":null,"work_id":"94a15b89-3e30-4736-9f73-4841caf301db","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:2f3a59cd5af5ef7afa452970b3ba341bb3484e9842b0999f8aab32dd8f71701b","observation_id":"6b89e04f-fe3f-4a2c-9f67-ee55b7245510","resolution":{"observed_at":"2026-07-01T10:25:41.893817Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:56.361707Z","title":null,"venue":null,"work_id":"b479b6f3-9afd-4f87-bdd7-991fcd0bff31","year":2018},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:772aa3ac34af9563e156a03e9c4f3be968397f78b09ef963a6c3084b3a1d1543","observation_id":"82bb8e3d-c4e3-4070-b98c-b0dec0973ee0","resolution":{"observed_at":"2026-07-06T21:32:56.363212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2404.02101","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-07-10T01:46:41.167891Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","venue":"cs.CV","work_id":"1c05c278-c023-4ef0-a359-25a41f1065eb","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:55bd591608438be69f151381c627867ae892c86699fb61014bb5b3c0f89e6e0b","observation_id":"aae2484c-f770-4b70-a50d-812a7bb414ca","resolution":{"observed_at":"2026-07-01T10:25:41.908460Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:6506ee2ae125b7fd2e29db511e436f16f28dc042da423be7108c207455ed65f8","observation_id":"afa6254d-dba9-4036-803b-59356d35d420","resolution":{"observed_at":"2026-07-01T10:25:41.892002Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04040","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:00:07.566418Z","title":"Relic: Interactive video world model with long-horizon memory.arXiv preprint arXiv:2512.04040","venue":null,"work_id":"d398db79-a718-4fff-a215-641fd1af997a","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:37302dd294c0194256a5650a7470725da4052c7eb05e179d7be494edef8b1593","observation_id":"cae09e41-14cb-401d-8834-fe323949b14b","resolution":{"observed_at":"2026-07-01T10:25:41.897139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":"2506.08009","doi":"10.48550/arxiv.2506.08009","metadata_source":"pith","pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","venue":"cs.CV","work_id":"53e58ef9-7932-4b83-b757-34ac14db3e0f","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:631421eef79b6f571d294707111f8ed141213aa73f3746d0c6d2d852c172a11a","observation_id":"12793a0a-e0bb-41bd-8971-dd9f8a2f5ca2","resolution":{"observed_at":"2026-07-01T10:25:41.899992Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:57.152714Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (2024)","venue":null,"work_id":"b949ae28-f24c-4677-ae19-6d3cd6322532","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:fc819c341f8f335fc8bc13d2699bcf7983b863ce56e08aa9e6a9235aafc1316f","observation_id":"a18952b9-13f4-40bd-bd17-3d811a25faa6","resolution":{"observed_at":"2026-07-06T21:32:57.153991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:57.150857Z","title":"Nature638(8051), 656–663 (2025)","venue":null,"work_id":"2ac2e742-f640-475e-a806-2b8d2db4eb5d","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:7e46e2dcf9ab67fd32f508f052e2b0971bb10f2ab359e24281449841a6068e24","observation_id":"8a4e114c-3eef-4c31-900f-bafe3caed023","resolution":{"observed_at":"2026-07-06T21:32:57.152130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:57.143119Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"090ac7ec-d498-4e79-a1a1-500767d9fbf3","year":2020},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:a58d866ac41f1ed4c020ec0f2422d598d9c2b9a9cec9f2477f48d9df5b929716","observation_id":"681661fa-5577-4f48-b633-dbc5863dae0c","resolution":{"observed_at":"2026-07-06T21:32:57.144449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:57.145104Z","title":null,"venue":null,"work_id":"a0c614b6-a9e3-40dd-8de4-49d790b75f8f","year":2013},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:2623b09624f9f5ed8863afcc2f8a37a6013bb29136d3c6d818ce18db94ae76ba","observation_id":"18414c1c-451c-4e81-bd55-b39d542d5a54","resolution":{"observed_at":"2026-07-06T21:32:57.146414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:57.147041Z","title":null,"venue":null,"work_id":"59e6b048-c519-4e66-8874-72fd27b8c534","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:aff80b9a7e4555908df98dfec580e48eb8be839876c5d3b47d6a4dfef158181b","observation_id":"b9ec92f2-ce38-4bc6-bc7d-c4d9638dab89","resolution":{"observed_at":"2026-07-06T21:32:57.148291Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":"2312.14125","doi":"10.48550/arxiv.2312.14125","metadata_source":"pith","pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","venue":"cs.CV","work_id":"5cc3572d-7e2f-4431-ae42-d9282a42a800","year":2023},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:b6d0ded358b4ea84e682cb634772756f804aa314a3f0d3ff148f9f87f6ef4d45","observation_id":"d09c0f50-9b73-4199-9535-72598503a29a","resolution":{"observed_at":"2026-07-01T10:25:41.910873Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:c71a3e22d82eaa9e620d2255228cc95467a1e4d068eaed96be50575fd3326752","observation_id":"5194b4d8-d4c6-4d11-ad92-971724e51a0b","resolution":{"observed_at":"2026-07-01T10:25:41.913335Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:57.154583Z","title":null,"venue":null,"work_id":"ded9cafb-8c45-4c7c-aeb3-79c95ad4b707","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:eb529a5cc7deb191a9412f49fe6151eea455c3d52064a1e6a1d22ad8e67d2ab1","observation_id":"8c5e2fdc-c89a-451b-aa6f-839914c1cc71","resolution":{"observed_at":"2026-07-06T21:32:57.155823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:06:35.483671Z","title":"In: International conference on machine learning","venue":null,"work_id":"22ffc0fc-0e30-4787-a2dc-413b36c1ba9d","year":2023},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:16f5d3a2d58f97da54f612b3310948f1db9e5112e66745593cc3fc1417d4d19d","observation_id":"816534a7-565c-4a14-9596-9814748547c7","resolution":{"observed_at":"2026-07-06T21:32:57.159902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18903","last_updated":"2025-08-14T14:03:30Z","snapshot_observed_at":"2026-08-06T23:12:26.930611Z","submitted_at":"2025-06-23T17:59:56Z","title":"VMem: Consistent Interactive Video Scene Generation with Surfel-Indexed View Memory","version":3},"cited_work":{"arxiv_id":"2506.18903","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18903","snapshot_observed_at":"2026-07-03T17:58:47.750659Z","title":"Vmem: Consistent interactive video scene generation with surfel-indexed view memory","venue":null,"work_id":"8c6afc6c-7c32-41eb-87c1-e51bca941b63","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2506.18903","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:40c5ac1fccad78be570afcb0758003b6f022e91c41cf1daafbaffef809929acd","observation_id":"f7f4d308-7a1d-48e0-b60e-b026f81abe37","resolution":{"observed_at":"2026-07-01T10:25:41.888623Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":"2406.11838","doi":"10.48550/arxiv.2406.11838","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Autoregres- sive image generation without vector quantization.arXiv preprint arXiv:2406.11838","venue":"arXiv (Cornell University)","work_id":"154fdf62-5447-4dd1-bd62-d1188d2c4915","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:ddbb3b79c2b7e6f483332410e2cee2da02f074feffd7e69c9c56755fc3ea7ac9","observation_id":"1ac16127-092b-4769-94aa-2905eb528ac3","resolution":{"observed_at":"2026-07-01T10:25:41.896692Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.09212","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T10:54:49.237140Z","title":"Stable video infinity: Infinite-length video generation with error recycling.arXiv preprint arXiv:2510.09212","venue":null,"work_id":"cefcc1f7-7c1c-4881-9a8a-e91b74f1054c","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:82c596e67497e5a0a98c05d7087218c5b84f074a098d0941cf11cba2e8d69c5c","observation_id":"17dbca03-176d-42f7-8cd7-2043e9a48df9","resolution":{"observed_at":"2026-07-01T10:25:41.861034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.15675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:39:29.668820Z","title":"Sekai: A video dataset towards world exploration","venue":null,"work_id":"019b873e-99fa-4bf3-b771-a76531c86aa7","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:d77172223414451d16953a37970c3c569fd712c3d6214051cf5f1fce6ad3752c","observation_id":"7e34d0c9-71cf-440b-b908-fdd8adc2fdf6","resolution":{"observed_at":"2026-07-01T10:25:41.849473Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:57.139325Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision (2025)","venue":null,"work_id":"301bafd1-4b4f-4d04-84f0-dbc5cce2c05a","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:5ad90dcb9ff905d520d902a6d9d67e98e1dc9cf60158770ffc2e422bb64a5cec","observation_id":"67c37e6f-b2e7-49d8-83d2-9be801eb0453","resolution":{"observed_at":"2026-07-06T21:32:57.140613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25161","last_updated":"2025-09-29T17:57:14Z","snapshot_observed_at":"2026-07-06T22:31:10.099674Z","submitted_at":"2025-09-29T17:57:14Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","version":1},"cited_work":{"arxiv_id":"2509.25161","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.25161","snapshot_observed_at":"2026-07-08T10:54:49.169100Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","venue":"cs.CV","work_id":"e44fcf99-6683-4319-a07d-0db4c89ff93c","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2509.25161","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:50b7e998327ec189a3973e67c8d1e3697d88f1afd53edf6ec073f71535c201ff","observation_id":"caa55e36-23fa-416d-8b9d-c8db606074da","resolution":{"observed_at":"2026-07-01T10:25:41.915944Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06699","last_updated":"2025-03-21T08:55:03Z","snapshot_observed_at":"2026-07-06T20:04:01.034597Z","submitted_at":"2024-12-09T17:44:56Z","title":"You See it, You Got it: Learning 3D Creation on Pose-Free Videos at Scale","version":3},"cited_work":{"arxiv_id":"2412.06699","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06699","snapshot_observed_at":"2026-07-01T10:25:41.859211Z","title":"arXiv preprint arXiv:2412.06699 (2024) 18 J","venue":null,"work_id":"745e5ba6-c7d9-4250-954c-c30b399fe838","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2412.06699","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:ca9a3dc0a0046db64f168c0852e149d172b84d5c448a76bc7e1386b531e5357c","observation_id":"7fb6c6e3-cebc-402a-b540-9085c512c474","resolution":{"observed_at":"2026-07-01T10:25:41.860876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:57.141247Z","title":null,"venue":null,"work_id":"9bbd187f-3caf-4e71-a8f8-c9b8f313ca40","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:48fa2799d8ac75c9728ac7c11199a33223be285e35f0296b06dde3bea79d93dc","observation_id":"b2c96aa3-b62a-4177-8817-3d0a47eef048","resolution":{"observed_at":"2026-07-06T21:32:57.142488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:57.131636Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision (2023)","venue":null,"work_id":"b0d9537b-800e-4d48-9e77-7152c6d345d9","year":2023},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:72f7637ebf8edbb2445ad8c1c25c215990d8bc88a86dd56fcbcc43f46bb5c30a","observation_id":"81a84eb7-8fb1-4ae8-99f9-ead925a67836","resolution":{"observed_at":"2026-07-06T21:32:57.132982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-06T11:55:20.314872Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"cited_work":{"arxiv_id":"2505.20171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20171","snapshot_observed_at":"2026-07-10T18:57:31.679784Z","title":"Long-context state-space video world models.ArXiv, abs/2505.20171","venue":"cs.CV","work_id":"c35e6872-01ea-417a-ba0f-442c82e051c5","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2505.20171","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:27401b8abe219ac34fa334d32de05f079c4a7976f3d819f02696c693b21be556","observation_id":"aa774030-1094-409a-b8ea-c2344f10c2e0","resolution":{"observed_at":"2026-07-01T10:25:41.872252Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:57.133633Z","title":"In: International conference on machine learning (2021)","venue":null,"work_id":"6fed4b0e-5658-4385-b897-45c43b5832d7","year":2021},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:b761c042a90dc7bc346e84dc7ea5919b37a8f4646d7121b8c22d80bebfbb0186","observation_id":"aea3eaaa-479d-42eb-9dd9-6574935f633c","resolution":{"observed_at":"2026-07-06T21:32:57.134912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03751","last_updated":"2025-03-05T18:59:50Z","snapshot_observed_at":"2026-07-06T20:47:23.647914Z","submitted_at":"2025-03-05T18:59:50Z","title":"GEN3C: 3D-Informed World-Consistent Video Generation with Precise Camera Control","version":1},"cited_work":{"arxiv_id":"2503.03751","doi":"10.48550/arxiv.2503.03751","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03751","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Gen3c: 3d-informed world- consistent video generation with precise camera control","venue":null,"work_id":"0034efa2-c99c-440f-87e8-e360b84beabe","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2503.03751","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:0427c4745d4232b38ebe259dfb3aaf7ffd1316060d2565f6187356486fa3be50","observation_id":"04f205f9-923d-4577-9eff-6ed2399902e5","resolution":{"observed_at":"2026-07-01T10:25:41.880404Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:57.137519Z","title":null,"venue":null,"work_id":"68b53f1c-7c3d-4975-a131-89e315bee296","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:57d44e20b8a97ae2fdde34595a6f6217fae485e57056b1f9e84ceaff6fd4f4f7","observation_id":"b987a8e7-7a66-4969-a198-544585e4ffb1","resolution":{"observed_at":"2026-07-06T21:32:57.138753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06764","last_updated":"2025-07-24T03:58:47Z","snapshot_observed_at":"2026-07-06T20:34:11.407726Z","submitted_at":"2025-02-10T18:44:25Z","title":"History-Guided Video Diffusion","version":2},"cited_work":{"arxiv_id":"2502.06764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.06764","snapshot_observed_at":"2026-07-08T03:24:28.724863Z","title":"History-Guided Video Diffusion","venue":"cs.LG","work_id":"7822dfb2-a168-4080-8673-2dfafbe1a2ab","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2502.06764","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:1385d292c5e6bccb2505d1fde905a1a0ebfa52e11b82c3c3d8270c3a66fc4d73","observation_id":"84c63bd2-aaf7-4a3c-b20f-6dfe87c726f5","resolution":{"observed_at":"2026-07-01T10:25:41.919041Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.14614","last_updated":"2026-06-09T16:18:08Z","snapshot_observed_at":"2026-08-03T16:11:09.055651Z","submitted_at":"2025-12-16T17:22:46Z","title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","version":2},"cited_work":{"arxiv_id":"2512.14614","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.14614","snapshot_observed_at":"2026-07-09T07:56:04.709254Z","title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","venue":"cs.CV","work_id":"48231e12-6c15-4f28-8c51-092766c59f93","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2512.14614","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:3acde9b013cb88cfba4b6a277e0060fb0f4b1a49f83d1f545fec47bec1382ea3","observation_id":"6d647461-2589-4cc2-a54b-a8e47a753a79","resolution":{"observed_at":"2026-07-01T10:25:41.853105Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-07-06T19:06:23.640089Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":"2408.14837","doi":"10.48550/arxiv.2408.14837","metadata_source":"pith","pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Diffusion Models Are Real-Time Game Engines","venue":"cs.LG","work_id":"3f074579-63c2-40bf-b5c8-c6a8c39d9319","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:f6b8097800e304af0ea1266de278954c1b903e5d34c01a5a50912b1edde3f7d6","observation_id":"0432838b-d6ee-487d-9491-890efb8ee03c","resolution":{"observed_at":"2026-07-01T10:25:41.891328Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:6519bc06a97ca4bc68a2423b4d42f80c34bb48a46c05d67b5f1b746524ad9342","observation_id":"12624228-3b4e-4d3e-a2d3-55da533fbc2c","resolution":{"observed_at":"2026-07-01T10:25:41.836084Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.09676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:56:04.737468Z","title":"Spatialvid: A large-scale video dataset with spatial annotations.arXiv preprint arXiv:2509.09676, 2025a","venue":null,"work_id":"fa42660a-b999-4c7f-80c9-2b72151c3399","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:b5c6c7de6d61e9d58ca00378fc10f16a49095d322e2fc4f5aca06c579c6040a4","observation_id":"d07a1447-45c7-45f5-9389-ca870f8e7605","resolution":{"observed_at":"2026-07-01T10:25:41.830907Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:82a46b255136fd4583c0488e17213823f88df0dda0e4bfb9f7a122ee34e1b7ff","observation_id":"c33ce58a-702d-4ced-b31d-5e2776be1de2","resolution":{"observed_at":"2026-07-01T10:25:41.833228Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:57.125183Z","title":"In: ACM SIGGRAPH 2024 Conference Papers (2024)","venue":null,"work_id":"4686dddd-dfea-4507-94f9-fe78221328cc","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:b61686848871133f9be179d91451f1fc3e416a19915d59f50b6b86fc7609d32c","observation_id":"2bba5cca-22dd-49eb-b132-e98335b05796","resolution":{"observed_at":"2026-07-06T21:32:57.126584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-07-06T21:37:28.044836Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":"2506.05284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-07-03T17:58:47.769652Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":"dbc95f37-bd69-4309-9971-934e68e24e7b","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:d9d72bbb81e51cdf2dee77252f5db2d62a0bffc09617bf854e821ab82e234863","observation_id":"e4e4f89e-2fa9-4b30-8169-d9633376bce8","resolution":{"observed_at":"2026-07-01T10:25:41.838697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:57.127290Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"606a3a00-e246-4029-83eb-6287deb54e1c","year":2019},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:b8919458253fec7c8c73c78e724205a0f11702fd47c7357a3c6a1933043ef6b4","observation_id":"2709d5c1-48e3-48ab-a179-a185295505ec","resolution":{"observed_at":"2026-07-06T21:32:57.128817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.12369","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:19:13.356094Z","title":"arXiv preprint arXiv:2504.12369 , year=","venue":null,"work_id":"7159175f-77a7-43d9-8dc3-54bda91b0e0b","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:ca5a21cbfdbab227c98145b1fab24aee683b73d4d344faf338b9dacd8dffcf98","observation_id":"265ec9f6-814f-4f2b-8463-8bdcce49c448","resolution":{"observed_at":"2026-07-01T10:25:41.846449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-07-06T11:02:11.424356Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":"2104.10157","doi":"10.48550/arxiv.2104.10157","metadata_source":"pith","pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","venue":"cs.CV","work_id":"703c74c3-fa5e-455c-8c00-697c83511fcf","year":2021},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:1a7e17b435f58e22505ffc7a09d1ba81a7b778eea5d49cc08be478a9ef347572","observation_id":"f33a7c57-0642-4630-bc56-ed301e2b561d","resolution":{"observed_at":"2026-07-01T10:25:41.872227Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:57.120990Z","title":"In: Proceedings of the 41st International Conference on Machine Learning (2024)","venue":null,"work_id":"fdcf458d-c2ce-4227-9d29-8c29d5a41933","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:5d4d18e153c365da227a8ef104bec26b2128ef529cecf2544a85401f91f49d2b","observation_id":"afaa112b-8b63-4005-b62b-ca90d465f046","resolution":{"observed_at":"2026-07-06T21:32:57.122371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:57.119062Z","title":null,"venue":null,"work_id":"f1495d1b-6c08-4a71-9760-63b0aabc0c94","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:cad326837db5c1c12b34cbf6cdd774636f0bc3d8ad97df8453f59e61a9b8dfbf","observation_id":"8746157e-ccd6-4889-bb38-21511a3953ef","resolution":{"observed_at":"2026-07-06T21:32:57.120347Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:5b34dd4b94ddbb0db63b81e74ed3eae51e18d5ee353def1caabe33737fc60344","observation_id":"a9bb7f45-bd7e-40c9-bcc9-e66f8a66cfa0","resolution":{"observed_at":"2026-07-01T10:25:41.828161Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:cd5e0bf83409f3c10ae47b9813f68e3c4836954c16354c2222ae75ca9c15e898","observation_id":"17abb7ed-3b89-4867-be70-77e2668940d6","resolution":{"observed_at":"2026-07-01T10:25:41.817110Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:57.123071Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":"56a56669-2595-4113-b6b2-4647ebc18edf","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:fb8ed690f066b9a78a64574f9afa513844be05d130e03dc89e5c2bb964a5bc26","observation_id":"393f630b-cfc2-4b5a-a16f-a387359afdab","resolution":{"observed_at":"2026-07-06T21:32:57.124546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:47:44.287663Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"8f80e441-b1c7-4d53-9403-fb56d52b8c38","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:2b2f1ddbe59c52a4cc6c97c1d2d491998d008969801222541e424793d95fec3b","observation_id":"44e5c282-180f-4269-ae33-5536e43c23dc","resolution":{"observed_at":"2026-07-06T21:32:57.130980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-07-06T21:36:01.328140Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":"2506.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-07-03T17:58:47.760773Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141","venue":null,"work_id":"e279c098-3b79-4f32-a246-d51ad9df6c2a","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:3fef428ef593dfdbb8c321373ff42d82fda145c85b76f8ab40f10148ec059f3c","observation_id":"7bf165a4-308a-412f-8e7b-143ac53ad726","resolution":{"observed_at":"2026-07-01T10:25:41.877273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21853","last_updated":"2025-04-30T17:59:02Z","snapshot_observed_at":"2026-07-06T21:17:09.837496Z","submitted_at":"2025-04-30T17:59:02Z","title":"A Survey of Interactive Generative Video","version":1},"cited_work":{"arxiv_id":"2504.21853","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.21853","snapshot_observed_at":"2026-07-03T00:57:29.745635Z","title":"A survey of interactive generative video","venue":null,"work_id":"af6d5617-9cab-4961-8dfe-4aab1dd13a9b","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2504.21853","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:da82e2824c76b5f6efca870a8decbc809e3db7e92930815f1166f1abf13f7402","observation_id":"764f8600-24b9-4a67-b451-03bfe4c7113a","resolution":{"observed_at":"2026-07-01T10:25:41.811839Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17359","last_updated":"2025-05-29T16:42:53Z","snapshot_observed_at":"2026-07-06T20:56:53.615535Z","submitted_at":"2025-03-21T17:59:22Z","title":"Position: Interactive Generative Video as Next-Generation Game Engine","version":2},"cited_work":{"arxiv_id":"2503.17359","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17359","snapshot_observed_at":"2026-07-07T15:43:53.787763Z","title":"Position: Interactive Generative Video as Next-Generation Game Engine","venue":"cs.CV","work_id":"0ca57b78-e42a-4f65-97fd-168cbf258d99","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2503.17359","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:2b4d1431517c14a1aeb23d6b6e756444410207ce1c69c80191e5b1550334e3c0","observation_id":"d87793ea-c4cc-475f-a2fa-983dfdeb384c","resolution":{"observed_at":"2026-07-01T10:25:41.819798Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:32:57.135503Z","title":null,"venue":null,"work_id":"f635704f-e18f-403c-a11e-26cf6732af52","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:2d9b1367e96488ad92634495fb8f0770a7b60b8aee75bb9b26cd0304bbf28a7d","observation_id":"c8295003-00f8-4813-a388-0e2464ae6b08","resolution":{"observed_at":"2026-07-06T21:32:57.136862Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02048","last_updated":"2024-09-03T16:53:19Z","snapshot_observed_at":"2026-07-06T19:09:55.393720Z","submitted_at":"2024-09-03T16:53:19Z","title":"ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis","version":1},"cited_work":{"arxiv_id":"2409.02048","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02048","snapshot_observed_at":"2026-07-07T14:03:48.606626Z","title":"ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis","venue":"cs.CV","work_id":"af2e8736-e001-407f-b94e-21e98f89ec55","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2409.02048","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:040a64c09a609f41e5c6c11814330184395c9ef0c6e958f0d00f030d923327dc","observation_id":"1b1944bf-bab8-4e10-aa3c-0cda17ff2167","resolution":{"observed_at":"2026-07-01T10:25:41.810794Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.12626","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.170375Z","title":"Lvmin Zhang, Shengqu Cai, Muyang Li, Chong Zeng, Beijia Lu, Anyi Rao, Song Han, Gordon Wetzstein, and Maneesh Agrawala","venue":null,"work_id":"346b7c9e-ca8e-406d-8770-be430b5f63eb","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:ccea294c5212231c926e69a198a523bd48ce8ae9fa3ec5655e20b15a7dee258e","observation_id":"9c4e45ad-e197-411c-a260-d00cdf4cb04b","resolution":{"observed_at":"2026-07-01T10:25:41.874804Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04983","last_updated":"2025-02-01T02:40:49Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:54:37Z","title":"DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning","version":2},"cited_work":{"arxiv_id":"2411.04983","doi":"10.48550/arxiv.2411.04983","metadata_source":"pith","pith_arxiv_id":"2411.04983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning","venue":"cs.RO","work_id":"4a946586-a786-46da-9388-197c5410bf39","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2411.04983","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:ddc890cf6c884e4fa858269179df542a6263ea4cf769673de245fcdc14876fb2","observation_id":"3e632ca4-59da-4162-9a96-2926a0c6a59e","resolution":{"observed_at":"2026-07-01T10:25:41.850838Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T22:49:30.554473+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T22:49:30.554473+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05495","last_updated":"2025-05-05T17:59:17Z","snapshot_observed_at":"2026-08-05T04:37:38.213689Z","submitted_at":"2025-05-05T17:59:17Z","title":"Learning 3D Persistent Embodied World Models","version":1},"cited_work":{"arxiv_id":"2505.05495","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.05495","snapshot_observed_at":"2026-07-01T20:46:13.696776Z","title":"Learning 3d persistent embodied world models.arXiv preprint arXiv:2505.05495","venue":null,"work_id":"3cdfb30b-e277-4125-8612-a58c4885d307","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2505.05495","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:f5808dd0122b0312ceb0287fc9abb982cfa6cee59f000a70ec92eeef927c8d43","observation_id":"fd39595d-301a-4a34-b854-dfaa4c1b5689","resolution":{"observed_at":"2026-07-01T10:25:41.879808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.12201","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T02:27:45.680254Z","title":"Omniworld: A multi-domain and multi-modal dataset for 4d world modeling","venue":null,"work_id":"a2a9311e-9a5a-4a48-947d-c1f5e4eddd0b","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:5491cb618b195bc6b35a54b863973e35bb977d78eb7b929a58b46099c1945e0f","observation_id":"ea32659f-6a06-4cf6-8112-b07271200be9","resolution":{"observed_at":"2026-07-01T10:25:41.837376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14540","last_updated":"2025-07-29T16:48:03Z","snapshot_observed_at":"2026-08-06T20:16:51.288291Z","submitted_at":"2024-06-20T17:50:16Z","title":"IRASim: A Fine-Grained World Model for Robot Manipulation","version":2},"cited_work":{"arxiv_id":"2406.14540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.14540","snapshot_observed_at":"2026-07-10T04:16:48.676072Z","title":"Irasim: A fine-grained world model for robot manipulation","venue":"cs.RO","work_id":"94cf4d33-9a24-4155-b8ea-0a2f2d71fadc","year":2024},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2406.14540","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:8f84ecee2b741ed05a78d2a4f0673649831576b6f253f6705c16ffe3c9253566","observation_id":"cae434dd-a0cc-4eb1-9612-8db8fb619020","resolution":{"observed_at":"2026-07-01T10:25:41.866546Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":32,"parse_uncertain":0,"unresolved":10,"verified_exact":14,"verified_fuzzy":19},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 1 inbound Pith citation observation for arXiv:2606.31734."}