{"as_of":"2026-08-19T06:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2baf62ae6328699904998425e2130e2b63372333b1b4fc96c14dbc0dcf0973a6","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T11:00:44.057737Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:18:56.547557Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T22:18:57.314358Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"cited_work":{"arxiv_id":"2501.16753","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.16753","snapshot_observed_at":"2026-08-15T22:18:57.314358Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","venue":"cs.CV","work_id":"c29aba7d-77c7-4674-ae72-7c7ae91543ac","year":2025},"citing_paper":{"arxiv_id":"2505.07528","last_updated":"2025-05-12T13:10:46Z","snapshot_observed_at":"2026-08-19T05:16:31.254819Z","submitted_at":"2025-05-12T13:10:46Z","title":"SEReDeEP: Hallucination Detection in Retrieval-Augmented Models via Semantic Entropy and Context-Parameter Fusion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T22:18:56.547557Z"},"links":{"cited_paper":"/paper/2501.16753","citing_paper":"/paper/2505.07528"},"observation_digest":"sha256:95be3db15c3924c4beea14284e8cdf79546d11772260b45494ca7799e8a322d8","observation_id":"81243e9a-94d1-476a-ac69-8518f2ebcf3b","resolution":{"observed_at":"2026-08-15T22:18:57.321095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.16753/citation-record","integrity":"/paper/2501.16753/integrity","json":"/paper/2501.16753/citation-record.json","paper":"/paper/2501.16753"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:43.824542Z","title":"Vivit: A video vision transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.824542Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:259bee2f58a135754d10bfc3bc73d4b3ec539110d7392df5d6d3c795d1477ca5","observation_id":"7c8cb39d-cc3d-4353-9c7b-5531f3584465","resolution":{"observed_at":"2026-08-10T11:00:43.824542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.843720Z","title":"The problem of learning long-term dependencies in recurrent net- works","venue":null,"work_id":"0be0f364-6318-4b98-abb2-57485e5317cf","year":1993},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.831846Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:659ab30716accdaaea25560591f4aef341af7220bd7045c4b66ed996e8f572fc","observation_id":"d9432036-8a94-4b45-aebd-3d59484d4afb","resolution":{"observed_at":"2026-08-10T11:00:44.850013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:43.837210Z","title":"Mau: A motion- aware unit for video prediction and beyond","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.837210Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:d0de9b507e467936fbe6b5fe60cc6fbfc295b3906af3082b082be73e91f10ef4","observation_id":"5cbfcd8c-1024-4622-8326-8dd2db28d6ed","resolution":{"observed_at":"2026-08-10T11:00:43.837210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.809604Z","title":"Two deterministic half-quadratic regular- ization algorithms for computed imaging","venue":null,"work_id":"95acead8-beb2-4446-8031-218c2bad2c10","year":1994},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.842638Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:f3080202391733c0100c577b7e99f71132ab2c78b58fffc5fb52815271f358ea","observation_id":"6e789d69-a2ff-4c76-b4a0-e5945fea68ea","resolution":{"observed_at":"2026-08-10T11:00:44.815989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T11:00:43.848570Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.848570Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:569b24988cf796e9202c4714ff078b5d3d40045e4f4a51bd6160c3ee77d66f20","observation_id":"e8b29043-774d-4513-a480-1f17d832c552","resolution":{"observed_at":"2026-08-10T11:00:43.848570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.786908Z","title":"Anticipative video transformer","venue":null,"work_id":"ded547df-2e1e-4343-bee0-80d4ea37b507","year":2021},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.855184Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:f006d463bdd9444c6625dd2bb170976d15906f066468f0804c62d7459847362e","observation_id":"7a826fde-6fef-4185-b180-1eb9dd480358","resolution":{"observed_at":"2026-08-10T11:00:44.792971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:43.861972Z","title":"Human action recognition and predic- tion: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.861972Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:2494f2d092f5317274d2fe87aebd4cd222efe10bf6d0b365392cb90994a3b215","observation_id":"91f251bd-da48-419b-b6af-92f48cbf38fe","resolution":{"observed_at":"2026-08-10T11:00:43.861972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.752067Z","title":"Self-attention convlstm for spatiotemporal prediction","venue":null,"work_id":"2699a911-5f21-4df3-83da-b449b825cf0e","year":2020},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.870169Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:6d9f5b7e324c084d8fa07de5894d69d8745e41e21ec4855af04f57e8885885e1","observation_id":"fadb459a-d090-488f-bf70-4e5839b83da9","resolution":{"observed_at":"2026-08-10T11:00:44.758053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-10T11:00:43.884092Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.884092Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:d6285ad663a85dfb2158611c203e2743032e6464edf15373a6b9ceda7185e863","observation_id":"0cdd509f-83ef-4f56-b577-56b90f289185","resolution":{"observed_at":"2026-08-10T11:00:43.884092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.731463Z","title":"Future frame prediction using convolutional vrnn for anomaly detection","venue":null,"work_id":"a3d734f2-2c49-49f6-ba7c-43e2fe32a53b","year":2019},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.890616Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:b46ac2ded6400bce60f209863c8c7db2ed28d6214f0adaf0e098a8e01229a753","observation_id":"7469969a-c29a-4107-83d5-9abb095623e1","resolution":{"observed_at":"2026-08-10T11:00:44.739666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.709571Z","title":"Anomaly detection in crowded scenes","venue":null,"work_id":"7257c1f6-33f1-4291-8026-3b9d4c3d73f3","year":2010},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.896994Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:1bedc98aa870b0cd71a2a0ea4335490921b75c71ff89022f4ef3407bbce5c40d","observation_id":"23416522-4fbd-4eed-9062-08a519ea5109","resolution":{"observed_at":"2026-08-10T11:00:44.715588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.690177Z","title":"A hybrid transformer-lstm model with 3d separable convolution for video prediction","venue":null,"work_id":"557dd79b-36fb-4344-9396-c4c5d901512f","year":2024},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.902032Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:0230cfbe1b7e0cdca3d5eb25575025be411cb9e92774a46d1712b442a9850465","observation_id":"cdad764b-de1b-4124-a5e3-dc2e2cd1e519","resolution":{"observed_at":"2026-08-10T11:00:44.695700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05440","last_updated":"2016-02-26T22:10:30Z","snapshot_observed_at":"2026-08-14T22:22:34.655459Z","submitted_at":"2015-11-17T15:36:32Z","title":"Deep multi-scale video prediction beyond mean square error","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05440","snapshot_observed_at":"2026-08-10T11:00:43.909127Z","title":"Deep multi-scale video prediction beyond mean square error","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.909127Z"},"links":{"cited_paper":"/paper/1511.05440","citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:0537408fe4b06b566fa5b9b50e64750e97f06ac36e757dc44519310cf7900ef2","observation_id":"9872831a-fdfd-43be-affe-e7e7a135de25","resolution":{"observed_at":"2026-08-10T11:00:43.909127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.669886Z","title":"Unflow: Un- supervised learning of optical flow with a bidirectional cen- sus loss","venue":null,"work_id":"8110b52f-50a8-4604-8ce3-5bc4e40da653","year":2018},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.916115Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:8f165d92d062a873d6c7cf1c08490a10371d85b8a28b6234fcc5fca83ec4d158","observation_id":"ab9cd15f-5bcd-40d2-a6b7-f921176b97fb","resolution":{"observed_at":"2026-08-10T11:00:44.677032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.643576Z","title":"Conditional image-to-video gener- ation with latent flow diffusion models","venue":null,"work_id":"c4a65c3c-edfe-4a16-9620-327310637950","year":2023},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.921485Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:362769d2cf62d2554f72a022980cb146878c4520eb6760436204830dc8e6c6bc","observation_id":"d215e10c-ecdb-4611-bd2d-8180ebaaec77","resolution":{"observed_at":"2026-08-10T11:00:44.650439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.619588Z","title":"Mimo is all you need: A strong multi-in-multi-out base- line for video prediction","venue":null,"work_id":"b69e4018-ee78-4a78-9101-4e3c1012fd46","year":1975},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.929776Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:8b572d12a7f94c21d4962fd44b6734a71ac08665d8f62e71be3d48cc43dcbb46","observation_id":"44c5114e-a36b-4c70-b69b-799824f00b0f","resolution":{"observed_at":"2026-08-10T11:00:44.628550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.597716Z","title":"Recog- nizing human actions: a local svm approach","venue":null,"work_id":"330ec786-0c6c-430d-9060-6fdf79760c9a","year":null},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.940570Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:24a2479efb9b227c1a9768763a73af53cf3b6a36811355445d6ddefaf169e01a","observation_id":"e37083df-688e-4608-9f80-89771acd2dff","resolution":{"observed_at":"2026-08-10T11:00:44.605171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.554918Z","title":"Convolutional lstm network: A machine learning approach for precipitation nowcasting","venue":null,"work_id":"ec7973fb-5b48-462f-a3bb-80dbe8dff22f","year":2015},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.953982Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:8f366381e7b377569899e3d4191d6e868e5b4b5aaa1948536c36e917a40cb54f","observation_id":"1d24637e-ca10-4901-a752-9c0404cc01e0","resolution":{"observed_at":"2026-08-10T11:00:44.560910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.533928Z","title":"Deep learning for precipitation nowcasting: A benchmark and a new model","venue":null,"work_id":"c15ad951-697b-4129-9d7f-941d29495103","year":2017},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.961011Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:a1d7c5b2db91e12ddf6e54db90db1f761a0dc209476a50873a168be68aba7931","observation_id":"17f09259-cc1e-4456-93d7-e72d166840b2","resolution":{"observed_at":"2026-08-10T11:00:44.542957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.514730Z","title":"Action recognition in realistic sports videos","venue":null,"work_id":"f54677fb-d023-4e44-8297-e90e01bafe93","year":2015},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.968900Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:1397a66827aeda169d7bfb6a5040c7f40345fe2aa4852bb4710a168efe468382","observation_id":"b5f7726a-9b47-49b0-8241-9ba48eaac9e0","resolution":{"observed_at":"2026-08-10T11:00:44.521276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:43.975956Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.975956Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:8e54bbe40aeeb7a5c199530acb028182a6fc6cc93c7be4617550835c03383f04","observation_id":"798f0b1c-fbc6-40de-91fe-0eb3a067b070","resolution":{"observed_at":"2026-08-10T11:00:43.975956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.470195Z","title":"Predrnn: Recurrent neural networks for predictive learning using spatiotemporal lstms","venue":null,"work_id":"0bea7ae9-3f39-41b8-a255-e11b1f1e1282","year":2017},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.984385Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:68d77730cfaaf52f153342fcbae6203bd9ac296e7822194898a8a1b4c8851ff6","observation_id":"04fe17aa-b451-435b-844f-5baa1e435934","resolution":{"observed_at":"2026-08-10T11:00:44.478919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.447840Z","title":"Predrnn++: Towards a resolution of the deep-in-time dilemma in spatiotemporal predictive learn- ing","venue":null,"work_id":"dccbbb17-1356-43e8-81af-4aabc29cbb6d","year":2018},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.990205Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:cdba6d84d6f87c675d3bff16ae4c689823c52e01b9783c22e41fe60b21b0ebaf","observation_id":"2ff18651-306f-4d52-8f53-74324415bfa3","resolution":{"observed_at":"2026-08-10T11:00:44.454010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.428494Z","title":"Eidetic 3d lstm: A model for video prediction and beyond","venue":null,"work_id":"68b10d90-0816-402c-b0fe-04f1efd249d5","year":2018},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.998454Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:a8a65d820590810f1f9f368864b16cbc830cab599086cd47c22e18d7c9001f52","observation_id":"43806011-54cf-40e2-a0f2-1947c8d40a3d","resolution":{"observed_at":"2026-08-10T11:00:44.434300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.404256Z","title":"Memory in memory: A predictive neural network for learning higher-order non- stationarity from spatiotemporal dynamics","venue":null,"work_id":"d8fbf9a7-be76-4dd9-9faa-1f5570ddcf04","year":2019},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:44.005210Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:b47b22785c03c855ddc63b7c964681c5ee1dc2d6c36578a26eb4e4f1be5f13dd","observation_id":"c5ed0d94-e05d-4265-984c-0d96359c6da5","resolution":{"observed_at":"2026-08-10T11:00:44.410969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.375495Z","title":"Motionrnn: A flexible model for video predic- tion with spacetime-varying motions","venue":null,"work_id":"ba2d6b11-b581-4a43-a6f9-444dd31de23b","year":2021},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:44.010861Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:18022b9209acc2d0584aa8679b0fee8a40f9ec4f3f658da1756fcfb274eaa6dd","observation_id":"3feae6c7-3cad-4971-80b7-fc3db30f69a5","resolution":{"observed_at":"2026-08-10T11:00:44.385912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.346506Z","title":"Mo- tionnet: Joint perception and motion prediction for au- tonomous driving based on bird’s eye view maps","venue":null,"work_id":"e7fa5fc0-c3ae-4d94-91f2-1c51d2c4eb6d","year":2020},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:44.016830Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:ad69e590f6bb65df3e8d0d62686dc3e65ef70f8f2fd841e242b9917927b5ceeb","observation_id":"92e5f341-d97f-439d-be6f-40f92f0949c0","resolution":{"observed_at":"2026-08-10T11:00:44.353236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.323748Z","title":"Vptr: Efficient transformers for video prediction","venue":null,"work_id":"a19a3d92-0bae-4586-a759-0cae2be30381","year":null},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:44.022936Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:2cb9182eb34eb4219207c39dd67077a18c4d0f1ed49e8ce6171bfdcfc67b8ca5","observation_id":"69e3ed10-248f-46a5-8b79-55f2ac7c2e3d","resolution":{"observed_at":"2026-08-10T11:00:44.330062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.269417Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"f23d45ec-ec75-434d-a534-c2c75da39642","year":2018},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:44.036015Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:254dcb698852224a23018546ae410a25bb93b56bf5d91319a95a03d57c08589a","observation_id":"dfdb9c5a-590b-4e6e-b3de-9d7cc930e3f6","resolution":{"observed_at":"2026-08-10T11:00:44.277133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.244811Z","title":"From actemes to action: A strongly-supervised representa- tion for detailed action understanding","venue":null,"work_id":"f40d9142-b77f-4000-bc69-c9c146e68753","year":2013},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:44.044572Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:a060a45ade88a9595f62dc4c59418f70d26c8545db9f42f5bbcff3acac36891f","observation_id":"361883b8-ac7f-4d10-bb4a-e08116fd2dee","resolution":{"observed_at":"2026-08-10T11:00:44.251465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.222767Z","title":"Extdm: Distribution extrapolation dif- fusion model for video prediction","venue":null,"work_id":"38544578-9a6b-42a0-b661-2c7e29beaf04","year":2024},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:44.050482Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:5d1858f4ab130a520fea9c9d95f4509851723f8d434484b4d8eb199c40d77f95","observation_id":"433a0420-11d2-4ee7-aeaf-4a8ee7df0c73","resolution":{"observed_at":"2026-08-10T11:00:44.229542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.200536Z","title":"Video frame prediction from a single image and events","venue":null,"work_id":"ecdf0274-3e6a-42cd-8879-4b7afc9ebdd3","year":2024},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:44.057737Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:f52538385137e1ffec1181dda7b96a2865cd15f309fa498fd48706633480ee8c","observation_id":"dd515da5-fc37-47e4-8109-bc11dab557dc","resolution":{"observed_at":"2026-08-10T11:00:44.208901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.573047Z","title":"IEEE, 2004","venue":null,"work_id":"861544da-9bca-40c3-bf9c-04e78c0e754a","year":2004},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:43.947581Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:adaa39a924e28560f9ae8b1e50dd87dc9af810a31ef20537720d50f24c3dff94","observation_id":"903df590-80a5-4a5c-a998-0dffafbd1624","resolution":{"observed_at":"2026-08-10T11:00:44.582829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:00:44.292394Z","title":"1, 2, 3, 4","venue":null,"work_id":"feef7685-cd58-49ba-93bf-7b63ce2bdba6","year":2022},"citing_paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction","version":1},"reference_index":3499,"source":"pdf_text","source_observed_at":"2026-08-10T11:00:44.029909Z"},"links":{"citing_paper":"/paper/2501.16753"},"observation_digest":"sha256:88624a8e0157b2d8e8707fc76b575c5b4c5be1020e01f796b3d53134bc48b64c","observation_id":"c7615b99-958b-4d9c-8cd2-07ce453ce5b1","resolution":{"observed_at":"2026-08-10T11:00:44.304403Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.16753","last_updated":"2025-01-28T07:12:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T05:19:07.176873Z","submitted_at":"2025-01-28T07:12:29Z","title":"Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":7,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2501.16753."}