{"as_of":"2026-08-13T23:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a7396173c2031b26ce7e7efda6342f667e7ba6503b6559c0126dccc7f0ed35c3","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:59:00.269362Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:49:42.989079Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:49:52.967735Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"cited_work":{"arxiv_id":"2411.10503","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.10503","snapshot_observed_at":"2026-08-07T11:49:52.967735Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","venue":"cs.CV","work_id":"9e18ca34-b356-4dc7-af33-881c826660d4","year":2024},"citing_paper":{"arxiv_id":"2506.01364","last_updated":"2025-06-02T06:46:42Z","snapshot_observed_at":"2026-08-08T09:15:38.444850Z","submitted_at":"2025-06-02T06:46:42Z","title":"Unraveling Spatio-Temporal Foundation Models via the Pipeline Lens: A Comprehensive Review","version":1},"reference_index":135,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.989079Z"},"links":{"cited_paper":"/paper/2411.10503","citing_paper":"/paper/2506.01364"},"observation_digest":"sha256:203caf38e3e35e45f9fd89014dbbaeaa605778823922a3fc19e0115f143e0f0f","observation_id":"3c62bd83-a8a4-42bc-a3c9-82446053c66c","resolution":{"observed_at":"2026-08-07T11:49:53.110190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.10503/citation-record","integrity":"/paper/2411.10503/integrity","json":"/paper/2411.10503/citation-record.json","paper":"/paper/2411.10503"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.951354Z","title":"From methods to datasets: A survey on image-caption generators","venue":null,"work_id":"567442bc-5df1-4423-b59b-ae95cc11e09f","year":2023},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T19:58:59.985267Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:feeb698fbda37602d31a95086f700f26ac3b928885c8ea9d70ecedd84f8c8010","observation_id":"e38793b4-4c0b-413c-a19f-c16a564bf07f","resolution":{"observed_at":"2026-08-12T19:59:00.957912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-12T19:58:59.991539Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T19:58:59.991539Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:539bf79882d6a0935172357931405f6058612bce86ad18761cf75fb84dc8ad4f","observation_id":"07e62f32-e74b-472f-8214-0da90b355604","resolution":{"observed_at":"2026-08-12T19:58:59.991539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.932499Z","title":"Audiomnist: Exploring explainable artificial intelli- gence for audio analysis on a simple benchmark","venue":null,"work_id":"15b1a792-6344-4007-a861-28b290a50957","year":2024},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T19:58:59.997316Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:da5f69929538bd4c4613e820c58faf4dbdda4c861fea76e7662b8046e30f7c9b","observation_id":"ede4becb-eb9b-4d1d-9244-01c0b8270f6d","resolution":{"observed_at":"2026-08-12T19:59:00.938193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.913962Z","title":"Is space-time attention all you need for video understanding? In ICML, page 4, 2021","venue":null,"work_id":"15c70758-986f-4aa9-b1e4-5c2aff902a05","year":2021},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.009812Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:68d46f1eb67851b6ba18948b045cbb689d6d3e4bddf4c2df09e6b7d00b386cff","observation_id":"bb47d286-b6a0-48af-854c-3876671d61c9","resolution":{"observed_at":"2026-08-12T19:59:00.919706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.892074Z","title":"Pcanet: A simple deep learning baseline for image classification? IEEE transactions on image pro- cessing, 24(12):5017–5032, 2015","venue":null,"work_id":"417f1155-8001-42c7-b9db-a14451d52ade","year":2015},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.022299Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:5dc64f5551b6d128f80008544268ba315ad116caf15e6d2de69e1afbbffd0908","observation_id":"1e4e1f29-19c9-4d6c-869a-00d1968a8a6d","resolution":{"observed_at":"2026-08-12T19:59:00.899756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.031644Z","title":"Generative pre- training from pixels","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.031644Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:f1f2db56fede57828c2eafae57b0e99137de431d3f6719d8418f5458a3299352","observation_id":"ebd41328-7dee-49d8-81d4-4ef700d44ea0","resolution":{"observed_at":"2026-08-12T19:59:00.031644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11740","last_updated":"2020-07-17T22:19:59Z","snapshot_observed_at":"2026-08-09T19:02:25.484253Z","submitted_at":"2019-09-25T20:02:54Z","title":"UNITER: UNiversal Image-TExt Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11740","snapshot_observed_at":"2026-08-12T19:59:00.046717Z","title":"Uniter: Learning universal image-text representations","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.046717Z"},"links":{"cited_paper":"/paper/1909.11740","citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:eb74ef4bbe662ce071938969f15b809f1a0902a3cfae19f703bfae7c09a87809","observation_id":"be956813-70c8-4907-803b-68d82d645b5f","resolution":{"observed_at":"2026-08-12T19:59:00.046717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.859766Z","title":"High-performance long- term tracking with meta-updater","venue":null,"work_id":"c1da36b6-437a-4e2c-999d-1b7f0414c519","year":2020},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.055661Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:8bbba1974b8fa9a3993092a80971df52796075f47fcf22454caf087180a92394","observation_id":"f116849b-3e73-444b-adb7-5411c45c0cea","resolution":{"observed_at":"2026-08-12T19:59:00.865798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.842658Z","title":"Tinyvirat: Low-resolution video action recognition","venue":null,"work_id":"46b78e55-9a58-4a9c-9bc6-f5e057b9f407","year":2020},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.062318Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:2fbc294eddac4aa031d2048331fa764fdaed70a14f4b27fd4c4893f1985a2324","observation_id":"dea018fd-f403-4c3f-8eac-732c7f57a13f","resolution":{"observed_at":"2026-08-12T19:59:00.848075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.826037Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"0251a39c-16a4-4cf1-a887-8167f5a3aa02","year":2021},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.068835Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:f7f24f62c87f45d7208fad86dc8c12b852979fe9b04b8c257af031ec878b4282","observation_id":"6e13c638-90f6-46ce-b6cd-b42eb5df37a8","resolution":{"observed_at":"2026-08-12T19:59:00.831679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.077421Z","title":"Lasot: A high-quality benchmark for large-scale single ob- ject tracking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.077421Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:9757fe5e6a9be8aa48466b26bf517627e9f8de5b381edcd677713a6a4c5da387","observation_id":"bded84f4-ef3f-4f61-ba8c-e8b27111a274","resolution":{"observed_at":"2026-08-12T19:59:00.077421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14073","last_updated":"2024-02-21T19:01:03Z","snapshot_observed_at":"2026-08-13T04:13:25.689421Z","submitted_at":"2024-02-21T19:01:03Z","title":"Improving Language Understanding from Screenshots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14073","snapshot_observed_at":"2026-08-12T19:59:00.085021Z","title":"Improving language understanding from screenshots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.085021Z"},"links":{"cited_paper":"/paper/2402.14073","citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:3aa7665652d9e0188797ad9fb9f177177b58685fbc71043682b10deaf4c4b4db","observation_id":"4529372c-b4d8-4775-bb83-368e7da1498d","resolution":{"observed_at":"2026-08-12T19:59:00.085021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.798921Z","title":"Photorealistic video generation with diffusion models","venue":null,"work_id":"322c8d83-098a-4334-a56e-8fe7be95e6f1","year":2023},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.091353Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:a120d87f5a856918758bce69765b00ec5b60322b9ca1bd7c73e9f95a73f2ce71","observation_id":"1edaf6a9-600e-4a08-b89f-46ac57e44bd0","resolution":{"observed_at":"2026-08-12T19:59:00.804522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.781795Z","title":"Unit: Multimodal mul- titask learning with a unified transformer","venue":null,"work_id":"6bfeefa1-a9e9-4605-8245-dec5b52359a8","year":2021},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.097416Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:3f5a60d2b5ae3138f761cf3cea226396ebadbd816d5e5528483111e9e6153b92","observation_id":"32a06e5c-ea02-4501-8931-9ef37cf18346","resolution":{"observed_at":"2026-08-12T19:59:00.787385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.764829Z","title":"Video Question Answering with Spatio-Temporal Reasoning","venue":null,"work_id":"5877a69f-a6a8-45b9-ab2c-0975f4160deb","year":2019},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.103573Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:fcef6264ce8ebf075aec06e9410b9ff0f539c30fc9c5a7a831abe950f675764e","observation_id":"b3568299-f139-4847-8c3b-24d4ba37b3c7","resolution":{"observed_at":"2026-08-12T19:59:00.770191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09286","last_updated":"2019-09-20T18:01:55Z","snapshot_observed_at":"2026-07-06T07:47:14.837747Z","submitted_at":"2019-04-19T17:58:29Z","title":"Unifying Question Answering, Text Classification, and Regression via Span Extraction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09286","snapshot_observed_at":"2026-08-12T19:59:00.112379Z","title":"Unifying question answering, text classi- fication, and regression via span extraction","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.112379Z"},"links":{"cited_paper":"/paper/1904.09286","citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:399f29d56ea529b2413e68eb47f648de8872bb6132941f91b33509b63ba73d8b","observation_id":"4b4732d1-b4da-4fe8-b4c3-f5baa2a6ff1d","resolution":{"observed_at":"2026-08-12T19:59:00.112379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.119758Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.119758Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:3b82dcf9148cd1c17e547bdadb6a00626deaefafc1e4c7e9050aa3cb6c4fe844","observation_id":"c6886f5d-86be-438c-afaa-8ee0a23febef","resolution":{"observed_at":"2026-08-12T19:59:00.119758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.732467Z","title":"Temporally consistent video colorization with deep feature propagation and self-regularization learning","venue":null,"work_id":"afcc7f24-a9d7-4eb9-891b-5eb5db12219a","year":2024},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.126027Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:bf8a30b8312162f8ffe0dddfd2fdc0f7fbd2a8d4b73d1d97a022a6a0314b006b","observation_id":"d7940d5d-b5c9-44f4-b8fe-e9759f30d852","resolution":{"observed_at":"2026-08-12T19:59:00.739590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.134549Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.134549Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:fe2a5c18d6d80975c2c0fd518de4f9e75eb9d72f5ed982a171d127a42a1f121c","observation_id":"4360691c-c323-4759-ae1d-7fb0ae0608ab","resolution":{"observed_at":"2026-08-12T19:59:00.134549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.705264Z","title":"The multi-modal fusion in vi- sual question answering: a review of attention mechanisms","venue":null,"work_id":"a7521db4-7e72-46c3-a254-d4bbb89f0394","year":2023},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.140434Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:31ed20bd590aa54fe87228aa5ab4644bc88f7d2f2799fd28b3ffc16136852786","observation_id":"3c5327fb-a60e-4265-b2d4-6f95c06ba0af","resolution":{"observed_at":"2026-08-12T19:59:00.710446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.08730","last_updated":"2018-06-20T16:39:26Z","snapshot_observed_at":"2026-08-13T19:19:07.249930Z","submitted_at":"2018-06-20T16:39:26Z","title":"The Natural Language Decathlon: Multitask Learning as Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.08730","snapshot_observed_at":"2026-08-12T19:59:00.145573Z","title":"The natural language decathlon: Multitask learning as question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.145573Z"},"links":{"cited_paper":"/paper/1806.08730","citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:0443b4aee262f10d5a070fed727aeafd88fb5d2f7a13a4c8ecdf215a074a13ea","observation_id":"36d92b00-531d-4b93-ba7d-06937ba713d6","resolution":{"observed_at":"2026-08-12T19:59:00.145573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09494","last_updated":"2022-05-09T17:02:49Z","snapshot_observed_at":"2026-08-13T16:20:29.404391Z","submitted_at":"2022-03-17T17:48:32Z","title":"Transframer: Arbitrary Frame Prediction with Generative Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09494","snapshot_observed_at":"2026-08-12T19:59:00.151096Z","title":"Transframer: Arbitrary frame prediction with generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.151096Z"},"links":{"cited_paper":"/paper/2203.09494","citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:ef6d26288ecac4e735af4ed08ad0669329d518829fd79ca9915710c3e5554ce9","observation_id":"d2b3e8e3-6335-4962-8e27-23dcfc6297b2","resolution":{"observed_at":"2026-08-12T19:59:00.151096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.157591Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.157591Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:4bf77119b9544ad0f4587b7ff8174edd148acc93598aa35211987fb36f37c56b","observation_id":"e8febd18-221e-44e8-870b-771d3b1c81a4","resolution":{"observed_at":"2026-08-12T19:59:00.157591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6604","last_updated":"2016-05-04T14:01:42Z","snapshot_observed_at":"2026-07-06T04:04:18.621124Z","submitted_at":"2014-12-20T05:05:51Z","title":"Video (language) modeling: a baseline for generative models of natural videos","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6604","snapshot_observed_at":"2026-08-12T19:59:00.167425Z","title":"Video (lan- guage) modeling: a baseline for generative models of natural videos","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.167425Z"},"links":{"cited_paper":"/paper/1412.6604","citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:d71a0d1001bfcab4f610e1e33c50e16553a31de6f1e9d26d63e26989779edff9","observation_id":"28a728f5-9c93-45f8-a5c9-c7221187eec2","resolution":{"observed_at":"2026-08-12T19:59:00.167425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.06991","last_updated":"2023-04-26T15:27:35Z","snapshot_observed_at":"2026-08-13T15:04:04.557307Z","submitted_at":"2022-07-14T15:20:36Z","title":"Language Modelling with Pixels","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.06991","snapshot_observed_at":"2026-08-12T19:59:00.174488Z","title":"Language modelling with pixels","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.174488Z"},"links":{"cited_paper":"/paper/2207.06991","citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:751f358f06e80932bce11b6fd536dcb6074f14117378142b68fd5d500c7ad255","observation_id":"b8f9b94e-8d86-4e8c-a9f5-04a2d48dbaeb","resolution":{"observed_at":"2026-08-12T19:59:00.174488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07849","last_updated":"2023-03-14T12:41:56Z","snapshot_observed_at":"2026-08-13T12:24:57.894902Z","submitted_at":"2023-03-14T12:41:56Z","title":"Implicit Stacked Autoregressive Model for Video Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07849","snapshot_observed_at":"2026-08-12T19:59:00.180810Z","title":"Implicit stacked autoregressive model for video pre- diction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.180810Z"},"links":{"cited_paper":"/paper/2303.07849","citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:7f44948f1b5544594cdf887cf82908beee75416f1a732588c5ca847abd163a40","observation_id":"84a023d8-5388-4b65-8205-75d150f0180a","resolution":{"observed_at":"2026-08-12T19:59:00.180810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04482","last_updated":"2022-03-29T18:22:08Z","snapshot_observed_at":"2026-08-13T17:19:17.146234Z","submitted_at":"2021-12-08T18:59:16Z","title":"FLAVA: A Foundational Language And Vision Alignment Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04482","snapshot_observed_at":"2026-08-12T19:59:00.186534Z","title":"FLA V A: A foundational language and vision alignment model","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.186534Z"},"links":{"cited_paper":"/paper/2112.04482","citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:fc537fe8e7784819316026c026dd172149a78a5597c4ff2d99a1b6acb3f1476b","observation_id":"3645c40e-e2f8-41a7-8b0e-74fd0f97f629","resolution":{"observed_at":"2026-08-12T19:59:00.186534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.678960Z","title":"Recursive deep models for semantic compositional- ity over a sentiment treebank","venue":null,"work_id":"8a18a870-de76-41c3-8760-ba565ad5622d","year":2013},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.192904Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:d4b7f38134cac61c0b3819c7a5aa99f059246d6bd09b6e7ff328783d11063a65","observation_id":"9b5591c1-6ae5-4507-8aba-f7e3079ee87c","resolution":{"observed_at":"2026-08-12T19:59:00.684208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03321","last_updated":"2024-02-23T19:06:35Z","snapshot_observed_at":"2026-08-13T04:47:56.999401Z","submitted_at":"2024-01-06T22:49:38Z","title":"PIXAR: Auto-Regressive Language Modeling in Pixel Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03321","snapshot_observed_at":"2026-08-12T19:59:00.198753Z","title":"Pixar: Auto-regressive language modeling in pixel space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.198753Z"},"links":{"cited_paper":"/paper/2401.03321","citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:396d40cef4ab83f008ef8f741cac3c225738306add176f8a64eb1c6a47a484ea","observation_id":"3bc84ed7-9dfe-438c-a501-a72f9754e8c3","resolution":{"observed_at":"2026-08-12T19:59:00.198753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.08435","last_updated":"2023-02-06T14:49:05Z","snapshot_observed_at":"2026-07-06T05:27:58.459475Z","submitted_at":"2017-01-29T21:39:05Z","title":"Transformation-Based Models of Video Sequences","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.08435","snapshot_observed_at":"2026-08-12T19:59:00.204388Z","title":"van Amersfoort, Anitha Kannan, Marc’Aurelio Ranzato, Arthur Szlam, Du Tran, and Soumith Chintala","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.204388Z"},"links":{"cited_paper":"/paper/1701.08435","citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:06e6fc74d358492bf86243df921fc7ea58ea541669ac09d050ff67acf774eff0","observation_id":"1f7ab565-4240-441f-b0eb-b5330b29b97d","resolution":{"observed_at":"2026-08-12T19:59:00.204388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.662141Z","title":"Multimodal llm enhanced cross- lingual cross-modal retrieval","venue":null,"work_id":"92906a6b-68d5-4043-8c72-e5b7b58e64e9","year":2024},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.210160Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:efcf7a5327d8ca9663d180bd4581d55b18daa6761a4b90bf8ad828e411409634","observation_id":"2e09d4d6-8b24-41be-a5a3-25a80c23e98a","resolution":{"observed_at":"2026-08-12T19:59:00.667610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.216372Z","title":"Bovik, H.R","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.216372Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:c1cef56a5d862083f34a793f0c5d1d4280181c83ea17439e1ba472cb4ef5085f","observation_id":"b589a8ee-9745-4773-88b5-6140da2de8c1","resolution":{"observed_at":"2026-08-12T19:59:00.216372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.222174Z","title":"Visual question answer- ing: A survey of methods and datasets","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.222174Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:6c456dfb46d4140c5d319d041199fb84440abec19563a8df55c6e73523b7c76a","observation_id":"42f29cc1-00e4-4b44-a243-a669c6a0c5eb","resolution":{"observed_at":"2026-08-12T19:59:00.222174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08183","last_updated":"2024-02-13T02:46:45Z","snapshot_observed_at":"2026-08-13T04:20:06.880701Z","submitted_at":"2024-02-13T02:46:45Z","title":"Pixel Sentence Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08183","snapshot_observed_at":"2026-08-12T19:59:00.228785Z","title":"Pixel sentence repre- sentation learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.228785Z"},"links":{"cited_paper":"/paper/2402.08183","citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:fa88f3108dec31f9c476b5eae0a061a41f640895ac3b48cc3379cbbd5137d2ef","observation_id":"59f3cd8b-2217-46d2-afab-376787778509","resolution":{"observed_at":"2026-08-12T19:59:00.228785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.235445Z","title":"Videogpt: Video generation using vq-vae and trans- formers, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.235445Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:2ac1577b97c125c14012d23ca30f0d9636de9f82c3f611a5497c7ed03bbb2324","observation_id":"b2a3e8b8-2ffb-492f-a9ff-e7108e387f74","resolution":{"observed_at":"2026-08-12T19:59:00.235445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.616298Z","title":"Colormnet: A memory-based deep spatial-temporal feature propagation network for video colorization","venue":null,"work_id":"5d783c8e-a3a0-4ed8-826d-a98fd4276205","year":2024},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.240859Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:b202e19274ee63527d62a577d929c38414407f5c8b9d8dcba5f2779b0518c879","observation_id":"b11476c7-6673-4d84-afec-b5c57ff54520","resolution":{"observed_at":"2026-08-12T19:59:00.621333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01442","last_updated":"2020-03-08T00:09:07Z","snapshot_observed_at":"2026-07-06T08:26:38.349660Z","submitted_at":"2019-10-03T13:16:36Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01442","snapshot_observed_at":"2026-08-12T19:59:00.245986Z","title":"Clevrer: Collision events for video representation and reasoning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.245986Z"},"links":{"cited_paper":"/paper/1910.01442","citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:f7d0a26ece465d37eff8b044a76802f695ba360e55a9cc0f4f1940502b526b95","observation_id":"8b438b27-b62c-4236-8da5-c7e2ddcf297b","resolution":{"observed_at":"2026-08-12T19:59:00.245986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.599279Z","title":"Akin Yilmaz and Ahmet Murat Tekalp","venue":null,"work_id":"4fb4540e-d5f7-4c95-b014-f55fc28148ab","year":2021},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.252101Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:f59b61d209a59740304f21c26954415b420c25b0220a18282d3f05600c1a8bda","observation_id":"bcc370f7-493e-411a-bdae-cb5f5a8c8bcf","resolution":{"observed_at":"2026-08-12T19:59:00.604360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.582157Z","title":"Colorful image colorization","venue":null,"work_id":"5b99926e-830a-43d4-9e28-c150206bfb2e","year":2016},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.257545Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:ba4d1a4ea553ff99b547a220f5cfb1e7528d52e22371b0ac8fd61a796b089dc2","observation_id":"6b0c4265-dd2e-4798-bac9-51cb76b4d9b6","resolution":{"observed_at":"2026-08-12T19:59:00.587679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09268","last_updated":"2023-02-18T09:26:35Z","snapshot_observed_at":"2026-08-13T12:42:21.667320Z","submitted_at":"2023-02-18T09:26:35Z","title":"Bag of Tricks for Effective Language Model Pretraining and Downstream Adaptation: A Case Study on GLUE","version":1},"cited_work":{"arxiv_id":"2302.09268","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.09268","snapshot_observed_at":"2026-08-12T19:59:00.311371Z","title":"Bag of Tricks for Effective Language Model Pretraining and Downstream Adaptation: A Case Study on GLUE","venue":"cs.CL","work_id":"253ec4b3-c2d5-4983-88f9-ad43f4f5c932","year":2023},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.263231Z"},"links":{"cited_paper":"/paper/2302.09268","citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:b414fdfbf297425e0678b7b96586cd1644a20bb12b6c2df9b2394429ad85963c","observation_id":"3902d12c-2589-4e0d-8d3d-082882a42ac4","resolution":{"observed_at":"2026-08-12T19:59:00.323391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:59:00.564684Z","title":"A survey on vqa: Datasets and approaches","venue":null,"work_id":"c82ca158-cf2d-44db-9fb2-45c8d3bc3578","year":2020},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T19:59:00.269362Z"},"links":{"citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:48e340754df3185b7376a1f7268c156d949aa5e0dbbeb05ea3ead3869735c153","observation_id":"2856d329-c2aa-4a9e-be1c-342be7dafe80","resolution":{"observed_at":"2026-08-12T19:59:00.569716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2411.10503."}