{"as_of":"2026-08-22T20:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:679ed74b2f84fa71664bd26c21e8692eba6c8cc7dbcfcee63ffeb2e393aa9b45","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:57:29.979050Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T06:15:00.866473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-19T20:31:37.219054Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":"2103.15691","doi":"10.48550/arxiv.2103.15691","metadata_source":"pith","pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Vivit: A video vision transformer","venue":"cs.CV","work_id":"8e386afc-3ca8-45da-a24b-30baa0b96a56","year":2021},"citing_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T13:43:11.024069Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2402.17177"},"observation_digest":"sha256:d52a6d550dd60cd2a276198847c57b601b51fb0ffd18a216c449276f9bfd165b","observation_id":"f31e5cbf-f44b-4c67-bf61-20a3706da946","resolution":{"observed_at":"2026-05-13T13:43:11.097725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-19T20:31:37.219054Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-08-11T16:43:21.382552Z","title":"Vivit: A video vision transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09880","last_updated":"2024-12-13T05:51:00Z","snapshot_observed_at":"2026-08-17T16:15:57.071445Z","submitted_at":"2024-12-13T05:51:00Z","title":"Financial Fine-tuning a Large Time Series Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:21.382552Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2412.09880"},"observation_digest":"sha256:621c86c4c672607c8b233791f7190b55edacfbee3d2c1485c2ddcc0c8488491c","observation_id":"bcfb8bbe-a515-4a07-a03a-4f0d26cfcc6e","resolution":{"observed_at":"2026-08-11T16:43:21.382552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-19T20:31:37.219054Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-08-11T14:59:01.107233Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-21T08:28:48.041857Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.107233Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:de2ef4265c90fbd5d05af0959616e215fe11215d994f5d6d33d52fddb5507b96","observation_id":"9dcf01d1-605b-4013-9a10-6db96d4dc130","resolution":{"observed_at":"2026-08-11T14:59:01.107233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-19T20:31:37.219054Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-08-10T23:20:52.220620Z","title":"Cristian Bodnar, Wessel P Bruinsma, Ana Lucic, Megan Stanley, Johannes Brandstetter, Patrick Garvan, Maik Riechert, Jonathan Weyn, Haiyu Dong, Anna Vaughan, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20601","last_updated":"2024-12-29T22:13:16Z","snapshot_observed_at":"2026-08-18T13:36:10.495832Z","submitted_at":"2024-12-29T22:13:16Z","title":"MATEY: multiscale adaptive foundation models for spatiotemporal physical systems","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T23:20:52.220620Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2412.20601"},"observation_digest":"sha256:c98b914ee088c0a4c3cf6dd1d0c5c6494d8e8cd7ebf9ed936c829c65752298e3","observation_id":"789d1064-082d-4a6b-a9d0-1db1d9598107","resolution":{"observed_at":"2026-08-10T23:20:52.220620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-19T20:31:37.219054Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-08-16T05:57:29.979050Z","title":"Vivit: A video vi- sion transformer.CoRR, abs/2103.15691, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19475","last_updated":"2025-06-03T06:43:53Z","snapshot_observed_at":"2026-08-19T09:56:20.929176Z","submitted_at":"2025-04-28T04:31:24Z","title":"Prisma: An Open Source Toolkit for Mechanistic Interpretability in Vision and Video","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T05:57:29.979050Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2504.19475"},"observation_digest":"sha256:2a171b54320267333e381802e6f8ab36d0d0ab3960ad7144d2a7b7559e452eca","observation_id":"5215fa92-e0e8-4f76-a95d-f5674f04eff1","resolution":{"observed_at":"2026-08-16T05:57:29.979050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-19T20:31:37.219054Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-08-15T22:30:39.771377Z","title":"[Online]","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07890","last_updated":"2025-06-18T07:55:43Z","snapshot_observed_at":"2026-08-21T18:28:46.003006Z","submitted_at":"2025-05-11T14:30:56Z","title":"TSLFormer: A Lightweight Transformer Model for Turkish Sign Language Recognition Using Skeletal Landmarks","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:30:39.771377Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2505.07890"},"observation_digest":"sha256:24be9c26c2c84f74b96b1ebe40bf43d889cb83946c1068dfd3aaaabd4a959faf","observation_id":"2d0c896f-fa65-4a2a-9680-8e1701779dae","resolution":{"observed_at":"2026-08-15T22:30:39.771377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-19T20:31:37.219054Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-08-07T15:37:33.510207Z","title":"ViViT : A video vision transformer, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14543","last_updated":"2025-05-20T15:58:54Z","snapshot_observed_at":"2026-08-20T02:55:16.408326Z","submitted_at":"2025-05-20T15:58:54Z","title":"Time to Embed: Unlocking Foundation Models for Time Series with Channel Descriptions","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:37:33.510207Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2505.14543"},"observation_digest":"sha256:d5a15afdf8714899dd6ab3e3bbcd7db6e3fa161c768584c348f6cc8de8c8e7a0","observation_id":"70c1466b-8666-4691-b0b8-f6c45601fca1","resolution":{"observed_at":"2026-08-07T15:37:33.510207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-19T20:31:37.219054Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-08-07T10:46:14.155465Z","title":"Vivit: A video vision transformer.arXiv preprint arXiv:2103.15691, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04367","last_updated":"2025-06-04T18:29:32Z","snapshot_observed_at":"2026-08-16T15:46:34.113116Z","submitted_at":"2025-06-04T18:29:32Z","title":"Fine-Tuning Video Transformers for Word-Level Bangla Sign Language: A Comparative Analysis for Classification Tasks","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:46:14.155465Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2506.04367"},"observation_digest":"sha256:3f1e0191d815825f6d5f927f81d5ce37cd07f7092450432cb0c96c8f12e29f9b","observation_id":"05e657ca-e725-432d-850e-cdb03a59b95c","resolution":{"observed_at":"2026-08-07T10:46:14.155465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-19T20:31:37.219054Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-08-06T23:49:25.158984Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16258","last_updated":"2025-06-19T12:17:31Z","snapshot_observed_at":"2026-08-16T15:45:46.665785Z","submitted_at":"2025-06-19T12:17:31Z","title":"ViFusion: In-Network Tensor Fusion for Scalable Video Feature Indexing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:25.158984Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2506.16258"},"observation_digest":"sha256:99e42f4c0d1950f6b89d08a80a04ab51a4e09944a830f929b925673beeb7797c","observation_id":"7f79dfc7-bd56-47fb-961d-37b147cd9c89","resolution":{"observed_at":"2026-08-06T23:49:25.158984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-19T20:31:37.219054Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-08-06T22:24:13.917814Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21897","last_updated":"2025-06-27T04:34:07Z","snapshot_observed_at":"2026-08-09T12:25:24.460241Z","submitted_at":"2025-06-27T04:34:07Z","title":"One Video to Steal Them All: 3D-Printing IP Theft through Optical Side-Channels","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:24:13.917814Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2506.21897"},"observation_digest":"sha256:b2c38545bebbd24c669da1ec0c6f44e84dd377cc85de1199d3aad3742a53c59e","observation_id":"7aeb6395-7261-4df5-8193-6f0bfff8ac1e","resolution":{"observed_at":"2026-08-06T22:24:13.917814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-19T20:31:37.219054Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-08-06T21:06:56.096420Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00950","last_updated":"2025-07-01T16:52:20Z","snapshot_observed_at":"2026-08-16T01:09:01.029225Z","submitted_at":"2025-07-01T16:52:20Z","title":"MVP: Winning Solution to SMP Challenge 2025 Video Track","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:56.096420Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2507.00950"},"observation_digest":"sha256:19a2c0630f39839c777be270246d8180ca2abae438e3858d278e7e2cd9352615","observation_id":"426e24a1-26e0-4c4e-b4f4-45e39639b2f8","resolution":{"observed_at":"2026-08-06T21:06:56.096420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-19T20:31:37.219054Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-08-06T20:43:06.121709Z","title":"Vivit: A video vision transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-18T03:55:22.502659Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:06.121709Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:20938ae529691e0cadd07225a552fc53824c0f1da17fd955019c441c157262f4","observation_id":"2c97d037-7e18-4489-90a6-291bf823bb0d","resolution":{"observed_at":"2026-08-06T20:43:06.121709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-19T20:31:37.219054Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-08-03T22:19:23.918059Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.11090","last_updated":"2026-07-14T18:56:50Z","snapshot_observed_at":"2026-08-18T11:13:22.526085Z","submitted_at":"2025-11-14T09:10:31Z","title":"A Space-Time Transformer for Precipitation Nowcasting","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.918059Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2511.11090"},"observation_digest":"sha256:e0139ccbd18852f4d11130a85bffc94829752040804fbc01cb1b9d385d3b8368","observation_id":"51506fc2-78d5-4c41-8a8a-ad5da45c5bfa","resolution":{"observed_at":"2026-08-03T22:19:23.918059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-19T20:31:37.219054Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-08-03T19:00:12.936776Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.02743","last_updated":"2026-05-28T19:57:42Z","snapshot_observed_at":"2026-08-18T02:45:42.623538Z","submitted_at":"2025-12-02T13:24:17Z","title":"Reasoning-Aware Multimodal Fusion for Hateful Video Detection","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:12.936776Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2512.02743"},"observation_digest":"sha256:c4b33e54ce4496ecf64dccb812098fe44b5944ff6c5963f3541e11401f0c57dc","observation_id":"512e385e-51a5-42bc-a25e-99820ab7032c","resolution":{"observed_at":"2026-08-03T19:00:12.936776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-19T20:31:37.219054Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":"2103.15691","doi":"10.48550/arxiv.2103.15691","metadata_source":"pith","pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Vivit: A video vision transformer","venue":"cs.CV","work_id":"8e386afc-3ca8-45da-a24b-30baa0b96a56","year":2021},"citing_paper":{"arxiv_id":"2604.16987","last_updated":"2026-08-06T06:53:47Z","snapshot_observed_at":"2026-08-16T05:45:35.337885Z","submitted_at":"2026-04-18T13:22:42Z","title":"DVAR: Adversarial Multi-Agent Debate for Video Authenticity Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T07:51:04.580617Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2604.16987"},"observation_digest":"sha256:f936303d3a16e7fe249dda54748b20c833d22b0bbcb65bf22edf157fb4bdaae7","observation_id":"519970c0-5cce-46ec-a385-6a77cadd5237","resolution":{"observed_at":"2026-05-10T07:52:13.649938Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-19T20:31:37.219054Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":"2103.15691","doi":"10.48550/arxiv.2103.15691","metadata_source":"pith","pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Vivit: A video vision transformer","venue":"cs.CV","work_id":"8e386afc-3ca8-45da-a24b-30baa0b96a56","year":2021},"citing_paper":{"arxiv_id":"2604.20311","last_updated":"2026-04-23T11:17:19Z","snapshot_observed_at":"2026-08-14T12:34:29.231170Z","submitted_at":"2026-04-22T08:11:06Z","title":"Seeing Further and Wider: Joint Spatio-Temporal Enlargement for Micro-Video Popularity Prediction","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-09T23:13:34.852488Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2604.20311"},"observation_digest":"sha256:4a39dbb2935430a2acc15b81c7606c3ac062843751d0238e36cdbb78ec7f4f3e","observation_id":"5a4ef4c4-b4fd-4ccd-9bac-a8cae9785b62","resolution":{"observed_at":"2026-05-09T23:14:36.513569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-19T20:31:37.219054Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":"2103.15691","doi":"10.48550/arxiv.2103.15691","metadata_source":"pith","pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Vivit: A video vision transformer","venue":"cs.CV","work_id":"8e386afc-3ca8-45da-a24b-30baa0b96a56","year":2021},"citing_paper":{"arxiv_id":"2604.20760","last_updated":"2026-04-22T16:48:43Z","snapshot_observed_at":"2026-08-11T00:18:47.816514Z","submitted_at":"2026-04-22T16:48:43Z","title":"Exploring High-Order Self-Similarity for Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T00:59:03.890135Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2604.20760"},"observation_digest":"sha256:5b46cadbe9ee9aed701465c5fc35f808e36954574acfedd4cdf9e322b37063bc","observation_id":"4ba356d2-41e2-4291-8183-1fb3897e971f","resolution":{"observed_at":"2026-05-10T00:59:49.430327Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-19T20:31:37.219054Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":"2103.15691","doi":"10.48550/arxiv.2103.15691","metadata_source":"pith","pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Vivit: A video vision transformer","venue":"cs.CV","work_id":"8e386afc-3ca8-45da-a24b-30baa0b96a56","year":2021},"citing_paper":{"arxiv_id":"2604.20936","last_updated":"2026-04-22T13:11:21Z","snapshot_observed_at":"2026-07-06T23:07:36.996629Z","submitted_at":"2026-04-22T13:11:21Z","title":"AttentionBender: Manipulating Cross-Attention in Video Diffusion Transformers as a Creative Probe","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T22:42:52.758195Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2604.20936"},"observation_digest":"sha256:a748ab9ab5efc671b7042db051b641581f3d8005087855cf41c80c6e54cb7eb5","observation_id":"133d960b-ffeb-417f-9f00-30c1ea50b6ce","resolution":{"observed_at":"2026-05-09T22:44:14.277963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-19T20:31:37.219054Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":"2103.15691","doi":"10.48550/arxiv.2103.15691","metadata_source":"pith","pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Vivit: A video vision transformer","venue":"cs.CV","work_id":"8e386afc-3ca8-45da-a24b-30baa0b96a56","year":2021},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-11T13:23:12.680939Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:e4ba0c5b0e8bff86e5b7ff2eaf3058d81f4145d8120343b34d8ed9654f409ef1","observation_id":"b7430e96-a421-4f08-a9b4-b46c21738109","resolution":{"observed_at":"2026-05-11T04:50:55.710238Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-19T20:31:37.219054Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":"2103.15691","doi":"10.48550/arxiv.2103.15691","metadata_source":"pith","pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Vivit: A video vision transformer","venue":"cs.CV","work_id":"8e386afc-3ca8-45da-a24b-30baa0b96a56","year":2021},"citing_paper":{"arxiv_id":"2606.20561","last_updated":"2026-06-18T17:59:48Z","snapshot_observed_at":"2026-08-15T21:36:13.012997Z","submitted_at":"2026-06-18T17:59:48Z","title":"TimeProVe: Propose, then Verify for Efficient Long Video Temporal Reasoning in Activities of Daily Living","version":1},"reference_index":130,"source":"arxiv_source","source_observed_at":"2026-06-26T18:22:13.147215Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2606.20561"},"observation_digest":"sha256:b9bdf5c6d0382142117970f1199be1d3fc71a1d0223af9dbd9d7ca6dbb2ea32d","observation_id":"da044df2-9510-4584-b6ba-143292ad2d08","resolution":{"observed_at":"2026-07-04T03:09:30.225196Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-19T20:31:37.219054Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":"2103.15691","doi":"10.48550/arxiv.2103.15691","metadata_source":"pith","pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Vivit: A video vision transformer","venue":"cs.CV","work_id":"8e386afc-3ca8-45da-a24b-30baa0b96a56","year":2021},"citing_paper":{"arxiv_id":"2607.06999","last_updated":"2026-07-08T04:46:47Z","snapshot_observed_at":"2026-07-29T23:08:20.368602Z","submitted_at":"2026-07-08T04:46:47Z","title":"Physics-guided spatiotemporal neural models for fuel density prediction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-09T22:03:33.848601Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2607.06999"},"observation_digest":"sha256:9bb7312b6793d52968e4767182c32e1136bc73002282f06580e78ac3f6664281","observation_id":"dfe56956-42da-43b4-8f77-0068d3d55d1f","resolution":{"observed_at":"2026-07-09T22:06:35.216238Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2103.15691/citation-record","integrity":"/paper/2103.15691/integrity","json":"/paper/2103.15691/citation-record.json","paper":"/paper/2103.15691"},"outbound":[],"paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T20:31:37.219054Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:2103.15691."}