{"as_of":"2026-08-19T06:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a17cb069c0949982a54ff063102c9b4a2c38d89a81e13e1584a16aac3752f395","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:36:49.409281Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T00:47:29.725111Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2103.01950","last_updated":"2021-03-02T18:59:10Z","snapshot_observed_at":"2026-08-16T18:41:46.399000Z","submitted_at":"2021-03-02T18:59:10Z","title":"Predicting Video with VQVAE","version":1},"cited_work":{"arxiv_id":"2103.01950","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.01950","snapshot_observed_at":"2026-07-03T00:47:29.725111Z","title":"Predicting video with vqvae","venue":null,"work_id":"e5802151-2b34-4985-80d8-c5d24e27ca8e","year":2021},"citing_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-17T06:54:13.493934Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T17:24:33.725187Z"},"links":{"cited_paper":"/paper/2103.01950","citing_paper":"/paper/2104.10157"},"observation_digest":"sha256:ee89dc923d5192c420791276b3fd409a9e611561463ae10c98b325dd9547987e","observation_id":"006a8af4-cd91-4c2b-b6e3-5ca43c374e7b","resolution":{"observed_at":"2026-05-13T17:24:33.851129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.01950","last_updated":"2021-03-02T18:59:10Z","snapshot_observed_at":"2026-08-16T18:41:46.399000Z","submitted_at":"2021-03-02T18:59:10Z","title":"Predicting Video with VQVAE","version":1},"cited_work":{"arxiv_id":"2103.01950","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.01950","snapshot_observed_at":"2026-07-03T00:47:29.725111Z","title":"Predicting video with vqvae","venue":null,"work_id":"e5802151-2b34-4985-80d8-c5d24e27ca8e","year":2021},"citing_paper":{"arxiv_id":"2204.03458","last_updated":"2022-06-22T20:22:29Z","snapshot_observed_at":"2026-08-17T13:08:14.312126Z","submitted_at":"2022-04-07T14:08:02Z","title":"Video Diffusion Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T14:38:27.919104Z"},"links":{"cited_paper":"/paper/2103.01950","citing_paper":"/paper/2204.03458"},"observation_digest":"sha256:1a79183cccad1bb5fb3caa27ee9be7c8533708597f72d042c3726cc9782696d3","observation_id":"becc827f-ec90-4d52-b490-2770ce9214e3","resolution":{"observed_at":"2026-05-13T14:38:28.038363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.01950","last_updated":"2021-03-02T18:59:10Z","snapshot_observed_at":"2026-08-16T18:41:46.399000Z","submitted_at":"2021-03-02T18:59:10Z","title":"Predicting Video with VQVAE","version":1},"cited_work":{"arxiv_id":"2103.01950","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.01950","snapshot_observed_at":"2026-07-03T00:47:29.725111Z","title":"Predicting video with vqvae","venue":null,"work_id":"e5802151-2b34-4985-80d8-c5d24e27ca8e","year":2021},"citing_paper":{"arxiv_id":"2210.02399","last_updated":"2022-10-05T17:18:28Z","snapshot_observed_at":"2026-08-15T13:11:17.068630Z","submitted_at":"2022-10-05T17:18:28Z","title":"Phenaki: Variable Length Video Generation From Open Domain Textual Description","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-17T01:43:34.024375Z"},"links":{"cited_paper":"/paper/2103.01950","citing_paper":"/paper/2210.02399"},"observation_digest":"sha256:bb2e7792f11b76797ff29edf62b5039ff3042c6535606254fc539adda2dee3b9","observation_id":"4678c45a-d053-4c07-91d9-bb87a0248509","resolution":{"observed_at":"2026-05-17T01:43:34.127408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.01950","last_updated":"2021-03-02T18:59:10Z","snapshot_observed_at":"2026-08-16T18:41:46.399000Z","submitted_at":"2021-03-02T18:59:10Z","title":"Predicting Video with VQVAE","version":1},"cited_work":{"arxiv_id":"2103.01950","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.01950","snapshot_observed_at":"2026-07-03T00:47:29.725111Z","title":"Predicting video with vqvae","venue":null,"work_id":"e5802151-2b34-4985-80d8-c5d24e27ca8e","year":2021},"citing_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-17T16:16:01.560363Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T04:27:43.019940Z"},"links":{"cited_paper":"/paper/2103.01950","citing_paper":"/paper/2211.13221"},"observation_digest":"sha256:aa412e81d029f47311c5221c663702b3f97279e9b4150f70379d299dbe968cb9","observation_id":"0883370d-3f6a-41f7-af22-279bbe3ceed3","resolution":{"observed_at":"2026-05-15T04:27:43.291686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.01950","last_updated":"2021-03-02T18:59:10Z","snapshot_observed_at":"2026-08-16T18:41:46.399000Z","submitted_at":"2021-03-02T18:59:10Z","title":"Predicting Video with VQVAE","version":1},"cited_work":{"arxiv_id":"2103.01950","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.01950","snapshot_observed_at":"2026-07-03T00:47:29.725111Z","title":"Predicting video with vqvae","venue":null,"work_id":"e5802151-2b34-4985-80d8-c5d24e27ca8e","year":2021},"citing_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-08-13T12:06:46.989903Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"reference_index":122,"source":"arxiv_source","source_observed_at":"2026-05-16T02:15:18.265190Z"},"links":{"cited_paper":"/paper/2103.01950","citing_paper":"/paper/2310.06114"},"observation_digest":"sha256:31424bfbcedf9a1e00c860471ef2c151dd89f32230fa45a45f4390abb2a6d7b3","observation_id":"476ec4d4-bb8a-4277-92d3-d42782f94e1d","resolution":{"observed_at":"2026-05-16T02:15:18.530964Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.01950","last_updated":"2021-03-02T18:59:10Z","snapshot_observed_at":"2026-08-16T18:41:46.399000Z","submitted_at":"2021-03-02T18:59:10Z","title":"Predicting Video with VQVAE","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.01950","snapshot_observed_at":"2026-08-12T12:36:49.409281Z","title":"Pre- dicting video with vqvae","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17765","last_updated":"2025-07-30T10:27:47Z","snapshot_observed_at":"2026-08-18T16:05:35.597118Z","submitted_at":"2024-11-26T04:21:22Z","title":"I2VControl: Disentangled and Unified Video Motion Synthesis Control","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T12:36:49.409281Z"},"links":{"cited_paper":"/paper/2103.01950","citing_paper":"/paper/2411.17765"},"observation_digest":"sha256:2f89301c704badc209f4cfc8569a793b7e268ad0ba6853d6c8b11d4ec987c04f","observation_id":"a58a52b5-185c-4ab6-894b-04ff5b07f623","resolution":{"observed_at":"2026-08-12T12:36:49.409281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.01950","last_updated":"2021-03-02T18:59:10Z","snapshot_observed_at":"2026-08-16T18:41:46.399000Z","submitted_at":"2021-03-02T18:59:10Z","title":"Predicting Video with VQVAE","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.01950","snapshot_observed_at":"2026-08-10T17:16:47.594537Z","title":"Pre- dicting video with vqvae","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.594537Z"},"links":{"cited_paper":"/paper/2103.01950","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:086ca009913f57f2043368a19da45e756171c9aa448c91c5207c1a8323337e9f","observation_id":"80260792-2f5c-477d-a704-a08243a0995d","resolution":{"observed_at":"2026-08-10T17:16:47.594537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.01950","last_updated":"2021-03-02T18:59:10Z","snapshot_observed_at":"2026-08-16T18:41:46.399000Z","submitted_at":"2021-03-02T18:59:10Z","title":"Predicting Video with VQVAE","version":1},"cited_work":{"arxiv_id":"2103.01950","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.01950","snapshot_observed_at":"2026-07-03T00:47:29.725111Z","title":"Predicting video with vqvae","venue":null,"work_id":"e5802151-2b34-4985-80d8-c5d24e27ca8e","year":2021},"citing_paper":{"arxiv_id":"2606.02385","last_updated":"2026-06-01T15:34:34Z","snapshot_observed_at":"2026-08-13T04:50:21.182396Z","submitted_at":"2026-06-01T15:34:34Z","title":"How Optimality Structures Sparse Dictionaries: A Theory for Understanding SAE Representations","version":1},"reference_index":270,"source":"arxiv_source","source_observed_at":"2026-06-28T11:36:45.020411Z"},"links":{"cited_paper":"/paper/2103.01950","citing_paper":"/paper/2606.02385"},"observation_digest":"sha256:0315444e4d1ac70f8cf65f83adb77af0c626ee6e0f2df4ce593a6fc2d8e75be9","observation_id":"91648f63-5f8b-4ffd-bc75-f0a397dbc4d4","resolution":{"observed_at":"2026-07-02T01:46:26.212776Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.01950","last_updated":"2021-03-02T18:59:10Z","snapshot_observed_at":"2026-08-16T18:41:46.399000Z","submitted_at":"2021-03-02T18:59:10Z","title":"Predicting Video with VQVAE","version":1},"cited_work":{"arxiv_id":"2103.01950","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.01950","snapshot_observed_at":"2026-07-03T00:47:29.725111Z","title":"Predicting video with vqvae","venue":null,"work_id":"e5802151-2b34-4985-80d8-c5d24e27ca8e","year":2021},"citing_paper":{"arxiv_id":"2606.09156","last_updated":"2026-06-08T07:47:53Z","snapshot_observed_at":"2026-08-12T21:49:33.640653Z","submitted_at":"2026-06-08T07:47:53Z","title":"OmniGen-AR: AutoRegressive Any-to-Image Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-27T17:05:16.883488Z"},"links":{"cited_paper":"/paper/2103.01950","citing_paper":"/paper/2606.09156"},"observation_digest":"sha256:937d6879bccefadb4888fec2f627696b7cb6b7e2164f095065f462a2b54b950f","observation_id":"c4668ade-3ead-4ab4-a49d-7165f839114c","resolution":{"observed_at":"2026-07-03T00:47:29.726937Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2103.01950/citation-record","integrity":"/paper/2103.01950/integrity","json":"/paper/2103.01950/citation-record.json","paper":"/paper/2103.01950"},"outbound":[],"paper":{"arxiv_id":"2103.01950","last_updated":"2021-03-02T18:59:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T18:41:46.399000Z","submitted_at":"2021-03-02T18:59:10Z","title":"Predicting Video with VQVAE"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2103.01950."}