{"as_of":"2026-08-10T23:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8624c9ece8150b006920043638d7edd0446b703f3bab0a1e795d16e7797d31fe","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:24:14.295583Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T19:19:17.796377Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T23:10:50.188969Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"cited_work":{"arxiv_id":"2507.02862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02862","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RefTok: Reference- Based Tokenization for Video Generation","venue":null,"work_id":"8b2a6d94-8348-4825-938b-bd3eef89f217","year":2025},"citing_paper":{"arxiv_id":"2604.04913","last_updated":"2026-04-06T17:55:05Z","snapshot_observed_at":"2026-08-10T11:36:36.197748Z","submitted_at":"2026-04-06T17:55:05Z","title":"A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T19:19:17.796377Z"},"links":{"cited_paper":"/paper/2507.02862","citing_paper":"/paper/2604.04913"},"observation_digest":"sha256:a28026cd2a69da04b34682e0d363940aaf4001a863c46561fe2e2375621ce582","observation_id":"422e5ca2-b01c-4224-9dde-92dbcd19c932","resolution":{"observed_at":"2026-05-10T23:10:50.196887Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02862/citation-record","integrity":"/paper/2507.02862/integrity","json":"/paper/2507.02862/citation-record.json","paper":"/paper/2507.02862"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:22.854380Z","title":"Towards high resolution video generation with progressive growing of sliced wasserstein gans, 2018","venue":null,"work_id":"8360c3d0-0f55-4fe7-9f7b-444ce1e76684","year":2018},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:10.129043Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:4823c0c42ef0a1d943a86e36f55872bad05b2c20edd703a04b598966fbd6f57d","observation_id":"098bb933-9d9b-4ebb-aada-84f2a6363a13","resolution":{"observed_at":"2026-08-06T20:24:22.914818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:22.707965Z","title":"Fitvid: Overfitting in pixel-level video prediction, 2021","venue":null,"work_id":"8675e317-a109-4909-a44f-9984fc40b6b7","year":2021},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:10.188041Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:1d29b4c4e9ba7383a384ea0649ff8da57439b44d429f52e2bc5b84d85f5e701e","observation_id":"d3ab17fe-85bf-4262-9272-a154f76a4fa5","resolution":{"observed_at":"2026-08-06T20:24:22.782558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:22.540311Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets, 2023","venue":null,"work_id":"bcbce796-16e1-47ed-8cb0-df9d04cc9592","year":2023},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:10.230753Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:05b425aa7c2107dc1b5d3f3d1b6cdfbe8b94e09e000daa30dbba541c7815cdad","observation_id":"03ca2c76-54a2-48a9-ab82-576afa890293","resolution":{"observed_at":"2026-08-06T20:24:22.622548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:22.394996Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models, 2023","venue":null,"work_id":"196c30fa-026c-47d2-a9ab-22e3221c5469","year":2023},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:10.294395Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:2c6f01c5c42e1ff502041094172c7a4e317a10247dfa1868549fb258a05b9552","observation_id":"378dbeaa-440a-48c6-bef9-fc7d44d73fc2","resolution":{"observed_at":"2026-08-06T20:24:22.455985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:22.196799Z","title":"Efros, and Tero Karras","venue":null,"work_id":"e1f49ac8-283c-43c3-a73d-d753747e2806","year":2022},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:10.368764Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:21ef1abd66e3fac6a74b165426e2c67353dc4ab21544305dad022cde7ff95598","observation_id":"7b97bbcb-b6fc-44c8-a34d-0ff7184ee671","resolution":{"observed_at":"2026-08-06T20:24:22.279970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:22.041690Z","title":"A short note about kinetics- 600, 2018","venue":null,"work_id":"1f42bb31-4b00-4d68-bdd0-3067da226650","year":2018},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:10.461138Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:7f913505196c8561010ce139214cb025a4e82929113b246f7da3d9ea10a071c7","observation_id":"da83308a-3143-401d-b3f5-d2a632de1663","resolution":{"observed_at":"2026-08-06T20:24:22.112017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:21.892996Z","title":null,"venue":null,"work_id":"9fc856d4-fded-449a-af77-8b1e8d1df2de","year":2022},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:10.545679Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:e1bef0edb2af6dff1d7cdb387f04f97cd5e4c6623eb28fc71e0e129016731876","observation_id":"429cc97a-4f2d-45e0-911f-edd4032faef0","resolution":{"observed_at":"2026-08-06T20:24:21.979392Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:21.693310Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models, 2024","venue":null,"work_id":"a1038ff2-5bb7-4c1b-a677-74c6f4227f39","year":2024},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:10.634361Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:550e86f6813c870b5e4c36c35ab1a7cd2865b49ae2cf2b20f76f8c93588ddc68","observation_id":"f66c88fd-2c5f-47df-8da9-93cc55eb4f82","resolution":{"observed_at":"2026-08-06T20:24:21.792845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:21.482203Z","title":"Adversar- ial video generation on complex datasets, 2019","venue":null,"work_id":"20774221-6137-482d-a8f6-63e08b320901","year":2019},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:10.722749Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:570f56c8d29492605301d924ad7666201753692b87e1ab58a9c089c3d0400700","observation_id":"dea1d19c-7803-4338-86a8-d3830c2b118c","resolution":{"observed_at":"2026-08-06T20:24:21.595627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:21.243357Z","title":"Av1 bitstream & decod- ing process specification","venue":null,"work_id":"47153191-855c-4be7-8fd9-6dd65ecb60fc","year":2018},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:10.790282Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:c69c99565117bdd654295b65f677e67481786b1977e4f30cab7403212d2f88d4","observation_id":"f4fa4c16-a335-4d62-a831-9bfd4f057a23","resolution":{"observed_at":"2026-08-06T20:24:21.356506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:10.863497Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:10.863497Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:d4b5d621061f4b4cea0ad1accf157ce80a96eb5af76b52e2faf5fd179c00f272","observation_id":"d92bc3ee-ee49-4718-bf52-2e48c643b6f5","resolution":{"observed_at":"2026-08-06T20:24:10.863497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:21.006476Z","title":"Lee, and Sergey Levine","venue":null,"work_id":"49d0a678-a01f-4a0e-a21d-65b5182dabb0","year":2017},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:10.946076Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:ac3256bb09c24dfd6a712bb2072bac54cc161c1a2fc1753daa260c2cc2e6b072","observation_id":"5ff7664d-0455-4b15-ac70-557ba3977fa6","resolution":{"observed_at":"2026-08-06T20:24:21.150885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:11.015793Z","title":"Taming transformers for high-resolution image synthesis, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:11.015793Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:fd328e3c19e6f947ccc6344623734bb4e0ecd9058dafcab60d38f74565398ef1","observation_id":"391dd248-6495-418b-8fd1-ae3e744a7f44","resolution":{"observed_at":"2026-08-06T20:24:11.015793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:20.736081Z","title":"Videoshop: Localized semantic video editing with noise-extrapolated diffusion inversion, 2024","venue":null,"work_id":"4e57d914-daab-4fd9-a776-055d2ca2b4cb","year":2024},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:11.084282Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:1a1a89bf73b99d8fda75d10a2d48fe4d2f04a3bdaa0fe680a880ea54b44128f1","observation_id":"8090a8b8-c661-4472-819e-8426b31d3e38","resolution":{"observed_at":"2026-08-06T20:24:20.872740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:20.414994Z","title":"Rv-gan: Re- current gan for unconditional video generation","venue":null,"work_id":"ef1b8f83-62c1-41c9-bf2b-972d10e37e0c","year":2024},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:11.175488Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:bb7624f7d75fac45a989c67ce8b1ac841900a0dd775eb5d35f469ffda88cc44c","observation_id":"e6c393a8-10c5-4827-ab10-b7df5784897e","resolution":{"observed_at":"2026-08-06T20:24:20.624651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:20.142955Z","title":"Masked autoencoders are scalable vision learners, 2021","venue":null,"work_id":"ec872454-6d20-47d0-92bd-08403fa078cd","year":2021},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:11.239482Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:288893212745fcad3550f078f99bc7f8b89843c0a5d6ab1cff5c8afc33dd866f","observation_id":"4fa49dc7-472c-41da-9239-80804c63ffaa","resolution":{"observed_at":"2026-08-06T20:24:20.258138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:19.773156Z","title":"Advanced video coding for generic audiovisual services","venue":null,"work_id":"4acd2c2b-4a0f-4dd9-85f2-7be03846a328","year":2010},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:11.335555Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:68fb3195a15d776dd535c5380e6cff37cbab471fed917df6e66eb3b59c32b1c2","observation_id":"29266b77-6317-4306-b2b4-44c4b5358082","resolution":{"observed_at":"2026-08-06T20:24:19.986902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:19.395430Z","title":"Rehg, and Pinar Yanardag","venue":null,"work_id":"80351549-a525-49a1-b2d4-95f3a123285c","year":2023},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:11.396147Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:21c074c17fa06e977a7fe73655cebb961d965479d0a93724f151473592d4763b","observation_id":"2d78a30f-5714-47e8-a60f-2e01219a423f","resolution":{"observed_at":"2026-08-06T20:24:19.563711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:19.030530Z","title":"Lay- ered neural atlases for consistent video editing, 2021","venue":null,"work_id":"32ac08c7-d2b7-4918-947b-dec867d0f846","year":2021},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:11.531815Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:efa62052b6b49c84fd19f17de1206f43dfb5bf39216be8f80f87f2bd75e9c0ed","observation_id":"3a39cbb7-f6f6-441e-b937-aa0ab04a5e72","resolution":{"observed_at":"2026-08-06T20:24:19.195599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:11.605620Z","title":"Auto-encoding varia- tional bayes, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:11.605620Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:d4c225f5c4e425965d09fafccb6812de0cce438175e8da6f25de609a83f20c26","observation_id":"15439237-de57-4a82-96c3-9d568e36ce36","resolution":{"observed_at":"2026-08-06T20:24:11.605620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:18.714393Z","title":"Ross, Bryan Seybold, and Lu Jiang","venue":null,"work_id":"5829938c-f91c-449d-83db-0bbcb2e07702","year":2024},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:11.688637Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:f52ebed2a4704fa1abc3e794757c2f99bbd689e2f39893ec149aaa5b4c7fbe4a","observation_id":"c802dbd8-8428-48e5-b64f-651c3fdb54ae","resolution":{"observed_at":"2026-08-06T20:24:18.908936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:18.441162Z","title":"Autoregressive image generation without vec- tor quantization, 2024","venue":null,"work_id":"f8f151a8-f364-429e-ad4a-242be053ce35","year":2024},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:11.767157Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:1baca15b8c72b99763e18d3acf57681d36d061e2ed825f6e5763ec83e3848504","observation_id":"459f9262-0c5a-45c5-bb54-178ed5399bcf","resolution":{"observed_at":"2026-08-06T20:24:18.586615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:18.138824Z","title":"An algorithm for vector quantizer design","venue":null,"work_id":"8c084605-7efc-40ca-a2c0-bde467ea7505","year":1980},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:11.846367Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:2b1f2b19b7b37b3712bc602fc09b7aae3422572419159520ed93cb891041c717","observation_id":"e582abfe-66f5-4ee8-b0a2-10da7bfe9053","resolution":{"observed_at":"2026-08-06T20:24:18.267472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:17.899915Z","title":"Snap video: Scaled spatiotemporal transformers for text-to-video synthesis, 2024","venue":null,"work_id":"24232c90-6257-4bee-8653-d8b868cb78f6","year":2024},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:11.919606Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:597572f1a2b3faabce33acd480dd7a8394848e00299a1e38d59aedbed94c2422","observation_id":"10c39e5e-cf17-4646-8f6e-58613dc71705","resolution":{"observed_at":"2026-08-06T20:24:18.006224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:17.721548Z","title":"Finite scalar quantization: Vq-vae made simple, 2023","venue":null,"work_id":"26c41531-b0b2-46a9-836b-92ae27f430c9","year":2023},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:12.005213Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:cf7dcb2ed94955fc739e61d5d793ff280fb4d1cfc3d14f1c86d8d7ab4fe399c7","observation_id":"75802674-e965-4252-a370-78facf87798a","resolution":{"observed_at":"2026-08-06T20:24:17.811559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:17.572106Z","title":"Hotshot-XL, 2023","venue":null,"work_id":"7a45759e-fe3c-423a-97b1-eb6f2735f4fd","year":2023},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:12.100635Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:6792b27916be191ad580ee8309f139f917cc6416de973551749ec4bfd790b17e","observation_id":"2cacb4f6-ecff-402e-98e1-525911416ead","resolution":{"observed_at":"2026-08-06T20:24:17.634533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:17.390339Z","title":"Perazzi, J","venue":null,"work_id":"1d71eb3c-f087-4570-a7b3-2c39ccc9790e","year":2016},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:12.207440Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:6ceac464931874f4a2be5bdbd0b56e8d5c4d6a8c211423baef9cc7e0d3b9a324","observation_id":"46272d8d-d82e-462f-9b66-2b8f74e0b9a9","resolution":{"observed_at":"2026-08-06T20:24:17.490697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:17.188995Z","title":"Fatezero: Fus- ing attentions for zero-shot text-based video editing, 2023","venue":null,"work_id":"94e9c631-8339-47a6-9717-b2b38c69bd2b","year":2023},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:12.329799Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:5fb792c2fe7792d20287edde1d4c5a4b3500379fd06c3a9352e3733149e9206e","observation_id":"18c400e5-bb8e-44f9-93c7-4feb6f3a7e47","resolution":{"observed_at":"2026-08-06T20:24:17.238715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:17.123780Z","title":"Cosmos tok- enizer: A suite of image and video neural tokenizers, 2024","venue":null,"work_id":"1171d0fc-f748-4df1-a258-19bbdfd0e02f","year":2024},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:12.405040Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:5fb97d4e97d96221d6236997ad60e03de787815750986bcfd74c3b03f8340b44","observation_id":"abcc7be8-7d51-48c1-bd26-ee86b2e7172b","resolution":{"observed_at":"2026-08-06T20:24:17.183544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:12.491032Z","title":"High-resolution image syn- thesis with latent diffusion models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:12.491032Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:c15aa4965a5eb1ff7b09f8b20370e1e13b1bc45ac4b7b55dd7775120b0688eab","observation_id":"1ce1e44a-336b-4a7d-bffc-d5ce3043461d","resolution":{"observed_at":"2026-08-06T20:24:12.491032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:17.020242Z","title":"Tempo- ral generative adversarial nets with singular value clipping,","venue":null,"work_id":"e4c15297-0934-4909-8792-7db4ed68891d","year":null},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:12.563254Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:330ac2cec1201f7b3831810367f33a7eb3a8fc618336b1197bc99b13a098b833","observation_id":"dce21332-4963-47e6-9471-9d22e0bb8ca9","resolution":{"observed_at":"2026-08-06T20:24:17.065883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:16.915774Z","title":"9 Make-a-video: Text-to-video generation without text-video data, 2022","venue":null,"work_id":"1c7a2bf6-e04d-4a0d-9549-3f32c8440d75","year":2022},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:12.677468Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:81f513ea39b575ec33b12633e5a76ff6d1883a6b2095204e16267bef2a1c8e29","observation_id":"4c7a4c6f-68e7-42af-85f4-3364cef47b76","resolution":{"observed_at":"2026-08-06T20:24:16.966310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:16.784724Z","title":"Stylegan-v: A continuous video generator with the price, image quality and perks of stylegan2, 2022","venue":null,"work_id":"c3bb9952-d334-4bc8-8ac4-5974c21adf71","year":2022},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:12.770484Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:c3b301c32ccde8f56ff0a2061d9314117c78f8ea7969a744e7eebe5e80dec74a","observation_id":"ad0ac60c-f428-4d9c-b3d3-673545683eaa","resolution":{"observed_at":"2026-08-06T20:24:16.847244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:16.679190Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild, 2012","venue":null,"work_id":"d249f0c2-e96d-44d0-b471-e83ef6ba4815","year":2012},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:12.864846Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:f68ce02fd965d9ab1e5aa21961bb1446aeb4547834f30479994cd5d49d8b0a57","observation_id":"e7a16f97-85b1-49a8-90f2-b926babf4d60","resolution":{"observed_at":"2026-08-06T20:24:16.731515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:16.576890Z","title":"Diffusion model-based video editing: A survey, 2024","venue":null,"work_id":"9e30baec-ee9e-4676-82a6-3c05767a4426","year":2024},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:12.962309Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:c9d381a1f27ac1a199859759cebca114e0c2afad0da34775b50c68834fe712d9","observation_id":"707402df-f354-4d8b-9d5f-58091b26c7c0","resolution":{"observed_at":"2026-08-06T20:24:16.641361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:16.454780Z","title":"Mocogan: Decomposing motion and content for video generation, 2017","venue":null,"work_id":"08110496-6383-4445-a1ee-00b965842ce6","year":2017},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:13.030915Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:ddcb962aeda33232da51f2637b29256c7d4371614d7ba830ef5ba98514410042","observation_id":"86103298-8d39-473a-8632-5ae4c19a2248","resolution":{"observed_at":"2026-08-06T20:24:16.512459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:13.117421Z","title":"Neural discrete representation learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:13.117421Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:4215359fa612eecc07123ba775f121ef6db5f08ae1a1a3dfc43249f25ead4e29","observation_id":"eff2cab0-b20a-4a56-a354-06c9418b3f57","resolution":{"observed_at":"2026-08-06T20:24:13.117421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:16.317475Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"dd80bf6b-9fd5-4edd-9ef8-700afbd49b93","year":2023},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:13.202432Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:83bfb9ed23d44a67b9a6eac62b492a621c5c08d5b4543446939d00908ef2dd4f","observation_id":"7af46399-94c8-48a2-895d-964fb07ffab7","resolution":{"observed_at":"2026-08-06T20:24:16.373401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:16.190786Z","title":"Phenaki: Variable length video generation from open domain textual description, 2022","venue":null,"work_id":"da7f6c11-b1d9-416f-bf26-3d7e8410abf2","year":2022},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:13.280020Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:912ed7ee15e2022809f7e6cc25b1990527ae0161c52c405892980490d651e3f8","observation_id":"a137870a-f311-4ae1-93f0-64e413b6ae15","resolution":{"observed_at":"2026-08-06T20:24:16.251582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:16.093832Z","title":"Larp: Tokenizing videos with a learned autoregressive generative prior, 2024","venue":null,"work_id":"e8bde7b2-82e7-4aa1-a800-826e6c3a6d2e","year":2024},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:13.380424Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:5ccbd84e106a510925cb117c4677216ad4d169a399fff20e0fb6e2809172f20f","observation_id":"30f6710d-b73a-4271-b52c-cff11ce17506","resolution":{"observed_at":"2026-08-06T20:24:16.138266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:15.937913Z","title":"Modelscope text-to-video technical report, 2023","venue":null,"work_id":"1c65df32-dcd9-41d3-b917-8be1abd771b5","year":2023},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:13.470907Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:ee9ce532ab334409da948c6a24a7bea759f01b87c8c42eb5d2533cd84e932705","observation_id":"d252e1f3-187a-44cb-96b1-a4b544af83cb","resolution":{"observed_at":"2026-08-06T20:24:16.008344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:15.815388Z","title":"Omnitokenizer: A joint image- video tokenizer for visual generation, 2024","venue":null,"work_id":"c5ad78fc-aabe-4366-a3f1-be1789b58345","year":2024},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:13.566023Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:92820a382f437da7b66e245628c07b0fd3b5e840a5a4b6a2473d9cfa30beb751","observation_id":"9993de7e-b252-49dc-b6ba-b405ba03ec51","resolution":{"observed_at":"2026-08-06T20:24:15.882355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:15.671142Z","title":"Videocomposer: Compositional video synthesis with motion controllability, 2023","venue":null,"work_id":"e9fe745e-bb6c-445d-bec1-0ad2a3852e58","year":2023},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:13.664212Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:55f16b0aa501fbb5cfbd34315d1baca0b31aec5f50f1f5d2d664fb51f20c5773","observation_id":"08039bdb-8277-442c-95a2-5ad17f8446e9","resolution":{"observed_at":"2026-08-06T20:24:15.732986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:15.524743Z","title":"Gmflow: Learning optical flow via global matching, 2022","venue":null,"work_id":"7fb0f861-b386-4054-837f-27aed40fff9f","year":2022},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:13.732253Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:a0fdb4857fc8c62428e3fff15cf035fd69689e42ec8a31b78b1a73e8b8b6485b","observation_id":"86401808-d66c-42e3-9865-70fd6dddf1c7","resolution":{"observed_at":"2026-08-06T20:24:15.599143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:15.365517Z","title":"Videogpt: Video generation using vq-vae and trans- formers, 2021","venue":null,"work_id":"ef0001c1-d836-4da5-8350-75cf34bd142e","year":2021},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:13.828286Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:08dcfbcc71c7624939ed1ac8c426fea2e98bc551d1ff05478ecfa8296303d1af","observation_id":"f45e7495-dfba-422e-94da-422213911099","resolution":{"observed_at":"2026-08-06T20:24:15.442988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:15.203686Z","title":"Elastictok: Adaptive tok- enization for image and video, 2024","venue":null,"work_id":"10e6ca88-d572-48b9-9533-b49f4700331e","year":2024},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:13.928272Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:753358919a180b421121a3f10d39a54d2f82ddb10f347118b52dfa15c8483e23","observation_id":"7cd3416c-9cd8-4c73-bc30-f9eea3bc6be8","resolution":{"observed_at":"2026-08-06T20:24:15.294319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:15.022088Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer, 2024","venue":null,"work_id":"32e8903b-d336-40aa-9565-9ef4fa8bad7e","year":2024},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:14.008910Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:2676d454a324f144219429973c6725b8740bf8b3b71b9ce7ece991984f61fafd","observation_id":"aeccd932-5da8-4af9-a2c1-474728fbd783","resolution":{"observed_at":"2026-08-06T20:24:15.120155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:14.870030Z","title":"Hauptmann, Ming- Hsuan Yang, Yuan Hao, Irfan Essa, and Lu Jiang","venue":null,"work_id":"581c53cd-f8ee-4e7d-a232-f3d394c5be1d","year":2023},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:14.085648Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:a99bc96aba21efa5aa816733db8309eef74d4a5bcb8f5586148d4c68419e3fdd","observation_id":"b30759f3-ad34-4f3e-80f9-951a66dcbd31","resolution":{"observed_at":"2026-08-06T20:24:14.946319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:14.712032Z","title":"Gundavarapu, Luca Ver- sari, Kihyuk Sohn, David Minnen, Yong Cheng, Vigh- nesh Birodkar, Agrim Gupta, Xiuye Gu, Alexander G","venue":null,"work_id":"88ce1cfc-74fd-4c41-b066-5f9eea4ed1ce","year":2024},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:14.155539Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:1de2ff06a2a18b7e2d2b648e039be49b38a4ae4d45c892662c4b1ff13ba71607","observation_id":"8f2ebbf9-c330-4846-9e72-af151173160c","resolution":{"observed_at":"2026-08-06T20:24:14.803192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:14.546198Z","title":"Generating videos with dynamics-aware implicit generative adversarial net- works, 2022","venue":null,"work_id":"bed8bb60-6630-45a1-b0ee-fbbd3ac85cd9","year":2022},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:14.229205Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:63610dc7c4e73e608992cc02669b2ddc67c0f14ebd014b66c69b7ce559677c8e","observation_id":"1ccddc64-e647-4587-aa8d-25ef654d341c","resolution":{"observed_at":"2026-08-06T20:24:14.624074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:14.386079Z","title":"Show-1: Marrying pixel and latent diffusion models for text-to-video generation, 2023","venue":null,"work_id":"1d67a019-7454-4a03-9bd6-d5caf66a7018","year":2023},"citing_paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:14.295583Z"},"links":{"citing_paper":"/paper/2507.02862"},"observation_digest":"sha256:34d3ea98e49c8502c55bb9193980a76cd444b4eaba2b30ac47b18c209748bde1","observation_id":"2295b644-e812-46ca-8b0f-35a575a912e8","resolution":{"observed_at":"2026-08-06T20:24:14.480920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02862","last_updated":"2025-07-03T17:59:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T20:16:43.361213Z","submitted_at":"2025-07-03T17:59:55Z","title":"RefTok: Reference-Based Tokenization for Video Generation"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":45},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 1 inbound Pith citation observation for arXiv:2507.02862."}