{"as_of":"2026-08-14T18:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d8e897613863ad7e02e8febec8eb66ebf9a98037ba010097d834ba28b6203878","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:28:31.486489Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T07:06:33.290588Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15728","snapshot_observed_at":"2026-08-03T07:06:33.290588Z","title":"Tokensgen: Harnessing condensed tokens for long video generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21402","last_updated":"2026-07-02T10:34:29Z","snapshot_observed_at":"2026-08-12T18:51:10.033845Z","submitted_at":"2026-01-29T08:40:37Z","title":"SemanticAudio: Audio Generation and Editing in Semantic Space","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T07:06:33.290588Z"},"links":{"cited_paper":"/paper/2507.15728","citing_paper":"/paper/2601.21402"},"observation_digest":"sha256:ddf1d4b4148740f89b3e4771c0256d718c8c8e5d70bd5a905e3b9d0e9ab3a838","observation_id":"7d9ec9f4-a98d-4d5d-a104-8b8b3f0b6ac0","resolution":{"observed_at":"2026-08-03T07:06:33.290588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15728","snapshot_observed_at":"2026-07-14T21:09:36.040879Z","title":"arXiv preprint arXiv:2507.15728 (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14526","last_updated":"2026-06-28T22:57:12Z","snapshot_observed_at":"2026-08-14T01:17:29.166622Z","submitted_at":"2026-03-15T18:07:29Z","title":"LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T21:09:36.040879Z"},"links":{"cited_paper":"/paper/2507.15728","citing_paper":"/paper/2603.14526"},"observation_digest":"sha256:b41c732a55f3b46c3dfa2e8cef5d664f300a09c546f3bf630f4dccb98502596c","observation_id":"be4158ea-3211-4fb7-8778-99ffce26305d","resolution":{"observed_at":"2026-07-14T21:09:36.040879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.15728/citation-record","integrity":"/paper/2507.15728/integrity","json":"/paper/2507.15728/citation-record.json","paper":"/paper/2507.15728"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:35.996563Z","title":"https://kling.kuaishou.com/, 2024","venue":null,"work_id":"90f65d10-f23e-4346-95e9-41c34b0908ad","year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:27.698569Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:b9e1916813a32cb0db9616f9d7273ca798fe9dcaace8e95e9558723bc2dafdd9","observation_id":"6b8d15a0-cc9f-41cf-b0e3-e53ac45b2ba4","resolution":{"observed_at":"2026-08-06T15:28:36.123355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:35.753588Z","title":null,"venue":null,"work_id":"e9e0af37-f067-4b0e-abc4-e339b6575024","year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:27.789533Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:f166dd536148afe37edda6a84e854d77d4b64cbf9afbe83d194518e8835141cf","observation_id":"7d6b37a8-8c03-4b72-9a82-de27b97c9318","resolution":{"observed_at":"2026-08-06T15:28:35.900536Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:35.540343Z","title":"https://openai.com/sora/, 2024","venue":null,"work_id":"493f04d8-13a9-4277-8faa-494e7ac26b5b","year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:27.878536Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:8a9cdf531773ee274fd53248048bb2f0af08f10788734daa635cdae459d19648","observation_id":"7a8932dc-2a0f-483d-8420-6a54ad56f43f","resolution":{"observed_at":"2026-08-06T15:28:35.656157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:35.307000Z","title":"chatgpt.com, 2025","venue":null,"work_id":"bc5d46cc-8dd7-4a7a-a5d6-1c98d07c5d6f","year":2025},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:27.972647Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:d7e04354b0e15712c193a7a72f670890bc43b47bc617372b4715cbfa6cfdc415","observation_id":"d08cfed8-3d36-4475-8fc5-193b9fea421c","resolution":{"observed_at":"2026-08-06T15:28:35.428782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-06T15:28:28.041932Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:28.041932Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:3234c09d9f79b5d3be8124b459a83b76992f9a457a1ac4c8c30c2b48c49f5035","observation_id":"3e71f12b-8e70-4b3e-b343-180b614c8a25","resolution":{"observed_at":"2026-08-06T15:28:28.041932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:35.123292Z","title":"Generating long videos of dynamic scenes","venue":null,"work_id":"66ea2ad8-e03d-4178-9f96-48d4851fc302","year":2022},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:28.140787Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:a7d65375cc590df64318fc5d7a04db9f48c499c6feed0a4e4c018953e44b718c","observation_id":"40f472b8-6b64-4fe3-8fc8-5c4418789c6e","resolution":{"observed_at":"2026-08-06T15:28:35.223884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18597","last_updated":"2025-03-26T09:05:41Z","snapshot_observed_at":"2026-08-11T04:35:23.935045Z","submitted_at":"2024-12-24T18:51:19Z","title":"DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18597","snapshot_observed_at":"2026-08-06T15:28:28.213590Z","title":"Ditctrl: Exploring attention control in multi-modal dif- fusion transformer for tuning-free multi-prompt longer video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:28.213590Z"},"links":{"cited_paper":"/paper/2412.18597","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:4d4733db1a03804705878590da4304af5c47181edb311a477b75f0f85acd7ed7","observation_id":"0c9f658c-b664-48b4-adeb-6a4a915ee9e0","resolution":{"observed_at":"2026-08-06T15:28:28.213590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:34.934718Z","title":"Pyscenedetect","venue":null,"work_id":"b93ef5dc-d0e2-4c4f-a390-7e9f3b1bd18a","year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:28.287841Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:be2959d9bb6f968d77f636b853cceedd1dc6b488655baaa51b7cd10bff9cf12e","observation_id":"693857a8-ba06-4245-b85b-54baadb58d43","resolution":{"observed_at":"2026-08-06T15:28:35.012541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:34.720034Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models, 2024","venue":null,"work_id":"0c52ed39-be1a-4291-bf0f-0d52639ace47","year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:28.342506Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:941ff84f39ce143763f4899eb1d8e3fef1b1ef3a80071b85c12db8a4e3c5a3ef","observation_id":"d1531c13-a8bc-4b7b-9a69-ef248d72f437","resolution":{"observed_at":"2026-08-06T15:28:34.820307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:28.395493Z","title":"Seine: Short-to-long video diffusion model for generative transition and prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:28.395493Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:b52fa1bfea89389661c77622bbd3aeb3345fdb7469c56a5e3869f01af62e5b51","observation_id":"181fa8ed-a762-4df1-aa84-075ffc7e5012","resolution":{"observed_at":"2026-08-06T15:28:28.395493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:34.469268Z","title":"Alabdul- mohsin, Avital Oliver, Piotr Padlewski, Alexey A","venue":null,"work_id":"55232364-6fa2-4f6d-80cb-8e1e955ea080","year":2023},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:28.470566Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:eb74369e56f7c3d3b4c39ad6e096c45857eb89da73c7d6210864904ee824e8ab","observation_id":"8d0e91d2-e201-4590-ba4b-df59785f3670","resolution":{"observed_at":"2026-08-06T15:28:34.617903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14130","last_updated":"2024-06-20T09:18:54Z","snapshot_observed_at":"2026-08-14T09:08:34.975004Z","submitted_at":"2024-06-20T09:18:54Z","title":"ExVideo: Extending Video Diffusion Models via Parameter-Efficient Post-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14130","snapshot_observed_at":"2026-08-06T15:28:28.536008Z","title":"Exvideo: Extending video diffusion models via parameter-efficient post-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:28.536008Z"},"links":{"cited_paper":"/paper/2406.14130","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:dc689c5a6ece24644d01d6f0538544b3ea14c184ccb5989119768bad8c2acf1d","observation_id":"221a3a91-45a3-4874-acc9-aa775791021e","resolution":{"observed_at":"2026-08-06T15:28:28.536008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:34.292556Z","title":null,"venue":null,"work_id":"6a0e3b01-d5bf-4873-bafc-df35a1151322","year":1901},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:28.625330Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:86d76ff0a956d57c994c5b30eb089b1012842aa893cf0f7b3ca4ff95d3094ab9","observation_id":"1999f25b-47df-49ac-9cee-01cf911b5145","resolution":{"observed_at":"2026-08-06T15:28:34.368553Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:34.141012Z","title":"Videostu- dio: Generating consistent-content and multi-scene videos","venue":null,"work_id":"ee92c503-5892-44b5-bb0c-f5404fb41da5","year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:28.669470Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:37d886b27d28058d475587a0cab782ce2f704ed583faf25408d7248b00cba522","observation_id":"c54510bf-8a1c-4d13-ac92-5beb02c57d86","resolution":{"observed_at":"2026-08-06T15:28:34.195845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16933","last_updated":"2023-11-28T16:33:08Z","snapshot_observed_at":"2026-08-13T05:15:15.489641Z","submitted_at":"2023-11-28T16:33:08Z","title":"SparseCtrl: Adding Sparse Controls to Text-to-Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16933","snapshot_observed_at":"2026-08-06T15:28:28.719286Z","title":"Sparsectrl: Adding sparse con- trols to text-to-video diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:28.719286Z"},"links":{"cited_paper":"/paper/2311.16933","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:2e6fcc5e42e38c0804dcde8e33c0604ba207525ab10af0c1a38f08f83db5854e","observation_id":"780bad60-0a28-4002-aa56-1497adcd6f25","resolution":{"observed_at":"2026-08-06T15:28:28.719286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:33.955994Z","title":"Animatediff: Animate your personalized text-to- image diffusion models without specific tuning","venue":null,"work_id":"369d9ad3-aaed-4b94-8826-0fd3ca9f959f","year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:28.826647Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:04b08115ffa5ab7a6f3c592d0c783e5985d4142c199d8e217f4299f4f83f5753","observation_id":"8f594f41-db8f-45eb-a680-4e30aa8247ec","resolution":{"observed_at":"2026-08-06T15:28:34.036935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:33.801417Z","title":"Latent video diffusion models for high-fidelity long video generation","venue":null,"work_id":"35ba976b-6c0d-4a4c-be65-8da5a79eb66e","year":2022},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:28.927845Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:bd4dc26c046d4087ef23d8f20fbc22b4467e57b5ab8a445126299ae688f1c2cd","observation_id":"16efe02e-cb35-49aa-a714-bbfd5530783e","resolution":{"observed_at":"2026-08-06T15:28:33.864953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14773","last_updated":"2025-04-16T13:38:58Z","snapshot_observed_at":"2026-08-13T18:13:05.895663Z","submitted_at":"2024-03-21T18:27:29Z","title":"StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14773","snapshot_observed_at":"2026-08-06T15:28:29.016923Z","title":"Streamingt2v: Con- sistent, dynamic, and extendable long video generation from text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:29.016923Z"},"links":{"cited_paper":"/paper/2403.14773","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:efd56b32a5cecf96c36b226f6f8418477eb3bcfb841bf0fe3fcbaac3de45315c","observation_id":"f863bcfd-ba0b-42a5-8ac1-8080db758286","resolution":{"observed_at":"2026-08-06T15:28:29.016923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:29.084392Z","title":"VBench: Com- prehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:29.084392Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:8dfff34d580f2e1a704bfad2db97f803d09ca5b6fe2186f6c9f0f6d8681137ab","observation_id":"3848cff8-4747-4c14-b7d7-c44f95fadeba","resolution":{"observed_at":"2026-08-06T15:28:29.084392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13503","last_updated":"2024-11-20T17:54:41Z","snapshot_observed_at":"2026-08-12T19:44:40.357419Z","submitted_at":"2024-11-20T17:54:41Z","title":"VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13503","snapshot_observed_at":"2026-08-06T15:28:29.174408Z","title":"VBench++: Comprehensive and versatile bench- mark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:29.174408Z"},"links":{"cited_paper":"/paper/2411.13503","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:51cbe2e6ce5a1be6e341be89f38ff09dc190bae5dad18c4516943bbc19446438","observation_id":"3b1116f8-421f-4161-86d7-0ff257d86b9d","resolution":{"observed_at":"2026-08-06T15:28:29.174408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:29.218063Z","title":"Pyramidal flow matching for efficient video generative modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:29.218063Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:d88ddcb3a67e6eae0eae8e28b52db15350d331ec2ff9f76b22452d6bf1a062b4","observation_id":"249be0f2-6a35-4326-af29-f02ca811d21a","resolution":{"observed_at":"2026-08-06T15:28:29.218063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:33.578113Z","title":"Miradata: A large-scale video dataset with long durations and structured captions, 2024","venue":null,"work_id":"11ce0b4a-9e6d-4b2e-82fe-8b125c5a164c","year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:29.269154Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:3dd930ea8c8739118c16f77a103498c65f093a4da9cf5bfb37a8436041f43936","observation_id":"4ae3edc4-061a-4155-ad5f-fa476cbebca3","resolution":{"observed_at":"2026-08-06T15:28:33.711098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11473","last_updated":"2024-11-03T12:40:41Z","snapshot_observed_at":"2026-08-13T00:04:24.814743Z","submitted_at":"2024-05-19T07:48:41Z","title":"FIFO-Diffusion: Generating Infinite Videos from Text without Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11473","snapshot_observed_at":"2026-08-06T15:28:29.382296Z","title":"Fifo-diffusion: Generating infinite videos from text without training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:29.382296Z"},"links":{"cited_paper":"/paper/2405.11473","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:53cb8c5552b618352fa6227c3b3a04814c4e8637f8c3518f46fa292d91cf2e31","observation_id":"c832b773-4ed9-43a7-97ca-f3961f4551f1","resolution":{"observed_at":"2026-08-06T15:28:29.382296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-06T15:28:29.502212Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:29.502212Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:445cff9c4f4fd4194fad5465a2d7e28666e5cf7a43ee225667531b26d98e1766","observation_id":"0531271c-a2f0-419a-a0ef-b55e68c7cf00","resolution":{"observed_at":"2026-08-06T15:28:29.502212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-13T21:19:07.777045Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-06T15:28:29.555990Z","title":"Open-sora plan: Open-source large video generation model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:29.555990Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:4deb7c607811acf592db225edddb596b0d25ae12539d9bc084fd62faf115cc62","observation_id":"4cc786b5-208d-4086-8437-b1060560bcac","resolution":{"observed_at":"2026-08-06T15:28:29.555990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:33.420492Z","title":"Videodirectorgpt: Consistent multi-scene video generation via llm-guided planning","venue":null,"work_id":"2b71d63e-bf6a-49fe-a61d-f6f65ef5c884","year":2023},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:29.634240Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:31aebd7ee18a17800b1b80d98ec322da4bb12a1c818ade7847ced9cff3af3f42","observation_id":"94655e04-eda0-40d0-9846-d5f652f16340","resolution":{"observed_at":"2026-08-06T15:28:33.512729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19918","last_updated":"2024-07-29T11:52:07Z","snapshot_observed_at":"2026-08-12T23:12:56.763608Z","submitted_at":"2024-07-29T11:52:07Z","title":"FreeLong: Training-Free Long Video Generation with SpectralBlend Temporal Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19918","snapshot_observed_at":"2026-08-06T15:28:29.693518Z","title":"Freelong: Training-free long video generation with spectralblend tem- poral attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:29.693518Z"},"links":{"cited_paper":"/paper/2407.19918","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:200ab3d8588c4d9d7dace3fddaf3f2a7dbdaced41a332ec2328351c5b3f5f04e","observation_id":"d2b20662-2cda-4d85-9335-52c9a7fc8462","resolution":{"observed_at":"2026-08-06T15:28:29.693518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-13T10:28:06.516901Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-06T15:28:29.772044Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:29.772044Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:9fd1785302877384732373fc442d19c44cf0b58ec07b69923bcf1ed148cacf27","observation_id":"4b697eee-44f4-4b1f-9333-196137b71b5d","resolution":{"observed_at":"2026-08-06T15:28:29.772044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05484","last_updated":"2025-01-08T05:49:39Z","snapshot_observed_at":"2026-08-13T12:33:00.554766Z","submitted_at":"2025-01-08T05:49:39Z","title":"Tuning-Free Long Video Generation via Global-Local Collaborative Diffusion","version":1},"cited_work":{"arxiv_id":"2501.05484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.05484","snapshot_observed_at":"2026-08-06T15:28:31.726758Z","title":"Tuning-Free Long Video Generation via Global-Local Collaborative Diffusion","venue":"cs.CV","work_id":"b0249939-0d27-4c65-aae6-df6535e9b190","year":2025},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:29.815825Z"},"links":{"cited_paper":"/paper/2501.05484","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:158b5c2146662cfa7ec3fdefec276996e858985871696f4d5cc052ea4f5e06ef","observation_id":"cd3b24b7-519f-4c8c-9e91-e2a0ec074014","resolution":{"observed_at":"2026-08-06T15:28:31.802642Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:33.223624Z","title":"Freenoise: Tuning-free longer video diffusion via noise rescheduling, 2023","venue":null,"work_id":"df6ff288-4a2a-4480-9cc0-2bb527634dbf","year":2023},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:29.882776Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:5bd79704b3e827456def91761f19d985812ee2f90de34328769e4f8e747492cd","observation_id":"7eb421af-573a-406e-9532-2e491f83c27a","resolution":{"observed_at":"2026-08-06T15:28:33.306331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09470","last_updated":"2024-09-09T11:30:41Z","snapshot_observed_at":"2026-08-13T04:20:49.808555Z","submitted_at":"2024-02-12T08:16:10Z","title":"Rolling Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09470","snapshot_observed_at":"2026-08-06T15:28:29.959732Z","title":"Rolling diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:29.959732Z"},"links":{"cited_paper":"/paper/2402.09470","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:49ead4466c166b9fe760fa681ab1f14e4130370344636bd174b72126fc91b8a8","observation_id":"fd57168a-2864-466b-bb1e-4d5753f928b0","resolution":{"observed_at":"2026-08-06T15:28:29.959732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:30.079674Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:30.079674Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:264e23f7e8106ecc475a558bd615b9b87340c364cf62a992d0479b67de3d44b0","observation_id":"5854ad69-242f-4937-87db-c21142f337ff","resolution":{"observed_at":"2026-08-06T15:28:30.079674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16260","last_updated":"2024-06-24T01:56:12Z","snapshot_observed_at":"2026-08-12T23:36:32.566132Z","submitted_at":"2024-06-24T01:56:12Z","title":"Video-Infinity: Distributed Long Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16260","snapshot_observed_at":"2026-08-06T15:28:30.162287Z","title":"Video-infinity: Distributed long video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:30.162287Z"},"links":{"cited_paper":"/paper/2406.16260","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:2a43b634f1c1c1871657cd82faed6a84211577eef986925bfec7f2bbb06fff51","observation_id":"3c30ae6f-238c-4a9e-91c6-1a5e4a8fa7f2","resolution":{"observed_at":"2026-08-06T15:28:30.162287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:33.006379Z","title":null,"venue":null,"work_id":"a5b908e1-ba23-4180-af36-aa50a60ad108","year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:30.218238Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:240e2e1436a2431868c97601ba001adb2f5abac4636332c62dc6974dccd9143b","observation_id":"6b68542f-f5df-47d4-b151-885b4e37bb24","resolution":{"observed_at":"2026-08-06T15:28:33.100424Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04277","last_updated":"2024-10-14T07:20:01Z","snapshot_observed_at":"2026-08-13T06:05:51.161533Z","submitted_at":"2024-06-06T17:25:33Z","title":"VideoTetris: Towards Compositional Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04277","snapshot_observed_at":"2026-08-06T15:28:30.276884Z","title":"Videotetris: To- wards compositional text-to-video generation.arXiv preprint arXiv:2406.04277, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:30.276884Z"},"links":{"cited_paper":"/paper/2406.04277","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:6fb0af80a3b8e20586a55410297c78109481876c7f52c26f5fc5478d673f693e","observation_id":"adf452e4-f75a-47c8-acc9-3d2f8b7465db","resolution":{"observed_at":"2026-08-06T15:28:30.276884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-13T11:30:06.083037Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-06T15:28:30.321287Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:30.321287Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:35d1c1dbdd6b142091fe82b6cf946e0e96a3dc88fc22aa3e1ad8bef9040d3107","observation_id":"05b365b8-e324-4737-876f-a97c2bcbaab0","resolution":{"observed_at":"2026-08-06T15:28:30.321287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-14T13:59:50.878772Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-06T15:28:30.394069Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:30.394069Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:cd0bd171234acc84b0a4f517f71f0e3d17b932c6aec66055c9d0f7b2eb11a27a","observation_id":"58416333-b7fe-4c73-bf81-aaf5dcbd7b29","resolution":{"observed_at":"2026-08-06T15:28:30.394069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:32.846805Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models","venue":null,"work_id":"86ec6f33-22f1-4f34-93f9-1d9756b4d5de","year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:30.510792Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:706ee690521f31e453271beb32c1af9ea6ae507a80f22f6b5a7dc0a967177b2e","observation_id":"be357ccc-b38b-4148-8931-1879725f5f54","resolution":{"observed_at":"2026-08-06T15:28:32.911714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-12T22:31:22.501227Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-06T15:28:30.643014Z","title":"Loong: Generating minute-level long videos with autoregressive lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:30.643014Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:e70d34536835df3106ba130086f70f27992f02849b9f485d66f87e7c9c7714e1","observation_id":"7f4c72cf-7aea-430b-bf5e-81a1e9075b20","resolution":{"observed_at":"2026-08-06T15:28:30.643014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08151","last_updated":"2025-05-18T06:43:40Z","snapshot_observed_at":"2026-08-12T22:26:04.826585Z","submitted_at":"2024-10-10T17:36:15Z","title":"Progressive Autoregressive Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08151","snapshot_observed_at":"2026-08-06T15:28:30.696472Z","title":"Progressive autoregressive video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:30.696472Z"},"links":{"cited_paper":"/paper/2410.08151","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:923cfec24d724fce5f363c70a66a7e65d6456db3404b433acf659dcb20d71cf1","observation_id":"a55a1ef5-243e-4225-8e2c-e6d197cf0489","resolution":{"observed_at":"2026-08-06T15:28:30.696472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12190","last_updated":"2023-11-27T13:36:04Z","snapshot_observed_at":"2026-08-13T05:46:49.160520Z","submitted_at":"2023-10-18T14:42:16Z","title":"DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12190","snapshot_observed_at":"2026-08-06T15:28:30.738068Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:30.738068Z"},"links":{"cited_paper":"/paper/2310.12190","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:8c071489afe31a2a9c5cf0d041c5fcf7fc5c8bac3422b09fc8b985427290fac2","observation_id":"1adb4979-161f-43d2-bfb0-70a793f893dd","resolution":{"observed_at":"2026-08-06T15:28:30.738068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T15:28:30.848440Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:30.848440Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:ebe04c6b2e118b322716c31b54916764587c7c5a0f50951d4303f4056bab33ed","observation_id":"e36c13c2-ca72-401b-a968-8c2d73967b3a","resolution":{"observed_at":"2026-08-06T15:28:30.848440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12346","last_updated":"2023-03-22T07:10:09Z","snapshot_observed_at":"2026-08-13T12:19:27.113436Z","submitted_at":"2023-03-22T07:10:09Z","title":"NUWA-XL: Diffusion over Diffusion for eXtremely Long Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12346","snapshot_observed_at":"2026-08-06T15:28:30.902462Z","title":"Nuwa-xl: Diffusion over diffusion for extremely long video generation.arXiv preprint arXiv:2303.12346, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:30.902462Z"},"links":{"cited_paper":"/paper/2303.12346","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:8fe6fc00db76f771e1ed3c7f6d5945aebd765c94cebefa3929960cbf87c6b634","observation_id":"6440d349-3cd5-4a3e-bff8-67b44d7502f6","resolution":{"observed_at":"2026-08-06T15:28:30.902462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:30.967710Z","title":"From slow bidirectional to fast causal video generators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:30.967710Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:91853dd0df95f7480c5c8055413622650b66544d1b83e799c9ec35a0065df3cf","observation_id":"88f54eef-26d3-45ad-9c29-10bcbc1eef69","resolution":{"observed_at":"2026-08-06T15:28:30.967710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13248","last_updated":"2024-10-03T22:13:39Z","snapshot_observed_at":"2026-08-13T00:49:52.189097Z","submitted_at":"2024-03-20T02:19:21Z","title":"Mora: Enabling Generalist Video Generation via A Multi-Agent Framework","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13248","snapshot_observed_at":"2026-08-06T15:28:31.054557Z","title":"Mora: Enabling gen- eralist video generation via a multi-agent framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:31.054557Z"},"links":{"cited_paper":"/paper/2403.13248","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:133d5cbf88a4a172bd86f25ab97af552f77d675ae9fd31c1ade66a2a584b0b6e","observation_id":"7be0dcfb-ac0f-4300-97f5-7a2bdaa28b53","resolution":{"observed_at":"2026-08-06T15:28:31.054557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:32.642062Z","title":"I2vgen-xl: High-quality image-to-video syn- thesis via cascaded diffusion models","venue":null,"work_id":"04f9081b-7a63-436f-bf0f-7b2187ef0979","year":2023},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:31.108134Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:8dd49374c95ad936ac9f980542b70e1c486861a5f14d2cd5fdcf47812f5d235c","observation_id":"c42ed040-268e-47f8-a811-2afb30564af4","resolution":{"observed_at":"2026-08-06T15:28:32.748966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:32.452730Z","title":"Moviedreamer: Hier- archical generation for coherent long visual sequence, 2024","venue":null,"work_id":"fc7bbeec-6a70-4c29-85a5-3aa761808bff","year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:31.200019Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:e61a427714dfc675c467a6a7cbeed91c38db17035357e1320c1f607c20f9cce8","observation_id":"67abd083-9273-43f4-a082-cc3eaab5c16b","resolution":{"observed_at":"2026-08-06T15:28:32.535540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:32.292995Z","title":"Open-sora: Democratizing efficient video production for all, 2024","venue":null,"work_id":"ee5198fc-3257-496a-b8e5-6cefa173e4b8","year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:31.301863Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:57651d6138de97c68770af3e25b5ab9f038bbfb81ceabe85a6115f0d50c95bf6","observation_id":"c66d2837-da08-4504-a942-e34e054e82d0","resolution":{"observed_at":"2026-08-06T15:28:32.364448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:28:32.085894Z","title":"Storydiffusion: Consistent self-attention for long-range image and video generation","venue":null,"work_id":"5324ece1-411d-4dd6-b7f1-6defe24c775e","year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:31.365833Z"},"links":{"citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:bd29e8e6bb3576e7085572a4cae2e8ffd6c30138cb2eac3175b9132d4cdc50a6","observation_id":"10b6a484-1add-4249-8798-aefbda007d62","resolution":{"observed_at":"2026-08-06T15:28:32.202605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09414","last_updated":"2024-01-17T18:55:12Z","snapshot_observed_at":"2026-08-13T04:40:23.947408Z","submitted_at":"2024-01-17T18:55:12Z","title":"Vlogger: Make Your Dream A Vlog","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09414","snapshot_observed_at":"2026-08-06T15:28:31.486489Z","title":"Vlogger: Make your dream a vlog","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:31.486489Z"},"links":{"cited_paper":"/paper/2401.09414","citing_paper":"/paper/2507.15728"},"observation_digest":"sha256:c7df3e1049bc77b5b2de6b9c8ba6c2eb3ec4f4db10fdcc08489aa90965cb201b","observation_id":"5a541034-3ac2-4f29-be2c-ea9415702346","resolution":{"observed_at":"2026-08-06T15:28:31.486489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15728","last_updated":"2025-07-21T15:37:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T03:56:59.973854Z","submitted_at":"2025-07-21T15:37:33Z","title":"TokensGen: Harnessing Condensed Tokens for Long Video Generation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 2 inbound Pith citation observations for arXiv:2507.15728."}