{"as_of":"2026-08-02T17:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a04dc7e3dd843ec03c4ce73a147485d2fdf412e1c7e4a6be8bc160cebcfe8215","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T18:16:14.985693Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-02T06:30:47.504484+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T03:30:25.729920Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-21T07:59:50.595450Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"cited_work":{"arxiv_id":"2605.04461","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.04461","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","venue":"cs.CV","work_id":"8c9ab80d-63f9-4ce4-91f1-28248723d012","year":2026},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-05-20T11:46:52.658984Z"},"links":{"cited_paper":"/paper/2605.04461","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:3961e467a2a0825236dace53aa5c0790423ac308a0e4cc1f2b1beef906c2be41","observation_id":"57015be4-cfba-4881-a9db-a6971606329b","resolution":{"observed_at":"2026-05-20T11:48:14.790869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"cited_work":{"arxiv_id":"2605.04461","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.04461","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","venue":"cs.CV","work_id":"8c9ab80d-63f9-4ce4-91f1-28248723d012","year":2026},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2605.04461","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:44cb94b334ff125610f89ccc9b47bc73a0fe19d88ccfc88134f8608a6fc553a2","observation_id":"7b56ca82-b68f-4341-bcee-62a0d9a38c9b","resolution":{"observed_at":"2026-05-21T07:59:50.598285Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.04461","snapshot_observed_at":"2026-08-01T03:30:25.729920Z","title":"Stream-t1: Test-time scaling for streaming video generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23159","last_updated":"2026-07-30T17:05:25Z","snapshot_observed_at":"2026-08-02T17:15:32.454865Z","submitted_at":"2026-07-25T11:30:59Z","title":"CachedSearch: Training-Free Cached Exploration for Test-Time Search in Video Diffusion","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T03:30:25.729920Z"},"links":{"cited_paper":"/paper/2605.04461","citing_paper":"/paper/2607.23159"},"observation_digest":"sha256:b71625df5b6aed5330c7b83de37ea21ebdabbb5b7284e63a061b911753ac025f","observation_id":"94b9d04a-88fc-45ed-a1c9-918dae59bee0","resolution":{"observed_at":"2026-08-01T03:30:25.729920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.04461/citation-record","integrity":"/paper/2605.04461/integrity","json":"/paper/2605.04461/citation-record.json","paper":"/paper/2605.04461"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02076","last_updated":"2025-07-02T18:27:42Z","snapshot_observed_at":"2026-07-06T21:51:24.566962Z","submitted_at":"2025-07-02T18:27:42Z","title":"Reasoning on a Budget: A Survey of Adaptive and Controllable Test-Time Compute in LLMs","version":1},"cited_work":{"arxiv_id":"2507.02076","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02076","snapshot_observed_at":"2026-07-04T10:39:45.816513Z","title":"Reasoning on a budget: A survey of adaptive and controllable test-time compute in llms","venue":null,"work_id":"ce2ea139-eaf6-4e82-a16d-cfa8657ac65c","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2507.02076","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:892fe5791bdb9ecba2d3a7a0a6cdafa73e4d53fa54f0597c49991ee89770ddf1","observation_id":"4f7159f5-d5ca-4da8-a1fe-9bbd642afe20","resolution":{"observed_at":"2026-05-09T06:40:39.447330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-07-11T02:27:48.842637Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:9e087b9f48407a8532bfa29a44c2640327ee250c69b1f9059afdfebca3d7a2be","observation_id":"3c6afa20-1390-48d2-8661-cd799312933a","resolution":{"observed_at":"2026-05-10T22:58:52.491420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"cited_work":{"arxiv_id":"2504.13074","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.13074","snapshot_observed_at":"2026-07-10T01:46:41.058772Z","title":"SkyReels-V2: Infinite-length Film Generative Model","venue":"cs.CV","work_id":"2ce11350-273e-4f0d-ae78-292aa3151060","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2504.13074","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:cce907276dda06e3457a9ebd92a74963243626e2e447a003d5371a585a840f10","observation_id":"3dc4a080-ea58-4fce-b65a-3d07585834ef","resolution":{"observed_at":"2026-05-14T20:23:04.486750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":"2412.14169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-05T11:41:02.772589Z","title":"Autoregressive Video Generation without Vector Quantization","venue":"cs.CV","work_id":"11db2d86-1589-4095-8111-fa80171a943f","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:cec0edce5f5919dd576f66236ce23f45477ebc01aa71157e7257644c36643767","observation_id":"ad65406b-a55c-40de-8ae7-716a00eba102","resolution":{"observed_at":"2026-05-17T15:07:39.939813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16375","last_updated":"2025-05-21T10:38:01Z","snapshot_observed_at":"2026-07-06T19:56:30.344759Z","submitted_at":"2024-11-25T13:33:41Z","title":"Ca2-VDM: Efficient Autoregressive Video Diffusion Model with Causal Generation and Cache Sharing","version":2},"cited_work":{"arxiv_id":"2411.16375","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.16375","snapshot_observed_at":"2026-07-07T14:03:48.589989Z","title":"Ca2-vdm: Efficient autore- gressive video diffusion model with causal generation and cache sharing","venue":"cs.CV","work_id":"64a14619-a1b0-45bc-acdb-eda16e69490c","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2411.16375","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:59986e10ca9937846771ca42e87e059eae50fa39eae2cd44398d88f816eed8b8","observation_id":"62b5c462-02c7-4d39-970d-8885c0eaeed1","resolution":{"observed_at":"2026-05-09T06:40:39.381562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"cited_work":{"arxiv_id":"2503.19325","doi":"10.48550/arxiv.2503.19325","metadata_source":"pith","pith_arxiv_id":"2503.19325","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","venue":"cs.CV","work_id":"9700bbdc-df42-461a-81fa-b29ffe683326","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2503.19325","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:bb9418c6cb34a138dd055a3e0d71d015ef11f16255bd0e8e9e93f606012c0c9f","observation_id":"3d9dc62f-0c40-47ca-8fa6-dfd6c9c18e24","resolution":{"observed_at":"2026-05-16T23:05:17.562899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepseek-r1 incentivizes reasoning in llms through reinforcement learning.Nature, 645(8081): 633–638","venue":null,"work_id":"a23a80ab-08ed-4291-b5c6-a2cd4d9c6d8d","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:9ca077f619537eeb44c566bdc78fd229c42b6696c57989751e3966e962f37134","observation_id":"909a02e4-251c-41e5-bcee-7595e15f8751","resolution":{"observed_at":"2026-05-26T05:26:45.821157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":"2307.04725","doi":"10.48550/arxiv.2307.04725","metadata_source":"pith","pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","venue":"cs.CV","work_id":"1f9d1d3b-a6d6-45a9-9f13-51393c03be8a","year":2023},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:40f53628c460c27e2dad1fbd4a9666a4209bfafdfecb4ba8465f953bd052603b","observation_id":"65c0da35-7216-4f86-8628-4d5a715e1344","resolution":{"observed_at":"2026-05-10T22:52:19.777506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17618","last_updated":"2025-05-23T08:25:46Z","snapshot_observed_at":"2026-08-02T14:26:12.032919Z","submitted_at":"2025-05-23T08:25:46Z","title":"Scaling Image and Video Generation via Test-Time Evolutionary Search","version":1},"cited_work":{"arxiv_id":"2505.17618","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17618","snapshot_observed_at":"2026-07-04T13:09:50.730002Z","title":"arXiv preprint arXiv:2505.17618 , year =","venue":null,"work_id":"57c6e091-57ae-40da-abcb-41b78bd60702","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2505.17618","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:71aa92935ef12d9664709054f34fd5950ed99d38148ad67dffb7ed14fb6bd544","observation_id":"6715b68a-f580-4a69-8dd2-338dbb1ddbc4","resolution":{"observed_at":"2026-05-09T06:40:39.266097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":"2506.08009","doi":"10.48550/arxiv.2506.08009","metadata_source":"pith","pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-07-11T01:07:45.231019Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","venue":"cs.CV","work_id":"53e58ef9-7932-4b83-b757-34ac14db3e0f","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:0af12898d11feae2a3e924a41509af38d116517a840ab60f0fb0cb420e7f1a73","observation_id":"e0127b0a-35f7-4e7e-9a01-0c0503386fb4","resolution":{"observed_at":"2026-05-11T01:36:53.812910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T23:44:22.326016Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"9f23bd16-4e15-463f-941a-93528f3b5926","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:d9f4323c64f8e5ead7832fe76351d84fb158270d8b3c8e8bc81e58e6d324aec1","observation_id":"8f711057-a0b5-44d5-a349-bbccdb4eb557","resolution":{"observed_at":"2026-05-26T05:26:45.870560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vbench++: Comprehensive and versatile benchmark suite for video generative models","venue":null,"work_id":"47e62b38-0a5b-4686-9de0-6e2d4fb1c105","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:31456f9502a62fbe6835a0a3568e5b3ecc0daeb9dcf731dd745353bf0ed5e271","observation_id":"7bb3c82a-7a6f-4a27-836f-096ee7152f90","resolution":{"observed_at":"2026-05-26T05:26:45.879025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-07-11T03:17:51.754565Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:3a8fe331bbc692268f08b9667134bf06bcec38971eea49e477cec11e866ddf57","observation_id":"3b8763fd-e4ac-4670-a9d0-0fb45e4269f8","resolution":{"observed_at":"2026-05-09T06:40:39.115011Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.05966","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:27:24.381988Z","title":"Videoar: Autoregressive video generation via next-frame & scale prediction","venue":null,"work_id":"165c8814-8d81-43db-9424-2b70e8538c65","year":2026},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:514acd924f6db3bffde83aaa08c1672104f0c0a284b3efd7e06441ba095a1e96","observation_id":"7d99f900-7788-4e94-b41d-4aebef16200e","resolution":{"observed_at":"2026-05-09T06:40:39.339531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Compositional image synthesis with inference-time scaling","venue":null,"work_id":"1e63dab2-01f8-42ef-8c91-70f9687b9cd9","year":2026},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:3ac769cf451fb806ff0a88e510bd39109690e23c7c8b50cdf5ff628af1dbb6ed","observation_id":"f6947854-683c-41f2-b89e-56e9b32ff3c8","resolution":{"observed_at":"2026-05-26T05:26:45.865958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":"2312.14125","doi":"10.48550/arxiv.2312.14125","metadata_source":"pith","pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","venue":"cs.CV","work_id":"5cc3572d-7e2f-4431-ae42-d9282a42a800","year":2023},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:de5f4ddd7616282b5953b827ab98fffdba69447fde20561d6ba652f2954e6891","observation_id":"df1188a5-0226-4137-af9c-92abd584f8ca","resolution":{"observed_at":"2026-05-15T17:51:05.830483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-07-11T01:07:45.135143Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:3724f75a1835fdc4ba9d36aa319f01270026c29206e10d1736c059eb0851ad3f","observation_id":"4fd06467-db47-4681-a9cc-fd471207dcea","resolution":{"observed_at":"2026-05-09T06:40:39.218180Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.07775","last_updated":"2026-05-03T01:49:14Z","snapshot_observed_at":"2026-07-30T09:22:37.641917Z","submitted_at":"2026-02-08T02:16:02Z","title":"Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion","version":6},"cited_work":{"arxiv_id":"2602.07775","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.07775","snapshot_observed_at":"2026-07-10T01:46:41.027454Z","title":"Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion","venue":"cs.CV","work_id":"ee9b6bbe-6f3e-4344-b631-395401ca5b33","year":2026},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2602.07775","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:2884d4b38812f011838e26405c9d114a58373d0b7cd46b597f4ee129a8cdad72","observation_id":"74d05e05-d655-41fe-88a3-0d0485ec1a98","resolution":{"observed_at":"2026-05-09T06:40:39.314786Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reflect-dit: Inference-time scaling for text-to-image diffusion transformers via in-context reflection","venue":null,"work_id":"9c7a2753-8d14-4cab-b7f1-851a438a62ff","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:b7ff683c6bed51e5156df5e0f8b0f86fa02cede5beded3a7222fd4181d423101","observation_id":"61cae0a0-9cd7-4099-8f74-0cd8adccd9f8","resolution":{"observed_at":"2026-05-26T05:26:45.874861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20502","last_updated":"2025-04-15T14:06:28Z","snapshot_observed_at":"2026-07-06T19:40:25.975196Z","submitted_at":"2024-10-27T16:28:28Z","title":"ARLON: Boosting Diffusion Transformers with Autoregressive Models for Long Video Generation","version":3},"cited_work":{"arxiv_id":"2410.20502","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20502","snapshot_observed_at":"2026-07-02T20:37:22.496220Z","title":"Arlon: Boosting diffusion transformers with autoregressive models for long video generation","venue":null,"work_id":"722a2b1e-c829-4cef-864f-4bbdb1eb0031","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2410.20502","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:c02fb12924d3b40317592d92ffa3e55084d2451d57185092b1e5629e564b1f67","observation_id":"04239bbe-1acd-41a1-9541-253eaec0a5d3","resolution":{"observed_at":"2026-05-09T06:40:39.477796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-t1: Test-time scaling for video generation","venue":null,"work_id":"f3e954bb-b996-45f0-b1ed-08f270999112","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:becdb6b96dc6ecf9cb58638253eb87f6bffc67150b2bfb5e235e40109c1e49a3","observation_id":"dc1b731f-471c-45cd-8ce4-7847e798e7fd","resolution":{"observed_at":"2026-05-26T05:26:45.882705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13918","last_updated":"2025-10-27T08:22:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-23T18:55:41Z","title":"Improving Video Generation with Human Feedback","version":2},"cited_work":{"arxiv_id":"2501.13918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.13918","snapshot_observed_at":"2026-07-04T13:19:51.115512Z","title":"Improving Video Generation with Human Feedback","venue":"cs.CV","work_id":"cfe4c01d-1cf7-4a00-ba86-06d583ca2cff","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2501.13918","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:c7c6e92eb981531ea470ac938ea0fb85bc8a53a4b54d05dcfaa107e963f40d15","observation_id":"66880af5-85db-4903-b231-7690dabf1a4f","resolution":{"observed_at":"2026-05-13T15:30:03.116566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25161","last_updated":"2025-09-29T17:57:14Z","snapshot_observed_at":"2026-07-06T22:31:10.099674Z","submitted_at":"2025-09-29T17:57:14Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","version":1},"cited_work":{"arxiv_id":"2509.25161","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.25161","snapshot_observed_at":"2026-07-08T10:54:49.169100Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","venue":"cs.CV","work_id":"e44fcf99-6683-4319-a07d-0db4c89ff93c","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2509.25161","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:258ca534b6799cf52500d4831319f5e4b57a57c435f436cbd11832090fb35d8c","observation_id":"f7354b2f-6c8c-453c-9065-8fa80bd029e2","resolution":{"observed_at":"2026-05-16T11:15:29.350628Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-07-06T20:34:06.899427Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:4b32d1c60189db15229c1c34b8b25234db672e2345d39eeb38095fd0037b5a08","observation_id":"11ce872f-0adc-4370-8d30-fe73dc63e331","resolution":{"observed_at":"2026-05-09T06:40:39.485808Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04678","last_updated":"2025-12-28T11:15:39Z","snapshot_observed_at":"2026-07-31T15:33:42.632137Z","submitted_at":"2025-12-04T11:12:13Z","title":"Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation","version":2},"cited_work":{"arxiv_id":"2512.04678","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04678","snapshot_observed_at":"2026-07-03T23:59:07.563782Z","title":"Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation","venue":"cs.CV","work_id":"74f20348-bdc0-4c09-a8d2-999657fb3fea","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2512.04678","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:773bac4114010855cf6899acafe9ebcc5c294b5e9fab78a0f5eaecbec38f172f","observation_id":"3c65e886-ca8e-42a6-8e6b-7a87b8ed35e0","resolution":{"observed_at":"2026-05-16T18:17:55.281442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T23:44:22.308181Z","title":"Hpsv3: Towards wide-spectrum human preference score","venue":null,"work_id":"ecd364a9-9512-4fa0-ba0d-557b6be69e84","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:83e4599e58d33bb54f6069ad7b6631b10674ee4b12f17f27266271228de29031","observation_id":"2dd9ee08-7cf5-4c0b-8a38-eb59955c3898","resolution":{"observed_at":"2026-05-26T05:26:45.861770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:43:39.521871Z","title":"s1: Simple test-time scaling","venue":null,"work_id":"a3e7b62a-fe52-4fbc-9830-9d6adb0d60c3","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:55f10e2c8c5fb23b6fb71098d12a9898eb0e5e79fea2fb5b091a451217aef45d","observation_id":"ade03136-71a8-4912-9f04-a07fb80f24da","resolution":{"observed_at":"2026-05-26T05:26:45.903273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.19252","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:09:29.395958Z","title":"Inference-time text-to-video alignment with diffusion latent beam search","venue":null,"work_id":"6c267bb1-9572-43f0-8ca8-35ff147d07c4","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:49b14d03acae02211e651cfed8535ffbc661faba036fe97aa965eb5b5377a990","observation_id":"0cf6b9c5-b46f-4135-bd5e-660e33622907","resolution":{"observed_at":"2026-05-09T06:40:39.103311Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-07-10T13:47:05.847810Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:1166300f9973f1f9c00c8e63f634cdc8df22ffb4a43c2ec98a5bc6387b0d599f","observation_id":"bc704297-30ac-4fb3-ad8b-50ac6474299e","resolution":{"observed_at":"2026-05-11T14:16:26.778393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hierarchical spatio-temporal decoupling for text-to-video generation","venue":null,"work_id":"ef8ed9e6-dbaa-45ee-ace9-b3c477f35e39","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:9776ae310586e5f531a027727401129bbec26fcecf8721a2f66a978cfe1ba319","observation_id":"107a2c90-1a1a-4181-8dcb-4d79596b5c4d","resolution":{"observed_at":"2026-05-26T05:26:45.910413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03164","last_updated":"2025-09-06T17:12:52Z","snapshot_observed_at":"2026-07-31T03:51:20.065129Z","submitted_at":"2025-05-24T19:13:29Z","title":"Test-Time Scaling of Diffusion Models via Noise Trajectory Search","version":2},"cited_work":{"arxiv_id":"2506.03164","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03164","snapshot_observed_at":"2026-07-03T20:18:57.227694Z","title":"Test-time scaling of diffusion models via noise trajectory search","venue":null,"work_id":"5fdaa472-1e01-4aa1-878b-27196cabe6b4","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2506.03164","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:01235e62edb4c1365a6686de2d50509fc4c9b667090c45aa17e58f4019eed5f7","observation_id":"39d4d151-904e-4457-97ad-d7ef043020d3","resolution":{"observed_at":"2026-05-09T06:40:39.091834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07737","last_updated":"2025-02-12T14:50:50Z","snapshot_observed_at":"2026-07-06T20:34:53.567141Z","submitted_at":"2025-02-11T17:57:53Z","title":"Next Block Prediction: Video Generation via Semi-Autoregressive Modeling","version":2},"cited_work":{"arxiv_id":"2502.07737","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07737","snapshot_observed_at":"2026-07-04T16:29:57.325994Z","title":"arXiv preprint arXiv:2502.07737 (2025) 30","venue":null,"work_id":"4696bd68-488d-48f9-ac0b-2fa808160ea2","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2502.07737","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:ea56bd0124558baba8edf62cc7880c6781f42cfadea6858d3a1f50245ed78e46","observation_id":"acbfbd2e-cde1-4a99-ba18-0f24fb52ba72","resolution":{"observed_at":"2026-05-09T06:40:39.120481Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":"2209.14792","doi":"10.48550/arxiv.2209.14792","metadata_source":"pith","pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","venue":"cs.CV","work_id":"52a801fc-a707-45a1-a8cd-0d6702f124ab","year":2022},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:abae83983cadf34f4cf071df39554cc0819fc412de2840305b435ba2ad4aa92d","observation_id":"d305d8ff-05a2-4c3e-bbac-521b50e38849","resolution":{"observed_at":"2026-05-11T01:13:03.403852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06848","last_updated":"2025-07-18T17:52:45Z","snapshot_observed_at":"2026-07-06T20:19:55.486841Z","submitted_at":"2025-01-12T15:34:24Z","title":"A General Framework for Inference-time Scaling and Steering of Diffusion Models","version":5},"cited_work":{"arxiv_id":"2501.06848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06848","snapshot_observed_at":"2026-07-04T13:09:50.123415Z","title":"A general framework for inference-time scaling and steering of diffusion models","venue":null,"work_id":"9ff11c8a-d659-4c6c-9262-d48f515ace17","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2501.06848","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:d52a1b2e4b394859cca01474cbdb1a45b300dfdca718a3b892e29163b02925a3","observation_id":"2cb6755b-5e14-44d8-aacd-392a6db0ebd6","resolution":{"observed_at":"2026-05-09T06:40:39.324015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling llm test-time compute optimally can be more effective than scaling parameters for reasoning","venue":null,"work_id":"f105068e-1f05-4abc-a876-56ca08649a7e","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:afa936ffc5d46dcd8a8482cf4f1badc29b97b55f6ed7109a9a75c5f28edabb27","observation_id":"70ecedaf-ca48-4702-9e34-27e454f1bfb5","resolution":{"observed_at":"2026-05-26T05:26:45.848682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"cited_work":{"arxiv_id":"2505.13211","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.13211","snapshot_observed_at":"2026-07-10T01:46:41.063877Z","title":"MAGI-1: Autoregressive Video Generation at Scale","venue":"cs.CV","work_id":"25e8bd3d-e51c-43ae-8126-4ea6ecdb3321","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2505.13211","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:afd2c52a777ed4d4248c2c3e7662a2d80d46309447ee39961373d0c6d8c545bc","observation_id":"5c3ef276-96e2-4404-99cc-22d40cdeb3c9","resolution":{"observed_at":"2026-05-13T20:31:15.871842Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:1606c0b572b937995467ea2b4216ecf5aa1af59acd90fed81429d5a28eeb1b91","observation_id":"35c4deb3-a411-475e-9f6d-1c20d6826baf","resolution":{"observed_at":"2026-05-09T06:40:39.207640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-07-06T16:05:35.645037Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":"2308.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-07-11T01:57:50.025885Z","title":"ModelScope Text-to-Video Technical Report","venue":"cs.CV","work_id":"1b1baf78-58ec-44d0-b700-84dff57b2f1f","year":2023},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:01fc6175161083502067791207ba4ca9f1584aae3aa773dfea4e74b9207a1d73","observation_id":"dd8db599-1797-480b-9f2c-971706144eba","resolution":{"observed_at":"2026-05-12T19:47:29.701736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-11T01:17:42.597062Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:a9b242ef82defcfad162dabde9fbd1a653e59207251b0c7626d89d4db24b71d9","observation_id":"c829bd25-08ae-432f-8423-98522d6f6920","resolution":{"observed_at":"2026-05-09T06:40:39.142753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Art-v: Auto-regressive text-to-video generation with diffusion models","venue":null,"work_id":"06b577a8-a264-4484-a95f-fda2276946f4","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:ca891d012016bff8bc12fdb893e1d359541fc6beafa1d96edc36f6759fc0695e","observation_id":"9f0ec689-0be9-4d5c-9a38-6012b7a46624","resolution":{"observed_at":"2026-05-26T05:26:45.857511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagerysearch: Adaptive test-time search for video generation beyond semantic dependency constraints","venue":null,"work_id":"78a0bb27-ef3e-4295-9b0e-3a89352f75ac","year":2026},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:d316002ded5db39c3ebe125ecf7fad7438ec9af1ab49766e61b11334f4166d73","observation_id":"7bf32e41-c4eb-4ce7-b45f-dfac6686e222","resolution":{"observed_at":"2026-05-26T05:26:45.808027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:34:01.618368Z","title":"Imagereward: Learning and evaluating human preferences for text-to-image generation","venue":null,"work_id":"5c5c3eee-061e-4af7-b5f2-2e03489973ae","year":2023},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:f46ba68d433e00daca122c4cccc88a30017a23d4d5432e8e800e1615ca381ef9","observation_id":"c8397314-d288-40d6-bf01-a5fb63cfef56","resolution":{"observed_at":"2026-05-26T05:26:45.816117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visionreward: Fine-grained multi-dimensional human preference learning for image and video generation","venue":null,"work_id":"41c6be61-6834-47b8-bd60-d35042dd6f1f","year":2026},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:f044efd855513986f194b389654b845f443db2753044026ed7c01cc279da6dc3","observation_id":"6bf7f549-062f-4b36-bfcd-988b7d0e379f","resolution":{"observed_at":"2026-05-26T05:26:45.812066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-07-06T11:02:11.424356Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":"2104.10157","doi":"10.48550/arxiv.2104.10157","metadata_source":"pith","pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","venue":"cs.CV","work_id":"703c74c3-fa5e-455c-8c00-697c83511fcf","year":2021},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:7b76c5ef81631630f0407535fb9b8490a53a2dbab58010a53c2ec5e1107ab9bf","observation_id":"7ad2f95b-98e4-4565-82e2-eed46028c0c8","resolution":{"observed_at":"2026-05-13T17:24:33.857072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22622","last_updated":"2025-10-13T22:41:26Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-26T17:48:24Z","title":"LongLive: Real-time Interactive Long Video Generation","version":2},"cited_work":{"arxiv_id":"2509.22622","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22622","snapshot_observed_at":"2026-07-09T07:56:04.670863Z","title":"LongLive: Real-time Interactive Long Video Generation","venue":"cs.CV","work_id":"29ec6550-6ac1-4cc6-8aae-b4206f1d5b38","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2509.22622","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:a6f3e577048a1b2ca324381fff056d5c053c15d6ff307fe7d5370de84e3536cb","observation_id":"06318ebc-7ac9-44b7-a820-312cb886c746","resolution":{"observed_at":"2026-05-15T03:52:59.837830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-07-11T00:07:42.878250Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:6e6f89cbfe104d57870a931e5e35773dd991ba0931a0562e67eb2b725fda13cc","observation_id":"0c5b2909-fc77-4327-a299-c52a0c577301","resolution":{"observed_at":"2026-05-10T18:26:22.534732Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From slow bidirectional to fast autoregressive video diffusion models","venue":null,"work_id":"670d460b-3b8f-4a28-9014-064842e32bbc","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:bfbf083b7b2a9dcb68663e96c13f9f5e8a90e29049a5c6e83e853cb05444115e","observation_id":"99ae0156-79f0-4524-a1f9-2415b49af3a4","resolution":{"observed_at":"2026-05-26T05:26:45.853255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14168","last_updated":"2025-06-18T09:44:09Z","snapshot_observed_at":"2026-07-06T21:43:22.202859Z","submitted_at":"2025-06-17T04:08:18Z","title":"VideoMAR: Autoregressive Video Generatio with Continuous Tokens","version":2},"cited_work":{"arxiv_id":"2506.14168","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14168","snapshot_observed_at":"2026-07-02T02:36:27.674391Z","title":"Videomar: Autoregressive video generatio with continuous tokens","venue":null,"work_id":"1b66fda8-50f3-4849-a2da-fe8282d5b0ef","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2506.14168","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:7044abdc9700f71dc40b1c79b6af57801bcf0609c1f3b7df2f06974ed79403ca","observation_id":"43281fb9-6d34-4319-a0fe-f0ba1e9f1583","resolution":{"observed_at":"2026-05-09T06:40:39.187032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lumos-1: On autoregressive video generation with discrete diffusion from a unified model perspective","venue":null,"work_id":"b4586eab-2879-4ea9-bcb4-a166e49554f6","year":null},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:ef30f146479d0fe5de84a3e4f9820229b853b9012cd78b771699f72eae7ae74f","observation_id":"eac90085-e369-41b6-a08b-70ad1001f64d","resolution":{"observed_at":"2026-05-26T05:26:45.826129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":"2501.13106","doi":"10.48550/arxiv.2501.13106","metadata_source":"pith","pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","venue":"cs.CV","work_id":"38f52461-37fd-4266-bc46-9dea31be2824","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:f78450553e0e7ea70f0c2d7c7e8d9f74851080028c2b8ffd80fda897ca1e214d","observation_id":"2091afb9-3c76-45d6-89e7-6f5d9847b3ae","resolution":{"observed_at":"2026-05-11T01:20:00.737157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Show-1: Marrying pixel and latent diffusion models for text-to-video generation.International Journal of Computer Vision, 133(4):1879–1893","venue":null,"work_id":"ac989087-7e78-437f-96f4-d1c18b88f7f2","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:f15e7a04e9631c7397d4de354d90b85aa3f78562ffd0cf35cff28dc2d5ef4d9e","observation_id":"5c7dba27-deb6-45e2-8e89-72a35e1fda04","resolution":{"observed_at":"2026-05-26T05:26:45.844510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24235","last_updated":"2025-05-04T15:48:08Z","snapshot_observed_at":"2026-07-06T21:01:40.296779Z","submitted_at":"2025-03-31T15:46:15Z","title":"A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?","version":3},"cited_work":{"arxiv_id":"2503.24235","doi":"10.48550/arxiv.2503.24235","metadata_source":"pith","pith_arxiv_id":"2503.24235","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?","venue":"cs.CL","work_id":"d4eaadf8-a3c6-4eee-98fb-1b337dd42e2d","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2503.24235","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:f79287e57ed996c93f42843b1eca285b2031213cd0f3724b8a67ebfc7b2c0a52","observation_id":"cf2b85a0-724e-4107-90b1-9350996c6eb3","resolution":{"observed_at":"2026-05-13T18:07:52.994249Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning multi-dimensional human preference for text-to-image generation","venue":null,"work_id":"67b28cef-ffb3-4afe-a1ce-9ae56fe9eda4","year":2024},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:e81d56c0f2cbb5f689dd26c9d0dcc2f568fe963d4d98929a049e50cb5742a0b0","observation_id":"a71c6540-4dd1-4ff4-8c21-eb12c53c9052","resolution":{"observed_at":"2026-05-26T05:26:45.839643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.14526","last_updated":"2026-06-28T22:57:12Z","snapshot_observed_at":"2026-08-02T01:05:20.949344Z","submitted_at":"2026-03-15T18:07:29Z","title":"LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion","version":2},"cited_work":{"arxiv_id":"2603.14526","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.14526","snapshot_observed_at":"2026-06-30T02:17:18.172894Z","title":"Latsearch: Latent reward-guided search for faster inference-time scaling in video diffusion","venue":null,"work_id":"6eff1c2b-cf66-43c1-95c9-53fdbfaef133","year":2026},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2603.14526","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:ca86f261fd29a1d5a3114bd45675a0121044dff2ac274c573b4d071d11100231","observation_id":"92812db4-1efa-4262-92c6-c7c569e5754f","resolution":{"observed_at":"2026-06-30T02:17:18.172894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":"2211.11018","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-07-11T01:57:50.042360Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","venue":"cs.CV","work_id":"aad71b40-2721-438d-8e8c-97f84063ed39","year":2022},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:c286a53632782d21d6748d14a0f1c5b8e0f1764dec3c667122785ea1dc36dfa1","observation_id":"e2ca6090-c584-4851-a333-cadcca0038f2","resolution":{"observed_at":"2026-05-15T18:47:57.649874Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Golden noise for diffusion models: A learning framework","venue":null,"work_id":"14d984ae-3705-4e57-b0dd-185194844705","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:3ad5c5608e9091e069100a6cf59e63b7e0bbb324e524a0cf9bd71b935631277b","observation_id":"a8101fbc-fa68-41d4-afa1-88924aeb5ad3","resolution":{"observed_at":"2026-05-26T05:26:45.830495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From reflection to perfection: Scaling inference-time optimization for text-to-image diffusion models via reflection tuning","venue":null,"work_id":"98b594a4-5148-4679-9737-1651b84e3626","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:aea0d21eb448131d7333107a6d4bf4e090969b46f6980ccaa66820f89ad69a7b","observation_id":"7998b363-a012-4fea-9d78-3db92aa0dc4a","resolution":{"observed_at":"2026-05-26T05:26:45.834970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":35,"verified_fuzzy":20},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"thesis":"As of 2 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 3 inbound Pith citation observations for arXiv:2605.04461."}