{"as_of":"2026-08-05T20:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aa250fde9a6a6b69c9c85215c27f6f42de81d3188df2381b7d59874386a290b8","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T05:38:21.587653Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T10:48:06.175705Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T07:56:04.682218Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"cited_work":{"arxiv_id":"2605.12496","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12496","snapshot_observed_at":"2026-07-09T07:56:04.682218Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","venue":"cs.CV","work_id":"a9f78b13-4fb5-478c-af7c-75ceae575aff","year":2026},"citing_paper":{"arxiv_id":"2606.20799","last_updated":"2026-07-15T15:45:17Z","snapshot_observed_at":"2026-08-02T10:48:03.144592Z","submitted_at":"2026-06-18T18:00:03Z","title":"GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T18:15:51.862192Z"},"links":{"cited_paper":"/paper/2605.12496","citing_paper":"/paper/2606.20799"},"observation_digest":"sha256:3937e8c16054e528d1164d7c8f6c76bdbc5e71c3605a3e8f64a6212c4cdd27aa","observation_id":"111337ef-8671-4244-b2db-c1d125d07cd6","resolution":{"observed_at":"2026-07-04T03:19:30.216440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12496","snapshot_observed_at":"2026-08-02T10:48:06.175705Z","title":"Causalcine: Real-time autoregressive generation for multi-shot video narratives.arXiv preprint arXiv:2605.12496, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.20799","last_updated":"2026-07-15T15:45:17Z","snapshot_observed_at":"2026-08-02T10:48:03.144592Z","submitted_at":"2026-06-18T18:00:03Z","title":"GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:06.175705Z"},"links":{"cited_paper":"/paper/2605.12496","citing_paper":"/paper/2606.20799"},"observation_digest":"sha256:2ac07ea276049fa6e393af8b8c4be50a3f28ddf07f0e369dcdef33f30af71f42","observation_id":"42d6fbe0-044b-4b6a-8632-21e067b2b31f","resolution":{"observed_at":"2026-08-02T10:48:06.175705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"cited_work":{"arxiv_id":"2605.12496","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12496","snapshot_observed_at":"2026-07-09T07:56:04.682218Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","venue":"cs.CV","work_id":"a9f78b13-4fb5-478c-af7c-75ceae575aff","year":2026},"citing_paper":{"arxiv_id":"2607.07534","last_updated":"2026-07-08T15:33:25Z","snapshot_observed_at":"2026-07-11T23:20:11.647150Z","submitted_at":"2026-07-08T15:33:25Z","title":"Infinite Worlds with Versatile Interactions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-09T07:51:36.802801Z"},"links":{"cited_paper":"/paper/2605.12496","citing_paper":"/paper/2607.07534"},"observation_digest":"sha256:5301bf26b80a391cfdb27ed3ba2e5bfefe23a326eacb66465dceb2e279df03e5","observation_id":"4e183a8a-376d-4eff-a0b4-2c9b670f37a0","resolution":{"observed_at":"2026-07-09T07:56:04.683623Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.12496/citation-record","integrity":"/paper/2605.12496/integrity","json":"/paper/2605.12496/citation-record.json","paper":"/paper/2605.12496"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.04682","last_updated":"2024-11-08T05:45:45Z","snapshot_observed_at":"2026-08-03T04:59:27.434851Z","submitted_at":"2024-05-07T21:52:39Z","title":"TALC: Time-Aligned Captions for Multi-Scene Text-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2405.04682","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04682","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Talc: Time-aligned captions for multi-scene text-to-video generation","venue":null,"work_id":"bb200c5c-fb1b-4687-8d72-1f391c46e4db","year":2024},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2405.04682","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:05f63dcf83d5a7c40c83075767b87db08a3ba053e85d5ecccec3da960615ed3a","observation_id":"0c35e817-0dce-493e-a1cf-ddfd7bc8507c","resolution":{"observed_at":"2026-05-13T05:42:21.395852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1080/10494820.2024.2414152","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Genie: Generative interactive environments","venue":"Interactive Learning Environments","work_id":"6c633c28-756b-4f8a-b31e-d5ac37197f04","year":2024},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:0286077e6e23b146190d8f88da5cf1abc03e92a0f79e68943060072da4c77557","observation_id":"1ef21037-572f-4d11-a238-669177347e9f","resolution":{"observed_at":"2026-05-13T10:17:39.498270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.21058","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:59:42.121465Z","title":"Mixture of contexts for long video generation.arXiv preprint arXiv:2508.21058","venue":null,"work_id":"b800ec2a-ab41-48e3-a98d-a26b4942bb2a","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:79625f9ddc8df885f7e6ef11e330c8639e3962f786824159cdcd20c4e2f5488d","observation_id":"3ab921f3-10c1-4dab-a738-1d67a6a46167","resolution":{"observed_at":"2026-05-13T05:42:21.402476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mode seeking meets mean seeking for fast long video generation","venue":null,"work_id":"825259b1-902b-4ab6-b6a2-f35d47853108","year":2026},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:c880bd474181f5633426ea78245a493d4de4c7dd1fbc019f6975af8a0857ea77","observation_id":"44aa5837-4210-40eb-82a5-a0d6fbadd50f","resolution":{"observed_at":"2026-05-13T10:17:39.494356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:27:52.995100Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":"def40bfd-07b5-4f25-94fd-883b4ac6838d","year":2021},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:c4dd9d2fc0ef1e19f7b552a1e4db46b89dd8b666e8dd0d79606e13ac0e85d63a","observation_id":"94312f9f-bded-4df5-a309-afcf3ab43cff","resolution":{"observed_at":"2026-05-13T10:17:39.489872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:bb7929ee8b4e9b90048d5d98079adacfd3af5ff0d3de73ef3d664c48b634ed63","observation_id":"24310c87-74ff-4bb8-98ed-2b7f49ff6441","resolution":{"observed_at":"2026-05-13T05:42:21.329846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.02283","last_updated":"2025-10-02T17:55:42Z","snapshot_observed_at":"2026-08-02T07:40:05.046770Z","submitted_at":"2025-10-02T17:55:42Z","title":"Self-Forcing++: Towards Minute-Scale High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":"2510.02283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.02283","snapshot_observed_at":"2026-07-08T13:14:53.231711Z","title":"Self-Forcing++: Towards Minute-Scale High-Quality Video Generation","venue":"cs.CV","work_id":"3b83d5f5-6929-46ae-9de2-7c32af3c7346","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2510.02283","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:b783fc757e248af7ac41e865288fb02f111b9d21927ac554d6446990b3232adb","observation_id":"6f27cc11-f075-474f-9e93-5b6b4c24d267","resolution":{"observed_at":"2026-05-15T22:39:54.578381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.16914","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T10:27:02.503868Z","title":"Lol: Longer than longer, scaling video generation to hour.arXiv preprint arXiv:2601.16914","venue":null,"work_id":"a78a2848-7aa5-4af3-aa35-9ace2d8d78af","year":2026},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:b43b29796319bcb75ec880c6232e1c4d099a79e3ff136cd9021a33e132c6b80a","observation_id":"0aa265d5-6e3c-4070-9d09-aaf7278627a2","resolution":{"observed_at":"2026-05-13T05:42:21.346373Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:05:48.537771Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"8331d9c0-b11b-4b03-89a7-e461fa541183","year":2024},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:1fbbb894c541f50b1e19045152e7de6e03a4e8fbd79922d4ede19586a3039a24","observation_id":"a3b44424-6880-429b-82cc-b65f335bb156","resolution":{"observed_at":"2026-05-13T10:17:39.468825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"cited_work":{"arxiv_id":"2503.19325","doi":"10.48550/arxiv.2503.19325","metadata_source":"pith","pith_arxiv_id":"2503.19325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","venue":"cs.CV","work_id":"9700bbdc-df42-461a-81fa-b29ffe683326","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2503.19325","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:8beaabca4cfc6d312bbe1996d22612e184d92ac4085d4ddc1ffcdb9576f58b4b","observation_id":"4ec976b2-02fb-4b3e-9134-a4d9cdb2f22b","resolution":{"observed_at":"2026-05-16T23:05:17.562899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15702","last_updated":"2026-07-01T03:39:09Z","snapshot_observed_at":"2026-08-03T15:46:03.731716Z","submitted_at":"2025-12-17T18:53:29Z","title":"End-to-End Training for Autoregressive Video Diffusion via Self-Resampling","version":2},"cited_work":{"arxiv_id":"2512.15702","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15702","snapshot_observed_at":"2026-07-10T01:46:41.136211Z","title":"End-to-end training for autoregressive video diffusion via self-resampling.arXiv preprint arXiv:2512.15702","venue":"cs.CV","work_id":"2c6453d6-0b89-4a86-b325-43ecf40d49aa","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2512.15702","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:b24de4e05c36e71f68d872f9828cdb5911140ae1128a09d355fe8fb7b68bf73a","observation_id":"522f12fe-7851-471a-b310-e27147718568","resolution":{"observed_at":"2026-07-02T02:17:24.702694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Long context tuning for video generation","venue":null,"work_id":"852ceb7a-1cdb-4a43-8b80-945c08b1c5a0","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:a8721efbd4dd21f35b937d933eb1dacabd34f5ba3c8e132fd2a3a1520cb84105","observation_id":"c1cfc910-3ad7-4e59-8eea-3577117e42d0","resolution":{"observed_at":"2026-05-13T10:17:39.464802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-07-06T22:40:51.136169Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"cited_work":{"arxiv_id":"2601.03233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.03233","snapshot_observed_at":"2026-07-10T01:46:41.047035Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","venue":"cs.CV","work_id":"1334671f-ee98-4c53-a1d4-0805281f8d2b","year":2026},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2601.03233","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:6a909f127385dc883a9df01e8e03d10bd65a65c0a760e06b4cc59c85df5623d0","observation_id":"635f96c5-2e89-49fd-9c28-2be732ea899c","resolution":{"observed_at":"2026-05-13T05:42:21.248644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streamingt2v: Consistent, dynamic, and extendable long video generation from text","venue":null,"work_id":"48389f44-098c-4edc-8301-73cde29d5982","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:344d67fb97965dedf01abd8942fde1156fa9aca44799bfea67a19077d2952b04","observation_id":"c6da1c89-8034-4884-b6eb-72d185d8c0d7","resolution":{"observed_at":"2026-05-13T10:17:39.473463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23277","last_updated":"2024-10-31T18:03:51Z","snapshot_observed_at":"2026-07-06T19:42:25.742756Z","submitted_at":"2024-10-30T17:55:52Z","title":"SlowFast-VGen: Slow-Fast Learning for Action-Driven Long Video Generation","version":2},"cited_work":{"arxiv_id":"2410.23277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.23277","snapshot_observed_at":"2026-07-04T08:59:42.106584Z","title":"Slowfast-vgen: Slow-fast learning for action-driven long video generation","venue":null,"work_id":"7fa572e7-d965-4713-bb4b-2f3860a012bc","year":2024},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2410.23277","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:5a8f7691145b242d407ebe3d0e01f0344f10052694e8bb0f7823bd43c21d4c9c","observation_id":"09f61fff-18f6-4533-bb12-7f45fe5996da","resolution":{"observed_at":"2026-05-13T05:42:21.198036Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04925","last_updated":"2024-11-11T13:24:18Z","snapshot_observed_at":"2026-07-06T19:46:50.403301Z","submitted_at":"2024-11-07T18:00:33Z","title":"StoryAgent: Customized Storytelling Video Generation via Multi-Agent Collaboration","version":2},"cited_work":{"arxiv_id":"2411.04925","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04925","snapshot_observed_at":"2026-07-09T07:56:04.704136Z","title":"Xun Huang, Zhengqi Li, Guande He, Mingyuan Zhou, and Eli Shechtman","venue":"cs.CV","work_id":"d989b19d-4134-4b76-a09f-cc1e4b0e579e","year":2024},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2411.04925","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:4a456ec57ced37306be4d24e5ef53ff7f7d9e1050b6c8801dd1f8809bc3a7fe1","observation_id":"fffd6d12-190e-4b8f-a69f-78309e10612c","resolution":{"observed_at":"2026-05-13T05:42:21.358995Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":"2506.08009","doi":"10.48550/arxiv.2506.08009","metadata_source":"pith","pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","venue":"cs.CV","work_id":"53e58ef9-7932-4b83-b757-34ac14db3e0f","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:baaf952471be6de6d91b82d489e6c278ba9e5b6a7611300a7bf49007bd4e4efa","observation_id":"122e6f7d-a44a-48e5-bd87-0be38d4dffab","resolution":{"observed_at":"2026-05-13T05:42:21.339731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T20:11:59.604751Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":"2512.04677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-04T20:00:07.549832Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","venue":"cs.CV","work_id":"6162e20b-7f90-4812-8c9b-a2423c67be80","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:106d8d0beb6d4d1bbf5084802f128ec85811a0f45959f6386aa10702547fe3a6","observation_id":"c330c1f8-ecf7-4b1d-a4eb-ebdf59e968f9","resolution":{"observed_at":"2026-05-13T05:42:21.265641Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:07:50.611559Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"2383dbc4-0e5d-40ed-a102-5aac37332eae","year":2024},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:9eda83fd7b30c9704c9258bf4412e2d7293a384c3455d270be9db6f3df3f5225","observation_id":"e5ba7cb2-9edd-4ea9-acde-1a94016bf316","resolution":{"observed_at":"2026-05-13T10:17:39.425386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":"2309.14509","doi":"10.48550/arxiv.2309.14509","metadata_source":"pith","pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","venue":"cs.LG","work_id":"bb119d0b-c7f0-412a-a426-f74bd6949a51","year":2023},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:d084e9cdfc3bde0323beb4083f1d376014b9c03fc0cc030fc0ce9f980e5167a9","observation_id":"127d563f-8c06-47b3-b796-693efc9b7fd0","resolution":{"observed_at":"2026-05-13T05:42:21.306589Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.14699","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T22:39:00.980432Z","title":"Memflow: Flowing adaptive memory for consistent and efficient long video narratives","venue":null,"work_id":"e31a9aca-409e-4ac5-8e91-3bb188e52cd0","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:8f88832bbf33929e1ea97b50d1b74ce4cdb18a8da1ad4e544788f0103d8d4986","observation_id":"e4c79e2a-5a52-4df7-a5f8-27d08daac28a","resolution":{"observed_at":"2026-05-13T05:42:21.335024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.18692","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:07:28.128948Z","title":"Jiaxiu Jiang, Wenbo Li, Jingjing Ren, Yuping Qiu, Yong Guo, Xiaogang Xu, Han Wu, and Wangmeng Zuo","venue":null,"work_id":"ae9e13c2-1a31-4b28-87a5-dd006e6bd2ed","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:5f97668440dbc2a2879c5d7f6bea2480ab61ae2ce7fb3244ee60f93c35ea3b9a","observation_id":"170c1d31-6d5e-4740-91b3-b90ea30369a5","resolution":{"observed_at":"2026-05-13T05:42:21.237718Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.00664","last_updated":"2026-05-30T08:41:30Z","snapshot_observed_at":"2026-08-05T17:56:34.094236Z","submitted_at":"2026-01-02T11:58:48Z","title":"Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation","version":2},"cited_work":{"arxiv_id":"2601.00664","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.00664","snapshot_observed_at":"2026-07-04T16:49:57.689282Z","title":"Weijie Kong, Qi Tian, Zijian Zhang, Rox Min, Zuozhuo Dai, Jin Zhou, Jiangfeng Xiong, Xin Li, Bo Wu, Jianwei Zhang, et al","venue":"cs.LG","work_id":"5f7fa4c2-df1a-4280-b0ed-602800cfab52","year":2026},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2601.00664","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:68be46728d993c5819550a5087eae2ec591b57343ee6ac374dd91c5964b30736","observation_id":"23450ec6-3ecf-4da3-ab95-c1ff162df95f","resolution":{"observed_at":"2026-06-02T02:03:37.193094Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vmem: Consistent interactive video scene generation with surfel-indexed view memory","venue":null,"work_id":"7059aa84-884a-4988-a992-26544955fcb3","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:4137d4ab923178363e6ae235cdf983b994d0403412fb8fb5fd80598d3b2fcfd1","observation_id":"0d12c6b0-e022-4e46-b8ea-8f69c5706e33","resolution":{"observed_at":"2026-05-13T10:17:39.432973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.08316","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:07:45.233309Z","title":"Diffusion adversarial post-training for one-step video generation","venue":null,"work_id":"62c7164b-8dc8-4fc0-898d-e70790cfb89c","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:6cdcefe717021a89ecab977a254677253fb573060ade077f82d2d89924914be7","observation_id":"f0713075-9a29-4214-8170-6e2f62a20826","resolution":{"observed_at":"2026-05-13T05:42:21.379262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25161","last_updated":"2025-09-29T17:57:14Z","snapshot_observed_at":"2026-07-06T22:31:10.099674Z","submitted_at":"2025-09-29T17:57:14Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","version":1},"cited_work":{"arxiv_id":"2509.25161","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.25161","snapshot_observed_at":"2026-07-08T10:54:49.169100Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","venue":"cs.CV","work_id":"e44fcf99-6683-4319-a07d-0db4c89ff93c","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2509.25161","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:a2326b6d228651b51473effa60f48954e2be9affa7f857af94724156656e1627","observation_id":"4d3771fb-9caa-400f-b98f-16d4a87b542b","resolution":{"observed_at":"2026-05-16T11:15:29.350628Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.05449","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:47:41.355845Z","title":"Realwonder: Real-time physical action-conditioned video generation.arXiv preprint arXiv:2603.05449","venue":null,"work_id":"817e39ca-1acb-4170-b2c5-6d47674dfa6c","year":2026},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:ac48778fc1a36f65157d62aa2b1d5cd6032517f04d1b94d7756c214f52ab7756","observation_id":"75a72708-645f-402d-b130-101511345d7e","resolution":{"observed_at":"2026-05-13T05:42:21.365999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videostudio: Generating consistent-content and multi-scene videos","venue":null,"work_id":"b2810075-c1a6-4992-a319-4ac585bc33ac","year":2024},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:6bec7b04587efbb704516289a5a55d88d97f916f7b39dde1dfdacb8a805b6972","observation_id":"1989b758-63bf-4c4e-ac61-19e1326b249c","resolution":{"observed_at":"2026-05-13T10:17:39.420989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":"2502.13189","doi":"10.48550/arxiv.2502.13189","metadata_source":"pith","pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","venue":"cs.LG","work_id":"de16df2d-eb7f-429d-82c7-8e4bf5183193","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:1a7fc7bdf452a185dc57ff6ddd8f2b1d79012c27b660b73b52994b3fe98bb765","observation_id":"528c7a79-a5f3-4fd2-a759-949c7e27a743","resolution":{"observed_at":"2026-05-16T06:15:46.352230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.25746","doi":"10.48550/arxiv.2603.25746","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shotstream: Streaming multi-shot video generation for interactive storytelling","venue":"arXiv (Cornell University)","work_id":"eabcc1e0-ee6b-47bf-90fc-2e4fa7704243","year":2026},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:6aa6dd2903e78aaa3f747466b459ace848ffba64e79744344d727f148dfb887e","observation_id":"3ceda0ea-06e4-4b2f-86da-c66517cbea29","resolution":{"observed_at":"2026-05-13T05:42:21.260424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T19:18:55.664338+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T19:18:55.664338+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.20822","doi":"10.48550/arxiv.2510.20822","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Team Seawead, Ceyuan Yang, Zhijie Lin, Yang Zhao, Shanchuan Lin, Zhibei Ma, Haoyuan Guo, Hao Chen, Lu Qi, Sen Wang, et al","venue":"ArXiv.org","work_id":"86271608-cd60-4a6d-8e48-468ae623ded6","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:766f46762592eb374af32c3ebf0c434ea76eb6a3e4cbc4d53a725b1f92728aea","observation_id":"c567edfe-d392-473d-b59c-85209a6bfb1f","resolution":{"observed_at":"2026-05-13T05:42:21.231424Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:51f59de75caa67b91af3cd67ebe100eb210a4ebe0adda95ec1c41d41c011311f","observation_id":"5dd74a4d-204d-41e9-9c9e-533f42c083b6","resolution":{"observed_at":"2026-05-13T05:42:21.242805Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:27:53.186413Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"0c67bec8-6388-449f-9600-64c8ea9bc79f","year":2023},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:dc08e6957d6611d34a7c9cc1fc203181d7b87c59a86193f3c033faffc7a416c9","observation_id":"670045f9-2696-4955-92c2-1b40b0ef4cbf","resolution":{"observed_at":"2026-05-13T10:17:39.435215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maskˆ 2dit: Dual mask-based diffusion transformer for multi-scene long video generation","venue":null,"work_id":"3bc8f470-345d-4ef7-a41e-b4f818672127","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:2c62bca5ad1cab4c81f1fe00a4460d0e73bdb69267d8fb4016ecf96ca345fe45","observation_id":"54a2c2ad-bb5b-438f-8195-2956a8a77333","resolution":{"observed_at":"2026-05-13T10:17:39.442759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"3efdb13e-144e-4937-b851-1b75ef2893f4","year":2021},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:ccf78a1b037814f852aeb80668dcd8cdae3e7a9acdb8518c1991db7b048334e3","observation_id":"4ae68679-874d-4680-a8ab-9abfc8f3647a","resolution":{"observed_at":"2026-05-13T10:17:39.412016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in neural information processing systems, 35:25278–25294","venue":null,"work_id":"25581cba-8e27-40a4-86eb-c560ee7d7bbd","year":2022},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:bf6a86d0490683502d23d7a9da7da3169e52d6429c25773e0821e30fdf58cb78","observation_id":"878873bc-a1c0-400e-8e69-22f8947a6f51","resolution":{"observed_at":"2026-05-13T10:17:39.485850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":"2604.14148","doi":"10.48550/arxiv.2604.14148","metadata_source":"pith","pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","venue":"cs.CV","work_id":"ceac4ea4-1ca6-4fe9-8324-880c07aec27d","year":2026},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:7cd9da247727b57129b7f9b346d65f674323304efc482ca4c84fa7d85ad68f41","observation_id":"20b197fc-1265-4047-bb84-e63fbf54542c","resolution":{"observed_at":"2026-05-13T05:42:21.318565Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.01266","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.078141Z","title":"Motionstream: Real-time video gen- eration with interactive motion controls.arXiv preprint arXiv:2511.01266","venue":null,"work_id":"cf21957e-b90d-4728-83de-9326cf9751c3","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:7eae15ee487dd951dacaa8a1bfb58c104d12b293a15365dad72e8983ad253af1","observation_id":"ebd86ca9-3995-4cad-a897-9a2cf8572d6d","resolution":{"observed_at":"2026-05-13T05:42:21.282997Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transnet v2: An effective deep network architecture for fast shot transition detection","venue":null,"work_id":"6e7a3a86-f899-48e7-9dd3-a9030f812405","year":2024},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:5594f66bd38373d0a592330df7ee0b92f7a74bad68a94f4b4192f6f4aad9be18","observation_id":"142d7695-5852-433b-a517-3a3a55fc4f00","resolution":{"observed_at":"2026-05-13T10:17:39.481630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:e7ab36b5d0fbeb46e3380db2e1c6d6738b208e1ff89fdc83ccef0bcbacef7ef2","observation_id":"bc6d22ac-9103-4617-a747-ffb9ab1daf1f","resolution":{"observed_at":"2026-05-13T05:42:21.384833Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:1ed82678338bdb60f285f18305900dc468c46053b399ac0d559fadcb0d2fb831","observation_id":"08c79ffc-38d5-4a31-8489-e15b3c4f690a","resolution":{"observed_at":"2026-05-13T05:42:21.184222Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echoshot: Multi-shot portrait video generation","venue":null,"work_id":"2e840d21-87e7-4fe0-8df2-6187db097be1","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:19cbedd0b4047eb7169ee5251a4fd9072abdbd085d8c1dcb23a91f2d09edc068","observation_id":"1222f810-177b-49cc-818c-29860c9a5101","resolution":{"observed_at":"2026-05-13T10:17:39.416009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.03041","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:36.958778Z","title":"Xierui Wang, Siming Fu, Qihan Huang, Wanggui He, and Hao Jiang","venue":null,"work_id":"930f3aa4-2e69-4e67-a023-dc0c6437a6d8","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:e47e79145e076eef172c8f195f63935d64b5be24c7e122020c9ac37fe9e430c6","observation_id":"9126a276-bdc3-455f-8f63-2b2058f312a3","resolution":{"observed_at":"2026-05-13T05:42:21.372232Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Autostory: Generating diverse storytelling images with minimal human efforts.International Journal of Computer Vision, 133(6):3083–3104","venue":null,"work_id":"23615045-0ed6-42ef-b00b-62078d9bb0c4","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:69950a03f94e37beca67cce8df9cc3a31bed01fa2f3468282e3362c9a6b7c3f1","observation_id":"479ea9d0-0add-4ce1-b044-588cf404b3e5","resolution":{"observed_at":"2026-05-13T10:17:39.438915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:567a9041e982698e1e7a2b7687c648c1810edf08b9de2cd24b1e4e37cf376495","observation_id":"12b3b07f-e37d-4890-a123-a673735728e3","resolution":{"observed_at":"2026-05-17T00:36:53.574468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:8dc90f433636fe94de79348669094f76deecd29d1e815daee33d8c19f91dd6c1","observation_id":"0994a83c-63ec-4923-a22f-f68a8437b17c","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":"2309.17453","doi":"10.48550/arxiv.2309.17453","metadata_source":"pith","pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Streaming Language Models with Attention Sinks","venue":"cs.CL","work_id":"a8d25452-c237-48c9-88a4-682717c3979a","year":2023},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:3c74ef3aa77196668f66792d99dc53b1b777887f25ab3e93fdaec73498757bb2","observation_id":"e25b583d-79a4-44d0-a443-88effbc48ec1","resolution":{"observed_at":"2026-05-13T05:42:21.324493Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Captain cinema: Towards short movie generation","venue":null,"work_id":"de123753-d3d5-4e26-b456-5394442429e9","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:b3f8f9520f1c37f72f34e81eca3ddba1d2b6596b020daef80c8157bab592a370","observation_id":"b08ad45e-8425-4bda-aa56-d2aa86721a15","resolution":{"observed_at":"2026-05-13T10:17:39.477527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.12369","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:19:13.356094Z","title":"arXiv preprint arXiv:2504.12369 , year=","venue":null,"work_id":"7159175f-77a7-43d9-8dc3-54bda91b0e0b","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:06dd3cba29de8f92e0c2f0d947d4575b70f7a3dbe5641ec28a188a3adb0ac3c4","observation_id":"ce946097-17ca-4d3b-a895-494603be8767","resolution":{"observed_at":"2026-05-13T05:42:21.177208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11788","last_updated":"2024-08-21T17:21:13Z","snapshot_observed_at":"2026-08-02T10:20:43.147567Z","submitted_at":"2024-08-21T17:21:13Z","title":"DreamFactory: Pioneering Multi-Scene Long Video Generation with a Multi-Agent Framework","version":1},"cited_work":{"arxiv_id":"2408.11788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11788","snapshot_observed_at":"2026-07-04T03:19:30.292342Z","title":"Dreamfactory: Pioneering multi-scene long video generation with a multi-agent framework","venue":null,"work_id":"71310d3e-801f-4b4b-93b6-b75876b6dc48","year":2024},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2408.11788","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:891154f99f7f3ec9ac116d0331c7c3c856cd263490303302341e50d733526b20","observation_id":"b6944664-b599-44d7-87f2-ca3a93ab13bf","resolution":{"observed_at":"2026-05-13T05:42:21.171034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22622","last_updated":"2025-10-13T22:41:26Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-26T17:48:24Z","title":"LongLive: Real-time Interactive Long Video Generation","version":2},"cited_work":{"arxiv_id":"2509.22622","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22622","snapshot_observed_at":"2026-07-09T07:56:04.670863Z","title":"LongLive: Real-time Interactive Long Video Generation","venue":"cs.CV","work_id":"29ec6550-6ac1-4cc6-8aae-b4206f1d5b38","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2509.22622","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:ad9b4cc1927f620a78f6c477848ce7c16e7d08e0ac812c2d19f00e9251c2f51c","observation_id":"8a7d2bd7-725f-4d5e-a292-8bb75ebf42f7","resolution":{"observed_at":"2026-05-15T03:52:59.837830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.20649","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T23:59:07.583971Z","title":"Infinity-RoPE: Action-controllable infinite video generation emerges from autoregressive self- rollout","venue":null,"work_id":"bf98ead3-5902-4e92-9114-acd0c26e93c5","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:e5abd8b9b3fc69c9897662d16bf127c55e121201c8a2e45492c850a490e0929d","observation_id":"1484d422-1cd0-49c8-b6a3-49cdb3625782","resolution":{"observed_at":"2026-05-13T05:42:21.217273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T07:34:43.902351Z","title":"Improved distribution matching distillation for fast image synthesis.Advances in neural information processing systems, 37:47455–47487","venue":null,"work_id":"7d717b4b-8acc-4ba0-bdbd-729798db2a84","year":2024},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:2a4dbf42bc655181b313390b7d621db6b93ef5e581ac8d4d778266d250396889","observation_id":"16cce77a-6466-4f41-874b-827fe3c1a430","resolution":{"observed_at":"2026-05-13T10:17:39.448149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T07:34:43.937880Z","title":"One-step diffusion with distribution matching distillation","venue":null,"work_id":"067514cd-e6d1-4fca-a39f-b484eb80fc78","year":2024},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:4a011730ddbad5dc8661602a51513c3a77c928c679aa0e25d07cc37f1ec70122","observation_id":"29a80e67-5327-42f2-bb36-7d740b650ec6","resolution":{"observed_at":"2026-05-13T10:17:39.452440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From slow bidirectional to fast autoregressive video diffusion models","venue":null,"work_id":"670d460b-3b8f-4a28-9014-064842e32bbc","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:ed9ca5a3d5260f8f4b011a06d05a8df44eb4aefdea0b08489d0ed6699dcd5940","observation_id":"58328e55-9a5f-4cff-8943-a865fc073863","resolution":{"observed_at":"2026-05-13T10:17:39.456481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval","venue":null,"work_id":"3989049d-b475-436d-a77f-1493a767df5d","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:95af4f1c57d94a24c247a6829749614016d02361ae9a03425d64948268902ecf","observation_id":"20d85220-9e50-45d6-8971-34f44415525d","resolution":{"observed_at":"2026-05-13T10:17:39.460564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.12626","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.170375Z","title":"Lvmin Zhang, Shengqu Cai, Muyang Li, Chong Zeng, Beijia Lu, Anyi Rao, Song Han, Gordon Wetzstein, and Maneesh Agrawala","venue":null,"work_id":"346b7c9e-ca8e-406d-8770-be430b5f63eb","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:d6d4465543b2e67ac2893b9a287d4dd8b20e87822e3fb1fb0c8f938939755beb","observation_id":"31930703-47ff-4790-8692-136205fc74b5","resolution":{"observed_at":"2026-05-13T05:42:21.390164Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.16655","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.179332Z","title":"Yupeng Zhou, Daquan Zhou, Ming-Ming Cheng, Jiashi Feng, and Qibin Hou","venue":null,"work_id":"e4627f80-01d6-4559-96f4-069eab2ad080","year":2024},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:bec7a49e4a79c0cb369b908e754e660868994e90d707a5704fc07551cee8d507","observation_id":"c19bf4e7-321e-4529-af31-f1374079f470","resolution":{"observed_at":"2026-05-13T05:42:21.294367Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":"2304.11277","doi":"10.48550/arxiv.2304.11277","metadata_source":"pith","pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","venue":"cs.DC","work_id":"bee7755e-b855-401d-813a-06ae9451d768","year":2023},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:c6a0bb02d78be49118443ee83cc06a495a4a547fd9bd583eb4a2420b1ffb808d","observation_id":"6d2c6ac4-4890-47b3-89b8-3e6f55aae497","resolution":{"observed_at":"2026-05-13T05:42:21.209891Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.02259","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:07:28.048169Z","title":"Videogen-of-thought: Step-by-step generating multi-shot video with minimal manual intervention","venue":null,"work_id":"b95d01f7-3b7a-4791-aafe-f18f7e64e173","year":2024},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:6d415b6e76851cbca62f50e3ee65ac29ab2901afc08263b9fa829998ba4d45ef","observation_id":"aac2eee4-0bb1-49a6-a443-78c2418259ab","resolution":{"observed_at":"2026-05-13T05:42:21.301274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T01:20:37.517283Z","title":"Storydiffusion: Consistent self-attention for long-range image and video generation.Advances in Neural Information Processing Systems, 37:110315–110340","venue":null,"work_id":"546e3ae7-9681-40ac-aacb-7753a0be3a4a","year":2024},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:4ba702291167a9e414a8021e7f74cd1f2d82c6cb0c6f202f7fb767669d6f2b0c","observation_id":"007dc8ba-0442-4c59-8a4f-8d140f464133","resolution":{"observed_at":"2026-05-13T10:17:39.429821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02214","last_updated":"2026-06-01T14:32:37Z","snapshot_observed_at":"2026-08-03T05:30:22.346810Z","submitted_at":"2026-02-02T15:19:22Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","version":5},"cited_work":{"arxiv_id":"2602.02214","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.02214","snapshot_observed_at":"2026-07-10T13:47:05.847304Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","venue":"cs.CV","work_id":"04f67f5b-e79a-4ad9-8e90-763e5e54bd3d","year":2026},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2602.02214","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:ff85fbbf31c7ab76a8cc6dae19a5504a85384b232c1c7373aa85b9d076029009","observation_id":"f3a9cb6e-87dc-489c-a0ca-1a54185bea19","resolution":{"observed_at":"2026-05-21T17:32:01.900965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":0,"verified_exact":33,"verified_fuzzy":22},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 3 inbound Pith citation observations for arXiv:2605.12496."}