{"as_of":"2026-08-11T17:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6b274b6faa9c18a3589fdfbdd5ff2108690190140af22a2ed5f49af2470ce10b","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T14:30:48.687642Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:44:39.879025Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T13:04:15.827084Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"cited_work":{"arxiv_id":"2606.21661","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.21661","snapshot_observed_at":"2026-08-06T13:04:15.827084Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","venue":"cs.CV","work_id":"6b662819-7c41-45bf-8d05-015c200a2bf3","year":2026},"citing_paper":{"arxiv_id":"2608.04956","last_updated":"2026-08-05T15:27:26Z","snapshot_observed_at":"2026-08-08T23:13:39.797567Z","submitted_at":"2026-08-05T15:27:26Z","title":"ContextMaster: Interactive Multi-Shot Video Creation via Fixed-Budget Sparse Context Routing","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T13:04:13.631681Z"},"links":{"cited_paper":"/paper/2606.21661","citing_paper":"/paper/2608.04956"},"observation_digest":"sha256:b19fd5365ef58df58b19a5ea97305338223b7db9218efd00be3c1c8f1ac69bb0","observation_id":"8e99a2f7-594a-4de4-9d06-1534d92a080d","resolution":{"observed_at":"2026-08-06T13:04:15.832846Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.21661","snapshot_observed_at":"2026-08-07T23:44:39.879025Z","title":"Unityshots: Memory-driven multi-shot audio-video generation with boundary-aware gating.arXiv preprint arXiv:2606.21661,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05776","last_updated":"2026-08-06T09:09:49Z","snapshot_observed_at":"2026-08-09T23:11:31.435752Z","submitted_at":"2026-08-06T09:09:49Z","title":"Vorch-Director: Interactive World Story Model via Noise-Aware Error Rectification","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T23:44:39.879025Z"},"links":{"cited_paper":"/paper/2606.21661","citing_paper":"/paper/2608.05776"},"observation_digest":"sha256:2074fe62d5d40ccae89f3f4afd6cefdbba0865f660bca0e1e3aa7ef3158721a5","observation_id":"f79588df-4aae-4004-b8a4-4d776be64733","resolution":{"observed_at":"2026-08-07T23:44:39.879025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.21661/citation-record","integrity":"/paper/2606.21661/integrity","json":"/paper/2606.21661/citation-record.json","paper":"/paper/2606.21661"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.07802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T14:59:56.002433Z","title":"Nicolas Carion, Laura Gustafson, Yuan-Ting Hu, Shoubhik Debnath, Ronghang Hu, Di- dac Suris, Chaitanya Ryali, Kalyan Vasudev Alwala, Haitham Khedr, Andrew Huang, et al","venue":null,"work_id":"a2ff4c1c-0dd8-49b0-a09a-d7db531d4a6d","year":2025},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:bd6d4ed3c7864afc09d969f0324ce3f676760b6833a821670c8305618c27a5e6","observation_id":"3109daf9-48c2-4938-922c-20b6ea6c267d","resolution":{"observed_at":"2026-07-04T06:29:36.927383Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:af78bf02c038992324e5321bce2507f98528a23be36d3b070772ae27d6a71013","observation_id":"c5dddc9b-193f-412c-a5aa-e4af4bbd8733","resolution":{"observed_at":"2026-07-04T06:29:36.918036Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00747","last_updated":"2023-07-11T17:07:19Z","snapshot_observed_at":"2026-08-07T11:26:26.674534Z","submitted_at":"2023-03-01T18:59:13Z","title":"WhisperX: Time-Accurate Speech Transcription of Long-Form Audio","version":2},"cited_work":{"arxiv_id":"2303.00747","doi":"10.48550/arxiv.2303.00747","metadata_source":"pith","pith_arxiv_id":"2303.00747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WhisperX: Time-accurate speech transcription of long-form audio","venue":"cs.SD","work_id":"da9839e2-3c0b-4792-87a5-17cd9c608769","year":2023},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2303.00747","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:6d108f1976bc5d06dd64c16da1533eb8be24d69f58f3219909fe9140c3192b3c","observation_id":"3df3c858-676b-4256-9542-88db439d00ff","resolution":{"observed_at":"2026-07-04T06:29:36.915075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:564f5b22fd123ca482ab1fe230de379b8faa98ab1e5354d11b0f44d81e08e007","observation_id":"46b26646-5b5d-4453-b3ce-17cbbf741618","resolution":{"observed_at":"2026-07-04T06:29:36.965088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"Video generation models as world simulators.OpenAI Blog, 1(8):1, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:d9e9b5772538f5ef49f2576e551e34321551bd99928c18487f8135093eabde0e","observation_id":"076fcbcf-dfaf-4599-8249-d034dada056a","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"Seedance 2.0.https : / / seed","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:1057d1789c2a5aa9fbc644991fe8b924407710aa2706b8b126fc5a98475c65bd","observation_id":"8f9091b4-7e61-4e5c-bcb0-3a88a881841f","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.10256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:36.848919Z","title":"Id-lora: Identity-driven audio-video personalization with in-context lora.arXiv preprint arXiv:2603.10256, 2026","venue":null,"work_id":"74c2676a-3f78-45e1-aae3-bbff4549bb42","year":2026},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:27402f86b55e468f780b81f31fe69b6f873d358e37f540b26869e87c7d41a7a0","observation_id":"cad5b838-8358-4c86-a801-193602d54785","resolution":{"observed_at":"2026-07-04T06:29:36.850711Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03600","last_updated":"2022-08-30T16:07:25Z","snapshot_observed_at":"2026-08-09T01:10:41.785557Z","submitted_at":"2021-11-05T16:37:45Z","title":"Hybrid Spectrogram and Waveform Source Separation","version":3},"cited_work":{"arxiv_id":"2111.03600","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.03600","snapshot_observed_at":"2026-07-04T06:29:36.880276Z","title":"Hybrid spectrogram and waveform source separa- tion","venue":null,"work_id":"122be188-19a4-4f53-a701-6dca7ae33e88","year":2021},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2111.03600","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:3f8bd82fe23cb5170b6c3c1671c61bbfe9862ccb033859ff249bda1082387ded","observation_id":"601b8e3f-a1d3-41a2-b808-2432f618b09f","resolution":{"observed_at":"2026-07-04T06:29:36.882109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"Clap learning audio concepts from nat- ural language supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:fcf3f83d3f6f987e723f0101824b079788c28572c39b9aad038c955e6331c38c","observation_id":"da475eba-75cc-412b-96bf-e1e8260596ad","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21658","last_updated":"2024-07-31T14:59:17Z","snapshot_observed_at":"2026-08-01T04:12:33.815780Z","submitted_at":"2024-07-31T14:59:17Z","title":"Beat this! Accurate beat tracking without DBN postprocessing","version":1},"cited_work":{"arxiv_id":"2407.21658","doi":"10.48550/arxiv.2407.21658","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.21658","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beat this! accurate beat tracking without dbn postprocessing","venue":"arXiv (Cornell University)","work_id":"2a3d73d6-36ef-46df-b609-93c27c70fd49","year":2024},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2407.21658","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:1dfc3a7c9932c358dbcbe531fc9c3ebe514023fbf04d54f6a5187faa43377c99","observation_id":"b7b08f5c-a7ca-4800-867e-9a8c9d9732f3","resolution":{"observed_at":"2026-07-04T06:29:36.924623Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.12160","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:36.885838Z","title":"Dreamid-omni: Unified framework for controllable human-centric audio-video generation","venue":null,"work_id":"68a86102-576d-488e-8468-d7d87f76624f","year":2026},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:324cdf6514d0e15829bc1201129f5d6016520ffb6a0ddcc622676074acf0e8f6","observation_id":"2d0830ed-7749-42f1-a842-88582beec87a","resolution":{"observed_at":"2026-07-04T06:29:36.887697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-07T17:06:18.944213Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":"2503.10589","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-07-04T08:59:42.126868Z","title":"Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, et al","venue":null,"work_id":"94a15b89-3e30-4736-9f73-4841caf301db","year":2025},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:997c2c8b2c2e82c830212197406e5cfceaf5b99608fdd130e37160e227f93ba4","observation_id":"073bfb7a-b621-4518-9f95-be6ef80f2a32","resolution":{"observed_at":"2026-07-04T06:29:36.920808Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-07-06T22:40:51.136169Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"cited_work":{"arxiv_id":"2601.03233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.03233","snapshot_observed_at":"2026-07-10T01:46:41.047035Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","venue":"cs.CV","work_id":"1334671f-ee98-4c53-a1d4-0805281f8d2b","year":2026},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2601.03233","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:90dbd009f6e76785024022005539665cb0d46313dfc342aae114f48f524529e6","observation_id":"519a5368-c539-4a88-b084-bb11b06e56e1","resolution":{"observed_at":"2026-07-04T06:29:36.957109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08244","last_updated":"2025-08-12T12:41:32Z","snapshot_observed_at":"2026-08-05T21:28:56.371858Z","submitted_at":"2025-08-11T17:56:59Z","title":"Cut2Next: Generating Next Shot via In-Context Tuning","version":2},"cited_work":{"arxiv_id":"2508.08244","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08244","snapshot_observed_at":"2026-07-04T06:29:36.919364Z","title":"Cut2next: Generating next shot via in-context tuning.arXiv preprint arXiv:2508.08244,","venue":null,"work_id":"248ae2dd-a94f-4fd0-9ef0-5b5f1a123332","year":null},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2508.08244","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:7e54e36c1e1f0aef3cdeb8cb771b4b6d77b359ddf10362b2bc88374eec7972ca","observation_id":"0edea6f5-b840-4b02-9fea-aa0c6224da8b","resolution":{"observed_at":"2026-07-04T06:29:36.921720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"Denoising dif- fusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:c6186fd4e9065284ba8b8e7de305c08cb0c06487f9ef9ed4973f8e9b0685b23c","observation_id":"f235913b-f681-4233-aeb4-435459498be6","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2210.02303","doi":"10.48550/arxiv.2210.02303","metadata_source":"pith","pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","venue":"cs.CV","work_id":"bb20d241-dc6f-4b0a-b071-fd43a2cbd57f","year":2022},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:8adf872b684d3c485b17cd9ce5b14ffb615171db6e3cd15090de7eb5e024d193","observation_id":"1d0e5dbf-e0c9-4441-8640-6aa2681feb0c","resolution":{"observed_at":"2026-07-04T06:29:36.950324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"Video dif- fusion models.Advances in neural information processing systems, 35:8633–8646, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:063a53628755542c1c0a994eba5409b3ce6a4abe365053a7b0ad7d748b8f5d43","observation_id":"ffa644c8-9983-49df-9b0e-599a5e7b91f0","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23775","last_updated":"2024-11-05T06:41:27Z","snapshot_observed_at":"2026-07-06T19:42:47.238254Z","submitted_at":"2024-10-31T09:45:00Z","title":"In-Context LoRA for Diffusion Transformers","version":3},"cited_work":{"arxiv_id":"2410.23775","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.23775","snapshot_observed_at":"2026-07-04T20:10:08.832341Z","title":"In-context lora for diffusion transformers.arXiv preprint arXiv:2410.23775, 2024a","venue":null,"work_id":"135ddfe7-494d-4ec1-a27b-18a1ed8687f6","year":2024},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2410.23775","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:e7c7c000e5256bbdb7b3223d3a2d5653c36cf2c2c10a9b8d4e963bb68aed5ce2","observation_id":"f3b0e743-ccab-466a-bb1c-0f7c7b86e2e0","resolution":{"observed_at":"2026-07-04T06:29:36.953901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"Vbench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:03c944bf83762d446c88e67a8f5e44468704d53c8dcafff76bea8012b4e84058","observation_id":"9bba47a9-0141-4765-8cec-a0ddd537f8d0","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"Shotadapter: Text-to- multi-shot video generation with diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:0c911bb7016bd8f688c34778c06a746c40f7d6cc29272c22ab077bff1ad560c6","observation_id":"ecc88e60-d16a-436e-83a3-0b1cde99f00a","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:42f871ce1cd6b178befda31bcaa76fe9228ac56abb0708344f4055370c11a075","observation_id":"f1901d49-8938-45b9-9da0-d2963c6fc661","resolution":{"observed_at":"2026-07-04T06:29:36.927894Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"Kling ai.https://klingai","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:379c85c9d85b12ce5be81bb87e3462ec1d8ed0e5c63da34f33ef505b36c17b37","observation_id":"1922648c-fbbd-45c5-a4ce-ce692ac4225d","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04875","last_updated":"2026-04-06T17:26:04Z","snapshot_observed_at":"2026-07-06T22:53:46.999911Z","submitted_at":"2026-04-06T17:26:04Z","title":"DIRECT: Video Mashup Creation via Hierarchical Multi-Agent Planning and Intent-Guided Editing","version":1},"cited_work":{"arxiv_id":"2604.04875","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.04875","snapshot_observed_at":"2026-07-04T06:29:36.929187Z","title":"DIRECT: Video Mashup Creation via Hierarchical Multi-Agent Planning and Intent-Guided Editing","venue":"cs.CV","work_id":"96fa3e31-bf7c-4a3f-93d0-b34887203588","year":2026},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2604.04875","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:66a990be3431ea186f7878c463b66cbeab276c8c259d4e0be45498f21041a405","observation_id":"62b7d4ee-a8e3-459f-ac4d-161813ccd1d5","resolution":{"observed_at":"2026-07-04T06:29:36.930647Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.08521","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T14:59:55.985441Z","title":"Univa: Universal video agent towards open-source next-generation video generalist","venue":null,"work_id":"d59a3bcd-49ed-4413-a181-7756672b812a","year":2025},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:fac7506ef3452d5b26aa55b059193adb4f4bb8976ab10930742c4d6ecdfff913","observation_id":"3a1dcf94-3ccd-425d-84db-1764b114ba7f","resolution":{"observed_at":"2026-07-04T06:29:36.953703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"Audioldm 2: Learning holistic audio gen- eration with self-supervised pretraining.IEEE/ACM Trans- actions on Audio, Speech, and Language Processing, 32: 2871–2883, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:3ab25d6a64cc6604d02d9854763a3d32447ddb9d1b9fd3824b6d9be3b03221f8","observation_id":"5619a780-7c4b-41ed-aca1-2dbe2cb69118","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-11T13:07:35.192618Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"cited_work":{"arxiv_id":"2510.01284","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.01284","snapshot_observed_at":"2026-07-05T12:41:04.361399Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","venue":"cs.MM","work_id":"4ea3b1fc-d272-47f2-88a8-36cbeaa92448","year":2025},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2510.01284","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:12c22a5cf537e1ad9afec85627b078722fa41717c4c059a5999034662db0fa35","observation_id":"abfa0db6-9399-46ca-bc0c-b07c21a587b6","resolution":{"observed_at":"2026-07-04T06:29:36.885002Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"Filmweaver: Weaving consistent multi- shot videos with cache-guided autoregressive diffusion","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:0e2f4ef1727157aef795699956a22110dd2bebee827ef18026c41d2521a7a964","observation_id":"b4cf5651-b829-44c6-a510-06f0cf93c009","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.25746","doi":"10.48550/arxiv.2603.25746","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shotstream: Streaming multi-shot video generation for interactive storytelling","venue":"arXiv (Cornell University)","work_id":"eabcc1e0-ee6b-47bf-90fc-2e4fa7704243","year":2026},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:b7acb72a5379ebeebb352e6f4d9c771a11b2cd6d303294b24c5adee5f8987a68","observation_id":"8a85c64c-1c23-49bd-afae-485c195d41b7","resolution":{"observed_at":"2026-07-04T06:29:36.907596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-10T19:18:55.664338+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T19:18:55.664338+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.20822","doi":"10.48550/arxiv.2510.20822","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Team Seawead, Ceyuan Yang, Zhijie Lin, Yang Zhao, Shanchuan Lin, Zhibei Ma, Haoyuan Guo, Hao Chen, Lu Qi, Sen Wang, et al","venue":"ArXiv.org","work_id":"86271608-cd60-4a6d-8e48-468ae623ded6","year":2025},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:4114bf52993523f4edf72dfc89963171de602a2f29ffe897670a2d53528f0a5c","observation_id":"4a92260a-e066-45e0-b1c7-d3c296fec6a0","resolution":{"observed_at":"2026-07-04T06:29:36.873321Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:9ac0f25c0a53f68638da974dacc62ec8e4a6c5ddd6633d9a71e6918a07f45861","observation_id":"799e665c-290b-41ad-8a11-fc51f623ea55","resolution":{"observed_at":"2026-07-04T06:29:36.946480Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:3310f49fd6c5522b16af7efce0dd34b9ed499e2fa2f5eea071ca486a4d114314","observation_id":"293e1ccf-edd6-4df8-a705-65c965b628c3","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-10T21:41:31.247717Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:44bcc0faf13a6f12c8ca90205114b62401e81b469dac0241c00d3dac259219c3","observation_id":"41ce377b-b91a-45e1-938d-3934b104614c","resolution":{"observed_at":"2026-07-04T06:29:36.847624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:4236f9712e672848606d1a935e1a6a763dba6099cae07908d2399dadf6cf10c7","observation_id":"e45e663f-d35c-457a-8183-1f8cc722b268","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:31ecc5ca1a863f6d501ce3c02737bfd401fdd2a1fd1f6ee5c8f643aa9b6b4224","observation_id":"f6cab276-1fc6-470d-ac0e-fdd1cd32f168","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":"2010.02502","doi":"10.48550/arxiv.2010.02502","metadata_source":"pith","pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Implicit Models","venue":"cs.LG","work_id":"8fa2128b-d18c-405c-ac92-0e669cf89ac0","year":2020},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:47f64782bcaafcc2877a05d6bbd06c5b66cef7d875c77780b722693d92ec8115","observation_id":"f89166b0-29ff-48f5-b47f-9d1dc3a435ae","resolution":{"observed_at":"2026-07-04T06:29:36.950093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.04838","last_updated":"2020-08-11T16:37:59Z","snapshot_observed_at":"2026-08-07T21:35:40.193492Z","submitted_at":"2020-08-11T16:37:59Z","title":"TransNet V2: An effective deep network architecture for fast shot transition detection","version":1},"cited_work":{"arxiv_id":"2008.04838","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2008.04838","snapshot_observed_at":"2026-07-04T06:29:36.931995Z","title":"arXiv preprint arXiv:2008.04838 (2020)","venue":null,"work_id":"16ef49be-5783-4e0a-a993-09cdb1ab77c3","year":2008},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2008.04838","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:c752165e21c3d7e411c73c63f18f8114e0805984e51bbac678f081d0ca90c829","observation_id":"fa4d55f7-1953-44c1-968c-9f2ffa5e6d96","resolution":{"observed_at":"2026-07-04T06:29:36.933814Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:48dc9d66a788c4aaab751117df22894486c4331328a10bc17295adc34848d3db","observation_id":"f3c8f0b1-2e2b-4306-b694-9b3c6c554522","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.08794","doi":"10.48550/arxiv.2602.08794","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mova: Towards scalable and synchronized video-audio generation","venue":"Open MIND","work_id":"1ec90ca8-482d-433a-94ad-2005f2c6fe8f","year":2026},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:d1402f4d3848df65efd57e7f60c3343ed29224a22aa5578e8a0391e767a20db8","observation_id":"6484f5c3-c581-4307-9432-d3d966cf96d6","resolution":{"observed_at":"2026-07-04T06:29:36.941749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":"2502.05139","doi":"10.48550/arxiv.2502.05139","metadata_source":"pith","pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","venue":"cs.SD","work_id":"7cba92d8-f51e-4a64-8d1d-6d4cf1f56377","year":2025},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:2582f012428e91673f76aa34123939f69620ebeb11d755c6d5b06ef0572aa1e1","observation_id":"a4540cb8-2811-4ee5-bcd5-e665da92aa63","resolution":{"observed_at":"2026-07-04T06:29:36.904301Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:c26bfb6262193a4e070a5719e056a0fcd81dc0f91fc67bd6e47c1adad5869ac2","observation_id":"e8207912-e7ed-41e2-b2f0-24f606bae433","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:735c22a50127f159e778c6816ad0851a7649994d19c446d456612e8f7ffec7e8","observation_id":"3d3b7d49-1593-4422-9f5f-449cc5f02cd5","resolution":{"observed_at":"2026-07-04T06:29:36.930406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"Cinemaster: A 3d-aware and controllable frame- work for cinematic text-to-video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:73f736787f24dfca56817c49be939f39b61816c30d77ef4e78889cb05bfe91b5","observation_id":"b5f50de4-1858-42f0-9a4f-4b097ba9ad88","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.03041","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:36.958778Z","title":"Xierui Wang, Siming Fu, Qihan Huang, Wanggui He, and Hao Jiang","venue":null,"work_id":"930f3aa4-2e69-4e67-a023-dc0c6437a6d8","year":2025},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:1901c6fe1b5f4cc6ba616848b5bd634488adaa531116c65409a131533141beda","observation_id":"aa45f9f4-602a-489a-9e7f-bc7fa84edd58","resolution":{"observed_at":"2026-07-04T06:29:36.961388Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:ffb07b07a73e3159baf6377a4112532c4b94a998b42b14a34c3b9f82d75bb2d6","observation_id":"6317b0f0-5ac7-43dd-b38a-38d9f7337531","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"Qwen-image technical report,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:0e5d01388152ca131f58bc6eaf4749e45e0e4f983e0a641a1e96e0a018220b27","observation_id":"ea3d9d4c-2ddf-489c-b6d4-a4ea9aeac680","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.11484","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:36.862138Z","title":"Cinetrans: Learning to generate videos with cinematic transitions via masked diffusion models","venue":null,"work_id":"6e03d991-7eb0-42e9-848b-e41b274006c5","year":2025},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:2ff90f48eebb2ab2e80ad22082d6ff89eac147e5dedc67a7d6463f22dca3fe96","observation_id":"62639505-b66b-4ea5-b757-a88253d6e3e8","resolution":{"observed_at":"2026-07-04T06:29:36.864400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18634","last_updated":"2025-07-24T17:59:56Z","snapshot_observed_at":"2026-08-09T05:25:26.907103Z","submitted_at":"2025-07-24T17:59:56Z","title":"Captain Cinema: Towards Short Movie Generation","version":1},"cited_work":{"arxiv_id":"2507.18634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.18634","snapshot_observed_at":"2026-07-04T14:59:55.942413Z","title":"Hu Ye, Jun Zhang, Sibo Liu, Xiao Han, and Wei Yang","venue":null,"work_id":"f9a119c5-1df4-4a57-a6a5-0d1ac0d94b19","year":2025},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2507.18634","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:76ced4c5c064d89d64400d04eb1e6aae7b3801e3b59d4943eb600ade102e422e","observation_id":"4d3da473-bdd5-40e8-b45a-188af54f1830","resolution":{"observed_at":"2026-07-04T06:29:36.876998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"Motioncanvas: Cinematic shot design with controllable image-to-video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:db7b5635c5a0deedf35464257d70b943e7fbc6cc37144f1c87555bdeb7974f33","observation_id":"a0e08016-4948-4e52-b565-a38efeb9da29","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"Cogvideox: Text-to- video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:352c6a5dfc833d9159de0548b3e45ef7a90c62dbf7e7f2424ddb966faf529bd1","observation_id":"d4d5dacd-a63d-4981-99d5-63adbba7a6db","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2308.06721","doi":"10.48550/arxiv.2308.06721","metadata_source":"pith","pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","venue":"cs.CV","work_id":"98e51b10-54bd-4251-8a2d-f79bd6215c19","year":2023},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:a8db375aea025c813e797236b71015ef7c9b4ee3345f97f18b96418c14756faf","observation_id":"1cc83777-54b0-46f2-9c4d-1e39b737dced","resolution":{"observed_at":"2026-07-04T06:29:36.941115Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:20:08.139662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:20:08.139662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.19539","doi":"10.48550/arxiv.2512.19539","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Storymem: Multi-shot long video storytelling with memory","venue":"arXiv (Cornell University)","work_id":"e9664b60-b7f0-49af-8ca2-f9afad0a548c","year":2025},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:7773b058f9820d717e0644a463bd2934520d3c5dc49c037e7b7f7c2ebfbd957b","observation_id":"eeb79f86-c8f1-4c8b-b782-16eeff218219","resolution":{"observed_at":"2026-07-04T06:29:36.937641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-10T19:18:57.479357+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T19:18:57.479357+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"Frame context packing and drift prevention in next-frame-prediction video diffusion models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:b32355db6ebf2f60ac17cb0fa8173c97beb8a880bb69ed9539f8dd0bdbd20cca","observation_id":"969368aa-4cff-4f34-8b28-4c7c298ac10b","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.12372","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T14:59:55.999898Z","title":"Stage: Storyboard- anchored generation for cinematic multi-shot narrative","venue":null,"work_id":"167b9b79-2099-41d6-964e-9c011c55f890","year":2025},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:d31bc20c3d296af3a619124cf41ded02ef862bd8fdf8bf488cbb14b1a9a23bcb","observation_id":"95a24e8b-dc25-4377-a410-4fa1a0f544f5","resolution":{"observed_at":"2026-07-04T06:29:36.911140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"Fo- leycrafter: Bring silent videos to life with lifelike and syn- chronized sounds.International Journal of Computer Vision, 134(1):46, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:b3cf8686dd84f4c8fb20c49417854c1952be11bf90371bb202ae582db3644a62","observation_id":"995f29a0-0641-4568-bd24-c488280c7223","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":"2412.20404","doi":"10.48550/arxiv.2412.20404","metadata_source":"pith","pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open-Sora: Democratizing Efficient Video Production for All","venue":"cs.CV","work_id":"8b29ba7b-3d84-4281-85b7-9eaf905afd7f","year":2024},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:6cdf4ac473b73ebe0f3df9a83b5eb647013d0b6b09ea9e5393357b537675a563","observation_id":"98404115-dc36-47d4-b24d-086680a09b85","resolution":{"observed_at":"2026-07-04T06:29:36.904071Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.03655","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:36.944481Z","title":"arXiv preprint arXiv:2601.03655 (2026) 30","venue":null,"work_id":"616f92cf-132e-40f9-913f-d5541751c176","year":2026},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:78b0fcb0b65dfcea9d1e576113ec815c9636399d1293f245afae203c973f6172","observation_id":"2a32fd5b-a60b-4a49-a335-c67ff390caa9","resolution":{"observed_at":"2026-07-04T06:29:36.946921Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:30:48.687642Z","title":"Nipemaembemawili,haraka.\\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:cdfa582346f077f6f0add5ee0b2f53d27dc0b0a8bca10dbe68c88eef5b43db67","observation_id":"81b16b97-5f97-4a6b-aea4-22d1d54811c6","resolution":{"observed_at":"2026-06-26T14:30:48.687642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9780.6560","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:36.915958Z","title":null,"venue":null,"work_id":"ed6b2e0a-a3d2-48e3-8737-44f8a3b0899a","year":null},"citing_paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-26T14:30:48.687642Z"},"links":{"citing_paper":"/paper/2606.21661"},"observation_digest":"sha256:4a1259cc7b0163d01e58cec44344ba41601cdd3c67a1c214d49480d41c36a377","observation_id":"ad478994-600f-4eae-afb0-7efe41f60cc5","resolution":{"observed_at":"2026-07-04T06:29:36.917896Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.21661","last_updated":"2026-06-19T18:06:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T02:37:40.225224Z","submitted_at":"2026-06-19T18:06:15Z","title":"UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":1,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":23,"verified_exact":28,"verified_fuzzy":0},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 2 inbound Pith citation observations for arXiv:2606.21661."}