{"as_of":"2026-08-09T02:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:495395c2072298eb93da522c3ab154426b4f4c83c6bb8f0e284296592c2beca6","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T06:45:50.290338Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02474/citation-record","integrity":"/paper/2608.02474/integrity","json":"/paper/2608.02474/citation-record.json","paper":"/paper/2608.02474"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:45.965275Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:45.965275Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:b0f7c081da11613ffcc054344a4379de1efbca9780310004a8f31c94499a74c8","observation_id":"17c43c21-5382-417d-b35b-07d4341f1636","resolution":{"observed_at":"2026-08-04T06:45:45.965275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:46.043170Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:46.043170Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:aa43d19890d864d32c91decc7473755c201fbdf1514664fbba239501a96efa2c","observation_id":"bbd65bd2-962b-4cb9-8695-edee7a1586fb","resolution":{"observed_at":"2026-08-04T06:45:46.043170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-08-04T06:45:46.122397Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:46.122397Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:e2cec5d07b864bee48dca3d1affe3092eab5de29acc35b6c139fca7bee9cdc3b","observation_id":"d958e652-9421-4996-b66f-9ef6324edd8e","resolution":{"observed_at":"2026-08-04T06:45:46.122397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-08-04T06:45:46.185168Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:46.185168Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:4d4dd16ee2106d5f3d92110874919ba9bfcfb190355462983fc4fd8de821faf5","observation_id":"c3c5a997-5f97-462a-833d-4b2535c98401","resolution":{"observed_at":"2026-08-04T06:45:46.185168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-07T13:55:40.621856Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-04T06:45:46.240639Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:46.240639Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:dc2c1e59b9facef5800eef92c54469ef827a409dc19639ba0ee8e57ac4632950","observation_id":"b1bd9306-469f-4ce9-90b3-eab397e300ab","resolution":{"observed_at":"2026-08-04T06:45:46.240639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:46.324533Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:46.324533Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:285202959a2143612dbc81942080ebfd7ca004a704e7e8dd49921991201d180a","observation_id":"ee63e7fb-e32e-4225-8a3f-52a5fcc2dcfe","resolution":{"observed_at":"2026-08-04T06:45:46.324533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:46.387451Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:46.387451Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:27c8d45293f0798b34ed4d005fb7b99047bef130f2473f8395bf1a4ae0c16578","observation_id":"6ab68ca8-b328-49a6-a01c-36bfa9d2d9b4","resolution":{"observed_at":"2026-08-04T06:45:46.387451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:46.439890Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:46.439890Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:63bf845cba5ed9d4271060e8ffa6be4e9bc8536e3b1dc4f65b85d5df4673462c","observation_id":"b55a4f7e-bf1f-4132-ac11-be6ea7809f6c","resolution":{"observed_at":"2026-08-04T06:45:46.439890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-08-04T06:45:46.515828Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:46.515828Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:88b1ae8055e9e6b2cf0fa698ea048480ce05c26cb22af19d9a1b31f711edf9eb","observation_id":"afd2025c-a931-4640-a65e-51dd3c8b3371","resolution":{"observed_at":"2026-08-04T06:45:46.515828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09113","last_updated":"2025-06-28T11:58:23Z","snapshot_observed_at":"2026-08-09T02:36:54.979612Z","submitted_at":"2025-06-10T17:56:11Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09113","snapshot_observed_at":"2026-08-04T06:45:46.589273Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:46.589273Z"},"links":{"cited_paper":"/paper/2506.09113","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:80a3aa1f42f8c38fe6cc01007b905795692c351921f63758b472c5cd3409003e","observation_id":"75595454-e68d-4d84-b8c1-97759ff3c8c2","resolution":{"observed_at":"2026-08-04T06:45:46.589273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03025","last_updated":"2024-05-10T08:30:07Z","snapshot_observed_at":"2026-08-06T17:14:58.934575Z","submitted_at":"2024-05-05T18:36:45Z","title":"Matten: Video Generation with Mamba-Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03025","snapshot_observed_at":"2026-08-04T06:45:46.645084Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:46.645084Z"},"links":{"cited_paper":"/paper/2405.03025","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:8c8c1634734a94b725c1a7d011605f3dd3a4b99f16fce0b4f16db57650e698bf","observation_id":"086599f2-ef23-498d-81c2-273c56d09655","resolution":{"observed_at":"2026-08-04T06:45:46.645084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:46.718742Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:46.718742Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:b5465d8fafc59d8a8305890334d6c0904191554c729563b46fd0e3776a543935","observation_id":"2e3d43a6-df5e-40dc-81da-73581368df71","resolution":{"observed_at":"2026-08-04T06:45:46.718742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:46.767195Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:46.767195Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:b122477ea5f3a51dbac2784ce3bd7015b34b3c37e7cbee481e9751b015d3dfd2","observation_id":"d7d2acae-1ca2-40f5-acca-98c37d3398ee","resolution":{"observed_at":"2026-08-04T06:45:46.767195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:46.822030Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:46.822030Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:b3615a6a96641f17978aa90b788ce31e26d71abf5c8487be0843f4c415b46dbc","observation_id":"5d90c89f-364c-4306-bbfa-0645c9139806","resolution":{"observed_at":"2026-08-04T06:45:46.822030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:46.901345Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:46.901345Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:030983d7b68152a0d932005a3a118f10c632b5c21d2a8f3189b7afdf935935f4","observation_id":"70d9af34-93c8-4d0a-af37-6271993fc203","resolution":{"observed_at":"2026-08-04T06:45:46.901345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:46.960703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:46.960703Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:b4a334d8f824861ac65423d8184b2624adfc1f33c31ae5f2f234264fb9487e81","observation_id":"0d6e440b-8509-4176-aae8-3e06b21317d5","resolution":{"observed_at":"2026-08-04T06:45:46.960703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:47.014057Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:47.014057Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:c832f2d2a2c863ad46df6e67fe53e3f61f51d632bc005713e2eb7804a4ef3c03","observation_id":"5ec1bbba-5edd-4b61-bf4b-0aaae9dda29d","resolution":{"observed_at":"2026-08-04T06:45:47.014057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:47.065302Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:47.065302Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:e26b5da2a8b98eedfc733db4fa23441b997c2e754561c7603de2d07249063d93","observation_id":"bcdbfce5-2af8-44a0-a51d-828d83ca6c5c","resolution":{"observed_at":"2026-08-04T06:45:47.065302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:47.169515Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:47.169515Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:bb27232d885e30d72c958c4db836685e2515cd27f889061a4796ec20e1c5a10a","observation_id":"5c8c1794-7fc8-4594-b7ee-ac39bd3667d5","resolution":{"observed_at":"2026-08-04T06:45:47.169515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09608","last_updated":"2024-10-15T07:11:11Z","snapshot_observed_at":"2026-08-03T01:47:19.174467Z","submitted_at":"2023-12-15T08:46:43Z","title":"Faster Diffusion: Rethinking the Role of the Encoder for Diffusion Model Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09608","snapshot_observed_at":"2026-08-04T06:45:47.245265Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:47.245265Z"},"links":{"cited_paper":"/paper/2312.09608","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:56eb8e39d25a40af51bfb57858d5eb9fe8f9fb966071230c44603329a367711e","observation_id":"aeb70726-9186-42c6-9f34-22fe9c39daee","resolution":{"observed_at":"2026-08-04T06:45:47.245265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:47.293120Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:47.293120Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:6d48eb56de729d7e3a498e3bc7ffefccf5a4dbee323e987f864c0c6ba862a611","observation_id":"22b81dd8-73e3-4bc2-ae8c-7cd7eb326aff","resolution":{"observed_at":"2026-08-04T06:45:47.293120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:47.356906Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:47.356906Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:1fbb7a5906c428022f8555fab02e37616d67ab3a20b7d5d53072302614f64e3e","observation_id":"7c93db97-6bb9-48fa-9e1b-d9b5b5a1744f","resolution":{"observed_at":"2026-08-04T06:45:47.356906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:47.409300Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:47.409300Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:e2bf3055e08774bec6e78924ce6cff41e6e08ffd617e09cad61c6c0e2dd7b357","observation_id":"272cd7ab-80b7-4b11-bd1a-94b2d8385d5f","resolution":{"observed_at":"2026-08-04T06:45:47.409300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:47.506597Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:47.506597Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:65f8c992324d04ebf25dcdefa8f7432c7f7bf5bd18aca4f0d87b4ce6ac182a6d","observation_id":"b70ab8bf-785c-43ef-b1a8-945e8677bbbf","resolution":{"observed_at":"2026-08-04T06:45:47.506597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:47.589220Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:47.589220Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:4ea4261c17af904e4f782b4021eb1c54a23ae10d0407a9d5bfd76a0b0e03c005","observation_id":"1c172454-d875-4b90-a435-d9659c7a5355","resolution":{"observed_at":"2026-08-04T06:45:47.589220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.18636","last_updated":"2026-05-08T04:13:25Z","snapshot_observed_at":"2026-07-06T22:49:42.664225Z","submitted_at":"2026-03-19T09:00:08Z","title":"Attention Sparsity is Input-Stable: Training-Free Sparse Attention for Video Generation via Offline Sparsity Profiling and Online QK Co-Clustering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.18636","snapshot_observed_at":"2026-08-04T06:45:47.673744Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:47.673744Z"},"links":{"cited_paper":"/paper/2603.18636","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:e28f76df57366339246814cc64223825d8c59fe2e8b16dbc0756069d591b5131","observation_id":"b0630868-cb3a-40e0-96da-1db328798684","resolution":{"observed_at":"2026-08-04T06:45:47.673744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04378","snapshot_observed_at":"2026-08-04T06:45:47.757037Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:47.757037Z"},"links":{"cited_paper":"/paper/2310.04378","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:a69134d4ca05c135e744165d811c47d7f808e7841ee64ca6dfb4b54d85224944","observation_id":"b82da21c-4b8a-478e-98e4-fc9005ff2bcc","resolution":{"observed_at":"2026-08-04T06:45:47.757037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19355","last_updated":"2025-03-12T03:40:38Z","snapshot_observed_at":"2026-08-05T05:01:08.560635Z","submitted_at":"2024-10-25T07:24:38Z","title":"FasterCache: Training-Free Video Diffusion Model Acceleration with High Quality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19355","snapshot_observed_at":"2026-08-04T06:45:47.843254Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:47.843254Z"},"links":{"cited_paper":"/paper/2410.19355","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:88af5fa10a29671e6b70d01361c67200f229610aee44fbd1b38e6a997bd567a9","observation_id":"f6366aa3-ad56-438e-8c61-8bd339ea23df","resolution":{"observed_at":"2026-08-04T06:45:47.843254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:47.889166Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:47.889166Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:844a1d803e7f3a04e9e8da0182fde500be1899fdfb419669fdf5433ffe1aab33","observation_id":"8717e88e-2611-4cd7-b21b-0f02988713f1","resolution":{"observed_at":"2026-08-04T06:45:47.889166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:47.936518Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:47.936518Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:7633d4312ba2e3236b32cfaec31bc4b0f0dbbe29233c91a2cf4e0164f43cd48a","observation_id":"95bf70b2-76de-493f-9c6d-a95242f006ad","resolution":{"observed_at":"2026-08-04T06:45:47.936518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:48.086829Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:48.086829Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:66ce2c30f8d39bfa93b254a83417e3a82b01f91a761c6cbca5fa3f61c8ce92f7","observation_id":"08afb6f5-031d-4e6f-b1eb-46615c742b1c","resolution":{"observed_at":"2026-08-04T06:45:48.086829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:48.173438Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:48.173438Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:8b9547de3e9f9a1ff441c65eb7cd896f3eef88664ea9c44b3a6e3be5243d6221","observation_id":"6e309616-77dc-4e6c-a024-b4666c2e9d75","resolution":{"observed_at":"2026-08-04T06:45:48.173438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-07-06T12:33:23.843893Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-04T06:45:48.255974Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:48.255974Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:483586794db76d6fbbcd506460c1caa4556dc67957c0dcd8981224d3b346e905","observation_id":"cd59c5d4-9560-4e68-ad29-783ae5d5cdae","resolution":{"observed_at":"2026-08-04T06:45:48.255974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:48.356595Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:48.356595Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:3116e0b5765dfd7193dcf55bea8ff8fd6ebcfa841a3ecbf7361554f37a89089a","observation_id":"7fea8f20-9209-4248-b4d5-6bcfe643c6f7","resolution":{"observed_at":"2026-08-04T06:45:48.356595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:48.522199Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:48.522199Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:087b0db0d35dbda87c10353f3dfd4314994226310e1bafc32a8dc4b043df28ee","observation_id":"ee880484-b26e-49d8-a77d-6131ce433a27","resolution":{"observed_at":"2026-08-04T06:45:48.522199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16581","last_updated":"2024-04-25T12:55:58Z","snapshot_observed_at":"2026-08-03T01:17:05.063080Z","submitted_at":"2024-04-25T12:55:58Z","title":"AudioScenic: Audio-Driven Video Scene Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16581","snapshot_observed_at":"2026-08-04T06:45:48.605412Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:48.605412Z"},"links":{"cited_paper":"/paper/2404.16581","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:09322cf0daa41f773d7c0b51ba55010213567ddba58a8e3468257aae3d44a5c8","observation_id":"77d9d54b-af23-4753-af5d-abc17e4c72c3","resolution":{"observed_at":"2026-08-04T06:45:48.605412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:48.690829Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:48.690829Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:2d8e18a77bc59dbd24dd6fc7696636f80bb6ff496bb1c8b5defe9c797233589c","observation_id":"575d6926-b479-4cf7-87dc-499d1ffac4eb","resolution":{"observed_at":"2026-08-04T06:45:48.690829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:48.754529Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:48.754529Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:c8f94981b8f9df661592122f5e47e41b7970d9654d9af13cb94baae9be3080e4","observation_id":"861d81fe-73c2-4a71-b138-0f3aa31f6b33","resolution":{"observed_at":"2026-08-04T06:45:48.754529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:48.827724Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:48.827724Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:f5d82f6137db79d542c9da57075bcd385ada080a293f0f1f21df7b4196301a43","observation_id":"2f3cbc29-c679-4d7e-82dd-8868ac3df6cf","resolution":{"observed_at":"2026-08-04T06:45:48.827724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-08T20:25:42.487197Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-08-04T06:45:48.907820Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:48.907820Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:bc67941f378d24d0bdaffdb2d501ba37892ff3d9e0b797443fc3c6e64740165d","observation_id":"74502ed6-8987-428d-8011-e947ddedcbc0","resolution":{"observed_at":"2026-08-04T06:45:48.907820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:48.978720Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:48.978720Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:b5bc2f6fb6a95c7ade0288a8a6afa65c58e64a3c022ed51ea7f34074347bba3f","observation_id":"35cf45d6-9e49-42ff-834a-3926f8f86bdc","resolution":{"observed_at":"2026-08-04T06:45:48.978720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:49.097758Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:49.097758Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:8b8105018aebe378d5224933c209d5f67eab9db5014bafad4fe3c1968bbab608","observation_id":"f2fa3ded-2176-4ee7-b2bf-bf7797442d42","resolution":{"observed_at":"2026-08-04T06:45:49.097758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-04T06:45:49.180315Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:49.180315Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:b5bf1fde8fd15e971ffa43fca8a2d3ba1f84f99cf5103960570aa737946cb4be","observation_id":"890afb3a-3e70-4326-b50f-61ab3dfc713a","resolution":{"observed_at":"2026-08-04T06:45:49.180315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23307","last_updated":"2025-03-30T04:22:09Z","snapshot_observed_at":"2026-08-07T20:48:48.663695Z","submitted_at":"2025-03-30T04:22:09Z","title":"MoCha: Towards Movie-Grade Talking Character Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23307","snapshot_observed_at":"2026-08-04T06:45:49.263380Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:49.263380Z"},"links":{"cited_paper":"/paper/2503.23307","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:fcb1f17ed1a0e554e7d5a58d3303d46e500527fb75b3b8894782c27ba91287e5","observation_id":"80430d9c-9cc8-4bf8-b34f-840614c7b596","resolution":{"observed_at":"2026-08-04T06:45:49.263380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:49.348626Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:49.348626Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:62e7a045388ec072b7ba4c3f74e1e44f0e415df14bc5acc883d8a681fe5c59e6","observation_id":"6671c3db-281b-47a7-8b9c-b22caf742b01","resolution":{"observed_at":"2026-08-04T06:45:49.348626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01776","last_updated":"2025-04-27T00:10:11Z","snapshot_observed_at":"2026-08-06T01:54:01.546928Z","submitted_at":"2025-02-03T19:29:16Z","title":"Sparse VideoGen: Accelerating Video Diffusion Transformers with Spatial-Temporal Sparsity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01776","snapshot_observed_at":"2026-08-04T06:45:49.417885Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:49.417885Z"},"links":{"cited_paper":"/paper/2502.01776","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:b5eef0d2568e7e0c46e22dd895f82200ae7b0355fa6170faaca8119958849a73","observation_id":"e0991f63-ee9f-4291-9d57-b0a7d8a4bdf9","resolution":{"observed_at":"2026-08-04T06:45:49.417885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-04T06:45:49.501804Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:49.501804Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:a9b19c167d34d55c5f2070a995306f31b81b9c8b3abb07ccac5ed190545638e2","observation_id":"34e1868f-6321-4e80-985f-c29cc3aaff04","resolution":{"observed_at":"2026-08-04T06:45:49.501804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05806","snapshot_observed_at":"2026-08-04T06:45:49.611770Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:49.611770Z"},"links":{"cited_paper":"/paper/2506.05806","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:6bec0bda2e1d71b2903fe08323c9fee938adc89a3a6eb3a39f86d27fc9d41a2a","observation_id":"72ceac6e-82b4-470d-b963-349472f310d9","resolution":{"observed_at":"2026-08-04T06:45:49.611770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:49.695077Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:49.695077Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:ecbd38ec5c9cf2c774e1503aa9e1054aea76c08868f58046d4d2def0dd0d72f6","observation_id":"149fdd86-8aa7-4742-859c-17a85af04718","resolution":{"observed_at":"2026-08-04T06:45:49.695077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:49.781592Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:49.781592Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:34123dc5cf457bbee68f361650104aa3406c2fb9aa080f30a728cc8993b77581","observation_id":"5dbc32b8-8e95-4b57-a88f-b4c3201fa5cc","resolution":{"observed_at":"2026-08-04T06:45:49.781592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:49.882471Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:49.882471Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:beea124e4ce9a0950dda3f20277725b7ba4e0578a681554cb30fafd78bf40326","observation_id":"085d8773-9e4e-40ab-8c19-57a7dedc377c","resolution":{"observed_at":"2026-08-04T06:45:49.882471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:49.971950Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:49.971950Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:df9fbd36c7ac7767e9305039dbd71c6c3d40bf3a3e0d2460b152e4d52db38b59","observation_id":"d349b146-1f4d-4a25-9649-d695fba380ea","resolution":{"observed_at":"2026-08-04T06:45:49.971950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12588","last_updated":"2025-02-27T07:00:30Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T17:54:21Z","title":"Real-Time Video Generation with Pyramid Attention Broadcast","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12588","snapshot_observed_at":"2026-08-04T06:45:50.046478Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:50.046478Z"},"links":{"cited_paper":"/paper/2408.12588","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:6a4bcba1ab37d5b8db472772fc4acf736930fb08106c23351973440d36f4ee60","observation_id":"48a79f2f-3cef-4e21-8e90-78734aad181c","resolution":{"observed_at":"2026-08-04T06:45:50.046478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-04T06:45:50.173825Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:50.173825Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:9f6bfc92a63647477d633c107e72070d9e83fcbbee7c58ed39ba4f4b16ace743","observation_id":"e9d3a3bc-2138-453e-829c-f28be69d113b","resolution":{"observed_at":"2026-08-04T06:45:50.173825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:45:50.290338Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:50.290338Z"},"links":{"citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:58ade6506ef0ff22c287491cbad20d18ed99c6fdfccddb849dda7b022f3622f4","observation_id":"90e13d4d-e2a9-46ce-bb0d-4dddecee58ee","resolution":{"observed_at":"2026-08-04T06:45:50.290338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19833","last_updated":"2025-06-24T17:50:16Z","snapshot_observed_at":"2026-08-06T22:59:27.051058Z","submitted_at":"2025-06-24T17:50:16Z","title":"Bind-Your-Avatar: Multi-Talking-Character Video Generation with Dynamic 3D-mask-based Embedding Router","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19833","snapshot_observed_at":"2026-08-04T06:45:47.112983Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:47.112983Z"},"links":{"cited_paper":"/paper/2506.19833","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:ed286e7122df729e989f6a2a50976ee7e8b9706d1c5da67e11ecef59d9e95cd7","observation_id":"6b4962d2-9e61-441b-ad8b-528320b0f77e","resolution":{"observed_at":"2026-08-04T06:45:47.112983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-08-04T06:45:48.445201Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:48.445201Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:6ac568fb5f75ae6635cd0c8398c9bb73f2a25fbc0edf173783713aabab82e243","observation_id":"1f7d6edc-2f30-4508-b39e-d1e627c3a72e","resolution":{"observed_at":"2026-08-04T06:45:48.445201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2608.02474."}