{"as_of":"2026-08-21T15:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:99ab6a5f51a312acafb98a8b0db7d7ed5d719b88d8c142184f63f49de8b23d47","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":5,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":5,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:47:55.955024Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T00:05:48.394109Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.17550","last_updated":"2025-04-09T01:18:01Z","snapshot_observed_at":"2026-08-16T13:15:15.859117Z","submitted_at":"2024-09-26T05:39:52Z","title":"A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17550","snapshot_observed_at":"2026-08-11T11:47:55.955024Z","title":"A simple but strong baseline for sounding video generation: Effective adaptation of audio and video diffusion models for joint generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15023","last_updated":"2025-05-05T16:55:53Z","snapshot_observed_at":"2026-08-17T16:57:32.768924Z","submitted_at":"2024-12-19T16:37:19Z","title":"FolAI: Synchronized Foley Sound Generation with Semantic and Temporal Alignment","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T11:47:55.955024Z"},"links":{"cited_paper":"/paper/2409.17550","citing_paper":"/paper/2412.15023"},"observation_digest":"sha256:836ad16af5bc8112dae333f9fbb64423b39c684c348c53c96ef167ba71777b1c","observation_id":"c7325ee3-c854-42b1-b248-3037bbaf9549","resolution":{"observed_at":"2026-08-11T11:47:55.955024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17550","last_updated":"2025-04-09T01:18:01Z","snapshot_observed_at":"2026-08-16T13:15:15.859117Z","submitted_at":"2024-09-26T05:39:52Z","title":"A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17550","snapshot_observed_at":"2026-08-11T11:38:08.302374Z","title":"A simple but strong baseline for sounding video generation: Effective adaptation of audio and video diffusion models for joint generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-18T16:26:34.884540Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.302374Z"},"links":{"cited_paper":"/paper/2409.17550","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:9270f0bf60deeecd9839312a8dea5b71aea365ff6ff684b0d6518e3b8910e8b2","observation_id":"3f26d0e5-5a5e-488e-8b79-6cf965eb5261","resolution":{"observed_at":"2026-08-11T11:38:08.302374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17550","last_updated":"2025-04-09T01:18:01Z","snapshot_observed_at":"2026-08-16T13:15:15.859117Z","submitted_at":"2024-09-26T05:39:52Z","title":"A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation","version":3},"cited_work":{"arxiv_id":"2409.17550","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.17550","snapshot_observed_at":"2026-08-05T00:05:48.394109Z","title":"A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation","venue":"cs.LG","work_id":"930328b4-4fbf-4712-ab37-7d59bd786676","year":2024},"citing_paper":{"arxiv_id":"2509.06155","last_updated":"2025-09-07T17:55:03Z","snapshot_observed_at":"2026-08-20T05:56:51.995983Z","submitted_at":"2025-09-07T17:55:03Z","title":"UniVerse-1: Unified Audio-Video Generation via Stitching of Experts","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T00:05:47.686964Z"},"links":{"cited_paper":"/paper/2409.17550","citing_paper":"/paper/2509.06155"},"observation_digest":"sha256:fbbb51c21f911f4b02a7bccf48a423233798b165341259b0b249c457a907808b","observation_id":"c00952e7-6c12-4923-bec4-ce6fee53ae84","resolution":{"observed_at":"2026-08-05T00:05:48.399732Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17550","last_updated":"2025-04-09T01:18:01Z","snapshot_observed_at":"2026-08-16T13:15:15.859117Z","submitted_at":"2024-09-26T05:39:52Z","title":"A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17550","snapshot_observed_at":"2026-08-04T12:38:57.293402Z","title":"A simple but strong baseline for sounding video generation: Effective adaptation of audio and video diffusion models for joint generation.arXiv preprint arXiv:2409.17550,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-20T07:35:26.302045Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:57.293402Z"},"links":{"cited_paper":"/paper/2409.17550","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:19690af18573e469fed3ad86cdb25cc17175f4ebb856d51870680cb818b731db","observation_id":"295887da-3bab-4ee3-bbf4-dd8932dc092b","resolution":{"observed_at":"2026-08-04T12:38:57.293402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17550","last_updated":"2025-04-09T01:18:01Z","snapshot_observed_at":"2026-08-16T13:15:15.859117Z","submitted_at":"2024-09-26T05:39:52Z","title":"A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17550","snapshot_observed_at":"2026-08-03T16:25:56.290355Z","title":"A simple but strong baseline for sounding video generation: Effective adaptation of audio and video diffusion models for joint generation.arXiv preprint arXiv:2409.17550, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-16T01:03:28.277020Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:56.290355Z"},"links":{"cited_paper":"/paper/2409.17550","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:9d6f5e44203281b2ac746f7879eedafc334364fee19c80cacc2e3c27cd2be9b4","observation_id":"cee6463b-6430-4500-a5af-9c211722155e","resolution":{"observed_at":"2026-08-03T16:25:56.290355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2409.17550/citation-record","integrity":"/paper/2409.17550/integrity","json":"/paper/2409.17550/citation-record.json","paper":"/paper/2409.17550"},"outbound":[],"paper":{"arxiv_id":"2409.17550","last_updated":"2025-04-09T01:18:01Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T13:15:15.859117Z","submitted_at":"2024-09-26T05:39:52Z","title":"A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 5 inbound Pith citation observations for arXiv:2409.17550."}