{"as_of":"2026-08-19T05:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0ae7500116076001a50977321309c0dfa5d6477c5b27083bb682ea305caecfcd","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:43:41.137426Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T05:50:17.804576Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.13689","last_updated":"2024-09-20T17:59:01Z","snapshot_observed_at":"2026-08-16T13:16:47.187765Z","submitted_at":"2024-09-20T17:59:01Z","title":"Temporally Aligned Audio for Video with Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13689","snapshot_observed_at":"2026-08-12T12:00:01.699988Z","title":"Temporally aligned audio for video with autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17698","last_updated":"2025-03-17T17:44:37Z","snapshot_observed_at":"2026-08-16T07:29:11.626505Z","submitted_at":"2024-11-26T18:59:58Z","title":"Video-Guided Foley Sound Generation with Multimodal Controls","version":4},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T12:00:01.699988Z"},"links":{"cited_paper":"/paper/2409.13689","citing_paper":"/paper/2411.17698"},"observation_digest":"sha256:27d63e5c954a5be801f8ac330295e1d604afc865fc8f838ca4fb2717f64c8e75","observation_id":"e6e8909a-634d-486e-bc02-f373299d398c","resolution":{"observed_at":"2026-08-12T12:00:01.699988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13689","last_updated":"2024-09-20T17:59:01Z","snapshot_observed_at":"2026-08-16T13:16:47.187765Z","submitted_at":"2024-09-20T17:59:01Z","title":"Temporally Aligned Audio for Video with Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13689","snapshot_observed_at":"2026-08-11T17:17:49.276216Z","title":"Temporally aligned audio for video with autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09168","last_updated":"2024-12-12T10:55:57Z","snapshot_observed_at":"2026-08-15T22:25:08.518215Z","submitted_at":"2024-12-12T10:55:57Z","title":"YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T17:17:49.276216Z"},"links":{"cited_paper":"/paper/2409.13689","citing_paper":"/paper/2412.09168"},"observation_digest":"sha256:40a0a65a72b1e4de4192d552d58da4e0edeeb0f3de712804183c39ec679a6a24","observation_id":"7af3061b-bd22-4409-9e03-c35538f734b8","resolution":{"observed_at":"2026-08-11T17:17:49.276216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13689","last_updated":"2024-09-20T17:59:01Z","snapshot_observed_at":"2026-08-16T13:16:47.187765Z","submitted_at":"2024-09-20T17:59:01Z","title":"Temporally Aligned Audio for Video with Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13689","snapshot_observed_at":"2026-08-11T11:38:08.607273Z","title":"Temporally aligned audio for video with autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-18T16:26:34.884540Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.607273Z"},"links":{"cited_paper":"/paper/2409.13689","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:03a0da14796a2b93ead94adeba9fdb7495c1b1d8eada5d8a8bfee4fec7d4a8f8","observation_id":"17c6a2ae-05ee-4646-b9bd-c3365752c2e5","resolution":{"observed_at":"2026-08-11T11:38:08.607273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13689","last_updated":"2024-09-20T17:59:01Z","snapshot_observed_at":"2026-08-16T13:16:47.187765Z","submitted_at":"2024-09-20T17:59:01Z","title":"Temporally Aligned Audio for Video with Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13689","snapshot_observed_at":"2026-08-11T11:35:57.834871Z","title":"Temporally aligned audio for video with autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15322","last_updated":"2025-04-07T18:00:00Z","snapshot_observed_at":"2026-08-18T13:59:15.022742Z","submitted_at":"2024-12-19T18:59:55Z","title":"MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T11:35:57.834871Z"},"links":{"cited_paper":"/paper/2409.13689","citing_paper":"/paper/2412.15322"},"observation_digest":"sha256:5cde8a48c039f0e6470a003f47f5cac45d9eb1463789a5c3aff5cf8ef1fec650","observation_id":"9bbad2fc-ca5d-4cb5-a382-3c2da3cdcd7f","resolution":{"observed_at":"2026-08-11T11:35:57.834871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13689","last_updated":"2024-09-20T17:59:01Z","snapshot_observed_at":"2026-08-16T13:16:47.187765Z","submitted_at":"2024-09-20T17:59:01Z","title":"Temporally Aligned Audio for Video with Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13689","snapshot_observed_at":"2026-08-10T20:27:03.788957Z","title":"Temporally aligned audio for video with autoregression,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08587","last_updated":"2025-01-15T05:15:54Z","snapshot_observed_at":"2026-08-16T14:30:18.233558Z","submitted_at":"2025-01-15T05:15:54Z","title":"Sound Scene Synthesis at the DCASE 2024 Challenge","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:27:03.788957Z"},"links":{"cited_paper":"/paper/2409.13689","citing_paper":"/paper/2501.08587"},"observation_digest":"sha256:7c75998d1a3eec0aee461e7b58d92823c6b4a2f2ebffac910cf5fdfec9db2f37","observation_id":"7ca429fd-5320-47ba-add0-d721791b7105","resolution":{"observed_at":"2026-08-10T20:27:03.788957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13689","last_updated":"2024-09-20T17:59:01Z","snapshot_observed_at":"2026-08-16T13:16:47.187765Z","submitted_at":"2024-09-20T17:59:01Z","title":"Temporally Aligned Audio for Video with Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13689","snapshot_observed_at":"2026-08-16T11:43:41.137426Z","title":"Temporally aligned audio for video with autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14906","last_updated":"2025-06-03T03:27:47Z","snapshot_observed_at":"2026-08-17T22:53:48.202284Z","submitted_at":"2025-04-21T07:21:28Z","title":"OmniAudio: Generating Spatial Audio from 360-Degree Video","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T11:43:41.137426Z"},"links":{"cited_paper":"/paper/2409.13689","citing_paper":"/paper/2504.14906"},"observation_digest":"sha256:b6fcfd8a6f6d5ffb404845c0bcaa3f68594e59ffe588095fec7dcd66fe148f0b","observation_id":"eaa969e7-3ab2-4901-a887-c4c5f3aef29c","resolution":{"observed_at":"2026-08-16T11:43:41.137426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13689","last_updated":"2024-09-20T17:59:01Z","snapshot_observed_at":"2026-08-16T13:16:47.187765Z","submitted_at":"2024-09-20T17:59:01Z","title":"Temporally Aligned Audio for Video with Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13689","snapshot_observed_at":"2026-08-07T14:05:11.397850Z","title":"Temporally aligned audio for video with autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20038","last_updated":"2025-05-26T14:24:19Z","snapshot_observed_at":"2026-08-18T16:09:39.098977Z","submitted_at":"2025-05-26T14:24:19Z","title":"Towards Video to Piano Music Generation with Chain-of-Perform Support Benchmarks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:11.397850Z"},"links":{"cited_paper":"/paper/2409.13689","citing_paper":"/paper/2505.20038"},"observation_digest":"sha256:3178ca17bd97e33ed98c6d72c91ac9fcbdf2bf1b05fbbfff50d9de70c762c8b4","observation_id":"8aab714f-f38e-46bd-abbc-3c3d4a717b46","resolution":{"observed_at":"2026-08-07T14:05:11.397850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13689","last_updated":"2024-09-20T17:59:01Z","snapshot_observed_at":"2026-08-16T13:16:47.187765Z","submitted_at":"2024-09-20T17:59:01Z","title":"Temporally Aligned Audio for Video with Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13689","snapshot_observed_at":"2026-08-06T20:37:18.705798Z","title":"Temporally aligned audio for video with autore- gression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-18T21:03:23.712958Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:18.705798Z"},"links":{"cited_paper":"/paper/2409.13689","citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:b4b900d09764ac68b01d71e8b770abb81a2306c90a2f830e3ace39fe0a4a7660","observation_id":"a879510a-756e-404b-aee7-f14b9d686219","resolution":{"observed_at":"2026-08-06T20:37:18.705798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13689","last_updated":"2024-09-20T17:59:01Z","snapshot_observed_at":"2026-08-16T13:16:47.187765Z","submitted_at":"2024-09-20T17:59:01Z","title":"Temporally Aligned Audio for Video with Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13689","snapshot_observed_at":"2026-08-15T17:43:11.887020Z","title":"Temporally aligned audio for video with autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11074","last_updated":"2025-08-14T21:11:57Z","snapshot_observed_at":"2026-08-16T07:29:56.652433Z","submitted_at":"2025-08-14T21:11:57Z","title":"LD-LAudio-V1: Video-to-Long-Form-Audio Generation Extension with Dual Lightweight Adapters","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T17:43:11.887020Z"},"links":{"cited_paper":"/paper/2409.13689","citing_paper":"/paper/2508.11074"},"observation_digest":"sha256:9e639bc377632ff21a39c6708ba278f7d4886dfce1134144a72543330829e8ff","observation_id":"702af5aa-9c8d-4f6e-8fa0-14ed86edf5ad","resolution":{"observed_at":"2026-08-15T17:43:11.887020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13689","last_updated":"2024-09-20T17:59:01Z","snapshot_observed_at":"2026-08-16T13:16:47.187765Z","submitted_at":"2024-09-20T17:59:01Z","title":"Temporally Aligned Audio for Video with Autoregression","version":1},"cited_work":{"arxiv_id":"2409.13689","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.13689","snapshot_observed_at":"2026-08-05T05:50:17.804576Z","title":"Temporally Aligned Audio for Video with Autoregression","venue":"cs.CV","work_id":"77f792bd-3ccf-4add-93d8-381a810ac0bf","year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-18T15:15:42.964586Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.701833Z"},"links":{"cited_paper":"/paper/2409.13689","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:da03796f3cee895a4e995c1e85470dc4678721a08518d512a58d8fe6f9e4d1d4","observation_id":"0fdf94d3-d15b-4f2c-90d6-0d5ded89b42b","resolution":{"observed_at":"2026-08-05T05:50:17.811973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2409.13689/citation-record","integrity":"/paper/2409.13689/integrity","json":"/paper/2409.13689/citation-record.json","paper":"/paper/2409.13689"},"outbound":[],"paper":{"arxiv_id":"2409.13689","last_updated":"2024-09-20T17:59:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T13:16:47.187765Z","submitted_at":"2024-09-20T17:59:01Z","title":"Temporally Aligned Audio for Video with Autoregression"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2409.13689."}