{"as_of":"2026-08-09T13:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7d53c7ba41b18ca32f3c92a8e2cf60e4be5079063764fb75462840ed7291b84e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":5,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":5,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:26:46.705357Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T13:11:23.797787Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.05551","last_updated":"2024-12-26T15:23:36Z","snapshot_observed_at":"2026-07-31T15:22:41.072708Z","submitted_at":"2024-07-08T01:59:17Z","title":"Read, Watch and Scream! Sound Generation from Text and Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05551","snapshot_observed_at":"2026-08-08T14:26:46.705357Z","title":"Read, watch and scream! sound generation from text and video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06782","last_updated":"2025-02-12T10:07:07Z","snapshot_observed_at":"2026-08-08T14:18:27.556352Z","submitted_at":"2025-02-10T18:58:11Z","title":"Lumina-Video: Efficient and Flexible Video Generation with Multi-scale Next-DiT","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T14:26:46.705357Z"},"links":{"cited_paper":"/paper/2407.05551","citing_paper":"/paper/2502.06782"},"observation_digest":"sha256:a6611237d43d0d2d627da4714fa08515f546dc70fbb4f4f5703680d5a9f6c47e","observation_id":"b73e3130-6b2a-48b9-8788-c5136e7682a8","resolution":{"observed_at":"2026-08-08T14:26:46.705357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05551","last_updated":"2024-12-26T15:23:36Z","snapshot_observed_at":"2026-07-31T15:22:41.072708Z","submitted_at":"2024-07-08T01:59:17Z","title":"Read, Watch and Scream! Sound Generation from Text and Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05551","snapshot_observed_at":"2026-08-07T15:09:55.831770Z","title":"Read, watch and scream! sound generation from text and video,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.831770Z"},"links":{"cited_paper":"/paper/2407.05551","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:dab28ba7f6e0d6c92377fb97b594feb68beadadc2ed285db545ab5af1110cf9e","observation_id":"110c6b42-6d76-4411-a425-12ee6748e1f7","resolution":{"observed_at":"2026-08-07T15:09:55.831770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05551","last_updated":"2024-12-26T15:23:36Z","snapshot_observed_at":"2026-07-31T15:22:41.072708Z","submitted_at":"2024-07-08T01:59:17Z","title":"Read, Watch and Scream! Sound Generation from Text and Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05551","snapshot_observed_at":"2026-08-06T20:37:17.308243Z","title":"Read, watch and scream! sound generation from text and video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-08T12:03:28.548055Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:17.308243Z"},"links":{"cited_paper":"/paper/2407.05551","citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:f111b7b8289ee912d3982e6c10ecae855deeae225db14dc2efcedab9c9c36de3","observation_id":"4f00a0c2-f96d-4e06-944f-345201604a8e","resolution":{"observed_at":"2026-08-06T20:37:17.308243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05551","last_updated":"2024-12-26T15:23:36Z","snapshot_observed_at":"2026-07-31T15:22:41.072708Z","submitted_at":"2024-07-08T01:59:17Z","title":"Read, Watch and Scream! Sound Generation from Text and Video","version":2},"cited_work":{"arxiv_id":"2407.05551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05551","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Read, watch and scream! sound generation from text and video","venue":null,"work_id":"b48ab638-19b9-4686-a907-5b0a77be79e5","year":2024},"citing_paper":{"arxiv_id":"2509.23727","last_updated":"2026-04-09T14:19:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T08:12:43Z","title":"AudioMoG: Guiding Audio Generation with Mixture-of-Guidance","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-18T13:10:18.700497Z"},"links":{"cited_paper":"/paper/2407.05551","citing_paper":"/paper/2509.23727"},"observation_digest":"sha256:955ef7a0af83936f65f5b93f78db031878001afa3693d8a758aa21b7e0323dfe","observation_id":"689c51ec-fe7f-4d5f-a2af-89429960d0d5","resolution":{"observed_at":"2026-05-18T13:11:23.800632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05551","last_updated":"2024-12-26T15:23:36Z","snapshot_observed_at":"2026-07-31T15:22:41.072708Z","submitted_at":"2024-07-08T01:59:17Z","title":"Read, Watch and Scream! Sound Generation from Text and Video","version":2},"cited_work":{"arxiv_id":"2407.05551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05551","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Read, watch and scream! sound generation from text and video","venue":null,"work_id":"b48ab638-19b9-4686-a907-5b0a77be79e5","year":2024},"citing_paper":{"arxiv_id":"2510.09065","last_updated":"2026-04-17T15:00:46Z","snapshot_observed_at":"2026-07-06T22:32:17.816175Z","submitted_at":"2025-10-10T07:13:06Z","title":"MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T08:20:02.986562Z"},"links":{"cited_paper":"/paper/2407.05551","citing_paper":"/paper/2510.09065"},"observation_digest":"sha256:7b40bde34b13ca24791787bf7a6b17323970af699e0852cf7b5b915d7d4363b5","observation_id":"4573399d-1415-4678-a0fc-f8bc7dbd131b","resolution":{"observed_at":"2026-05-18T08:21:06.812467Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2407.05551/citation-record","integrity":"/paper/2407.05551/integrity","json":"/paper/2407.05551/citation-record.json","paper":"/paper/2407.05551"},"outbound":[],"paper":{"arxiv_id":"2407.05551","last_updated":"2024-12-26T15:23:36Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-31T15:22:41.072708Z","submitted_at":"2024-07-08T01:59:17Z","title":"Read, Watch and Scream! Sound Generation from Text and Video"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 5 inbound Pith citation observations for arXiv:2407.05551."}