{"as_of":"2026-08-06T06:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d791bb3cf6277149300aa3ee7a194c1732e1734c0eb972b59f242c179bc03cf4","coverage":[{"denominator":4,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T17:14:30.737975Z","state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:12:38.636242Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T00:07:28.033897Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.08540","last_updated":"2026-04-09T17:59:39Z","snapshot_observed_at":"2026-08-02T21:13:25.946486Z","submitted_at":"2026-04-09T17:59:39Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","version":1},"cited_work":{"arxiv_id":"2604.08540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08540","snapshot_observed_at":"2026-07-03T00:07:28.033897Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","venue":"cs.CV","work_id":"49aa4820-3ca7-4ee9-bac1-a9a8389e5c56","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-20T05:17:11.690484Z"},"links":{"cited_paper":"/paper/2604.08540","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:eb2346abf170d8ff8e174d0ea1da8113f39d30d72e75c5f69939209e78088376","observation_id":"c33338a2-d954-4107-b7b0-0dd9b784a88d","resolution":{"observed_at":"2026-05-20T05:18:03.141127Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08540","last_updated":"2026-04-09T17:59:39Z","snapshot_observed_at":"2026-08-02T21:13:25.946486Z","submitted_at":"2026-04-09T17:59:39Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","version":1},"cited_work":{"arxiv_id":"2604.08540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08540","snapshot_observed_at":"2026-07-03T00:07:28.033897Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","venue":"cs.CV","work_id":"49aa4820-3ca7-4ee9-bac1-a9a8389e5c56","year":2026},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2604.08540","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:0e20f0d337004cfa0a68150647c63f6816633b1de6263e2172e6f723195782cd","observation_id":"b84a4872-0c4f-4c41-8d7e-56515dd02d73","resolution":{"observed_at":"2026-06-30T18:04:58.018320Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08540","last_updated":"2026-04-09T17:59:39Z","snapshot_observed_at":"2026-08-02T21:13:25.946486Z","submitted_at":"2026-04-09T17:59:39Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","version":1},"cited_work":{"arxiv_id":"2604.08540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08540","snapshot_observed_at":"2026-07-03T00:07:28.033897Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","venue":"cs.CV","work_id":"49aa4820-3ca7-4ee9-bac1-a9a8389e5c56","year":2026},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2604.08540","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:97be29b8eef1c1e44029190aa4ca2bc6cabae24d99553aba0ce886183be9273e","observation_id":"d79a1bdf-ff4d-40bd-8840-ff993681a2cc","resolution":{"observed_at":"2026-06-29T22:54:00.796273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08540","last_updated":"2026-04-09T17:59:39Z","snapshot_observed_at":"2026-08-02T21:13:25.946486Z","submitted_at":"2026-04-09T17:59:39Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","version":1},"cited_work":{"arxiv_id":"2604.08540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08540","snapshot_observed_at":"2026-07-03T00:07:28.033897Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","venue":"cs.CV","work_id":"49aa4820-3ca7-4ee9-bac1-a9a8389e5c56","year":2026},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2604.08540","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:bc7aa74f4b157037425d49538224b9df2e50bab19ac5aa86aa6b0ecceed9f0ba","observation_id":"d12b254e-ca36-4bfe-9343-83bba87a0e4f","resolution":{"observed_at":"2026-06-29T13:03:26.186447Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08540","last_updated":"2026-04-09T17:59:39Z","snapshot_observed_at":"2026-08-02T21:13:25.946486Z","submitted_at":"2026-04-09T17:59:39Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","version":1},"cited_work":{"arxiv_id":"2604.08540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08540","snapshot_observed_at":"2026-07-03T00:07:28.033897Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","venue":"cs.CV","work_id":"49aa4820-3ca7-4ee9-bac1-a9a8389e5c56","year":2026},"citing_paper":{"arxiv_id":"2606.09639","last_updated":"2026-06-11T05:58:22Z","snapshot_observed_at":"2026-08-02T02:07:05.154330Z","submitted_at":"2026-06-08T15:35:51Z","title":"CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video Generation","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-06-27T17:30:25.371658Z"},"links":{"cited_paper":"/paper/2604.08540","citing_paper":"/paper/2606.09639"},"observation_digest":"sha256:0c47d470f78fb411c14d3369d1880d468b55a443eb5135defd2460b6ea3fc959","observation_id":"5608c485-f48a-466a-80eb-12584f0683b4","resolution":{"observed_at":"2026-07-03T00:07:28.035378Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08540","last_updated":"2026-04-09T17:59:39Z","snapshot_observed_at":"2026-08-02T21:13:25.946486Z","submitted_at":"2026-04-09T17:59:39Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08540","snapshot_observed_at":"2026-08-02T03:12:38.636242Z","title":"multi-reference","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-05T21:57:16.823101Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:38.636242Z"},"links":{"cited_paper":"/paper/2604.08540","citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:defcacb0b68a6db99908f61a95c99cd2ce6e7427de5afdd9ee46eb07e1e47ad4","observation_id":"8644857c-5477-4bd8-acac-4277519854e5","resolution":{"observed_at":"2026-08-02T03:12:38.636242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.08540/citation-record","integrity":"/paper/2604.08540/integrity","json":"/paper/2604.08540/citation-record.json","paper":"/paper/2604.08540"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.03034","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:49:57.634012Z","title":"Accessed: 2024-02-15","venue":null,"work_id":"99b70266-5b17-4136-a20b-997630aace19","year":2025},"citing_paper":{"arxiv_id":"2604.08540","last_updated":"2026-04-09T17:59:39Z","snapshot_observed_at":"2026-08-02T21:13:25.946486Z","submitted_at":"2026-04-09T17:59:39Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T17:14:30.737975Z"},"links":{"citing_paper":"/paper/2604.08540"},"observation_digest":"sha256:5961df0cc840b9bbbc8847a8aba868caa0e8e94a1f3fb3ecfc124f823a9e4b3b","observation_id":"40a9edcf-d16f-4b87-a7ae-9fa34872c127","resolution":{"observed_at":"2026-05-11T07:16:05.652003Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2604.08540","last_updated":"2026-04-09T17:59:39Z","snapshot_observed_at":"2026-08-02T21:13:25.946486Z","submitted_at":"2026-04-09T17:59:39Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T17:14:30.737975Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2604.08540"},"observation_digest":"sha256:8b3ec9bad5cbeeffc1c6f926fdbec538302f1ac55dfcfafad65436b053ebf447","observation_id":"9000eaa8-df4c-4b49-ac77-9d85d0512ddc","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"• Rationale:Determining ”which voice sounds more natural” is cognitively easier and more consistent via side-by-side comparison than absolute scoring","venue":null,"work_id":"eb7a288e-2b49-45d0-b744-f1e38af1fe19","year":null},"citing_paper":{"arxiv_id":"2604.08540","last_updated":"2026-04-09T17:59:39Z","snapshot_observed_at":"2026-08-02T21:13:25.946486Z","submitted_at":"2026-04-09T17:59:39Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T17:14:30.737975Z"},"links":{"citing_paper":"/paper/2604.08540"},"observation_digest":"sha256:a61526fb235ed530848b2aa2cae0beea74117cc31782231874b92c45b399dc85","observation_id":"7591e2a6-9cc8-45bc-a135-133d408a960e","resolution":{"observed_at":"2026-05-17T11:24:31.869996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A pairwise comparison might result in a ”Tie” if both models produce gibberish, failing to capture the absolute failure","venue":null,"work_id":"7249c9d6-cd81-4f51-b8af-775ebf909c18","year":null},"citing_paper":{"arxiv_id":"2604.08540","last_updated":"2026-04-09T17:59:39Z","snapshot_observed_at":"2026-08-02T21:13:25.946486Z","submitted_at":"2026-04-09T17:59:39Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T17:14:30.737975Z"},"links":{"citing_paper":"/paper/2604.08540"},"observation_digest":"sha256:b6a4888d286f4b3f67c37b44a83f0cb3d396a84171969e267c0296baf030e180","observation_id":"aea2f8a1-d7cf-43e9-a49f-357c122fbc55","resolution":{"observed_at":"2026-05-17T11:24:31.873429Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.08540","last_updated":"2026-04-09T17:59:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T21:13:25.946486Z","submitted_at":"2026-04-09T17:59:39Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation"},"reference_resolution":{"displayed":4,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":4},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 4 of 4 outbound references and 6 inbound Pith citation observations for arXiv:2604.08540."}