{"as_of":"2026-08-10T11:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf8f65867cfdf40e7fbc8ac07aef2cb03b135faa1c0a9791920398b3151b986a","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:02:31.138343Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04902/citation-record","integrity":"/paper/2608.04902/integrity","json":"/paper/2608.04902/citation-record.json","paper":"/paper/2608.04902"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:02:31.495057Z","title":"The Million Song Dataset","venue":null,"work_id":"08d22f77-56ec-43ab-9c8d-9a789b1c6c6f","year":2011},"citing_paper":{"arxiv_id":"2608.04902","last_updated":"2026-08-05T14:28:05Z","snapshot_observed_at":"2026-08-08T23:13:24.230013Z","submitted_at":"2026-08-05T14:28:05Z","title":"Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:02:31.067776Z"},"links":{"citing_paper":"/paper/2608.04902"},"observation_digest":"sha256:deeb629c9c8f4c9505efe8c9eb3d70054ee0204c518e8080237c89c8e6eddf60","observation_id":"45471de0-2efc-470e-b0c4-ccd50d499613","resolution":{"observed_at":"2026-08-06T14:02:31.499333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:02:31.424965Z","title":"InICCV, 4195–4205","venue":null,"work_id":"6a4dbb4d-80a8-4906-9cf7-d75814930b01","year":2021},"citing_paper":{"arxiv_id":"2608.04902","last_updated":"2026-08-05T14:28:05Z","snapshot_observed_at":"2026-08-08T23:13:24.230013Z","submitted_at":"2026-08-05T14:28:05Z","title":"Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:02:31.094932Z"},"links":{"citing_paper":"/paper/2608.04902"},"observation_digest":"sha256:96eb627c07794f20ef2d3c468693ba16863ba5dac40005007aa28eb625bc41d4","observation_id":"02dce2a7-0f15-4d4f-9322-65f13d136b38","resolution":{"observed_at":"2026-08-06T14:02:31.429678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16930","last_updated":"2025-08-23T07:30:18Z","snapshot_observed_at":"2026-08-09T16:55:24.799888Z","submitted_at":"2025-08-23T07:30:18Z","title":"HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.16930","snapshot_observed_at":"2026-08-06T14:02:31.099756Z","title":"arXiv:2508.16930","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04902","last_updated":"2026-08-05T14:28:05Z","snapshot_observed_at":"2026-08-08T23:13:24.230013Z","submitted_at":"2026-08-05T14:28:05Z","title":"Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:02:31.099756Z"},"links":{"cited_paper":"/paper/2508.16930","citing_paper":"/paper/2608.04902"},"observation_digest":"sha256:695038d9620c8c7cffa695a8a47c828d08a661df2e0739015d93781e2b2dc615","observation_id":"dfdb8c95-54b5-42cc-bb6f-9ceff5005d74","resolution":{"observed_at":"2026-08-06T14:02:31.099756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:02:31.410355Z","title":"InICASSP, 1–5","venue":null,"work_id":"82a13283-3b51-4685-867d-001f8237bad3","year":2021},"citing_paper":{"arxiv_id":"2608.04902","last_updated":"2026-08-05T14:28:05Z","snapshot_observed_at":"2026-08-08T23:13:24.230013Z","submitted_at":"2026-08-05T14:28:05Z","title":"Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:02:31.104491Z"},"links":{"citing_paper":"/paper/2608.04902"},"observation_digest":"sha256:b572cceb426ac8bb2e74efbaf9c28c3a52e1497d06527da423fb7df0a5ad997f","observation_id":"2b52b8b3-99e7-4d01-add4-fafc8a8e1fea","resolution":{"observed_at":"2026-08-06T14:02:31.414717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:02:31.381852Z","title":null,"venue":null,"work_id":"28a530a3-f2bd-48fb-bc30-36f12629817c","year":2019},"citing_paper":{"arxiv_id":"2608.04902","last_updated":"2026-08-05T14:28:05Z","snapshot_observed_at":"2026-08-08T23:13:24.230013Z","submitted_at":"2026-08-05T14:28:05Z","title":"Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:02:31.112670Z"},"links":{"citing_paper":"/paper/2608.04902"},"observation_digest":"sha256:55b6c63d1af2bc30b7b6ab8cd40ef218f054d09123fc88d31991ac998d8bcaf1","observation_id":"3945e800-7001-402d-8428-18eb7951b55e","resolution":{"observed_at":"2026-08-06T14:02:31.386492Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:02:31.367249Z","title":"InICML, 62596–62626","venue":null,"work_id":"24698955-3cc7-44c0-bc9b-d76cacfc52fa","year":2023},"citing_paper":{"arxiv_id":"2608.04902","last_updated":"2026-08-05T14:28:05Z","snapshot_observed_at":"2026-08-08T23:13:24.230013Z","submitted_at":"2026-08-05T14:28:05Z","title":"Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:02:31.117017Z"},"links":{"citing_paper":"/paper/2608.04902"},"observation_digest":"sha256:e576abace4b55849f2180065e66171f5eb7e35f43c81b634d78ddaeffe55f5f6","observation_id":"6c0ff6be-6ef1-4bc6-9df1-5f6eb67ecdd7","resolution":{"observed_at":"2026-08-06T14:02:31.371486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07464","last_updated":"2025-03-11T15:57:51Z","snapshot_observed_at":"2026-08-10T02:39:03.412777Z","submitted_at":"2024-07-10T08:40:39Z","title":"Video-to-Audio Generation with Hidden Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07464","snapshot_observed_at":"2026-08-06T14:02:31.121546Z","title":"arXiv:2407.07464","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04902","last_updated":"2026-08-05T14:28:05Z","snapshot_observed_at":"2026-08-08T23:13:24.230013Z","submitted_at":"2026-08-05T14:28:05Z","title":"Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:02:31.121546Z"},"links":{"cited_paper":"/paper/2407.07464","citing_paper":"/paper/2608.04902"},"observation_digest":"sha256:2a89ce164d6f34bcd886a5c46adc48ae879838d2e951cc35f2c4f947236a4f15","observation_id":"66eed211-a3b8-45f9-88d3-94138eb509cb","resolution":{"observed_at":"2026-08-06T14:02:31.121546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:02:31.306415Z","title":"baby crying","venue":null,"work_id":"0361a6cd-ae12-4153-89ba-da4a770d23ce","year":2023},"citing_paper":{"arxiv_id":"2608.04902","last_updated":"2026-08-05T14:28:05Z","snapshot_observed_at":"2026-08-08T23:13:24.230013Z","submitted_at":"2026-08-05T14:28:05Z","title":"Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:02:31.138343Z"},"links":{"citing_paper":"/paper/2608.04902"},"observation_digest":"sha256:2f7d92af97b3711f118f5bacfa01749266f25911716478b294c5a156d52c90f4","observation_id":"6a24dab8-44da-4224-8599-e384618994c1","resolution":{"observed_at":"2026-08-06T14:02:31.310949Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:02:31.320639Z","title":"Snake ac- tivation functions are applied throughout the network, and no final tanh activation is used in the decoder","venue":null,"work_id":"ba9960b4-c05e-49e5-b869-4feccae120eb","year":2024},"citing_paper":{"arxiv_id":"2608.04902","last_updated":"2026-08-05T14:28:05Z","snapshot_observed_at":"2026-08-08T23:13:24.230013Z","submitted_at":"2026-08-05T14:28:05Z","title":"Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation","version":1},"reference_index":640,"source":"pdf_text","source_observed_at":"2026-08-06T14:02:31.134405Z"},"links":{"citing_paper":"/paper/2608.04902"},"observation_digest":"sha256:e7e41bbb42d29ff2cd6b074160a4fb61e29a1f33a3ea8214200bc48adf5a1999","observation_id":"c311c4f5-a012-47b8-ba7a-5376eeac1565","resolution":{"observed_at":"2026-08-06T14:02:31.326121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:02:31.481217Z","title":"K.; Ishii, M.; Hayakawa, A.; Shibuya, T.; Schwing, A.; andMitsufuji,Y.2025.MMAudio:TamingMultimodalJointTrain- ing for High-Quality Video-to-Audio Synthesis","venue":null,"work_id":"ccfd0bb3-4876-4e3f-818e-f0ba97a2f0bf","year":2025},"citing_paper":{"arxiv_id":"2608.04902","last_updated":"2026-08-05T14:28:05Z","snapshot_observed_at":"2026-08-08T23:13:24.230013Z","submitted_at":"2026-08-05T14:28:05Z","title":"Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation","version":1},"reference_index":725,"source":"pdf_text","source_observed_at":"2026-08-06T14:02:31.072369Z"},"links":{"citing_paper":"/paper/2608.04902"},"observation_digest":"sha256:7cb28285e8215bc4a0b7d0d73fa98926a8957f6b6ef497abab3f07a5e13f8635","observation_id":"dd7e5510-caa3-461c-95c7-a3634daa1938","resolution":{"observed_at":"2026-08-06T14:02:31.485720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:02:31.336952Z","title":"Dataset Task Hours (h) Source AudioCaps T2A 109 (Kim et al","venue":null,"work_id":"60478e09-3751-4c7f-9640-ce67fe9c41c2","year":2011},"citing_paper":{"arxiv_id":"2608.04902","last_updated":"2026-08-05T14:28:05Z","snapshot_observed_at":"2026-08-08T23:13:24.230013Z","submitted_at":"2026-08-05T14:28:05Z","title":"Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-06T14:02:31.130418Z"},"links":{"citing_paper":"/paper/2608.04902"},"observation_digest":"sha256:94a71495269b247902edfed6d9271731c0873c20e6cdfaf34bc5cf3ddca96c61","observation_id":"6f2360e0-6179-4b73-99c8-0f77d5b01876","resolution":{"observed_at":"2026-08-06T14:02:31.341681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:02:31.453573Z","title":"In ICASSP, 776–780","venue":null,"work_id":"3df1100a-80ba-42b6-86fe-4e736dcdf5d6","year":2023},"citing_paper":{"arxiv_id":"2608.04902","last_updated":"2026-08-05T14:28:05Z","snapshot_observed_at":"2026-08-08T23:13:24.230013Z","submitted_at":"2026-08-05T14:28:05Z","title":"Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T14:02:31.086327Z"},"links":{"citing_paper":"/paper/2608.04902"},"observation_digest":"sha256:bcbda49db1b3df1cfd5295f885cb555f24648a90c8bdeebc0666c3153a6013ad","observation_id":"e5e2d683-b662-418a-8a5c-cffad615da28","resolution":{"observed_at":"2026-08-06T14:02:31.458005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:02:31.351890Z","title":"InECCV, 570–586","venue":null,"work_id":"d95e0d47-228d-45a7-9920-22fcd8bdd94b","year":2020},"citing_paper":{"arxiv_id":"2608.04902","last_updated":"2026-08-05T14:28:05Z","snapshot_observed_at":"2026-08-08T23:13:24.230013Z","submitted_at":"2026-08-05T14:28:05Z","title":"Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T14:02:31.126304Z"},"links":{"citing_paper":"/paper/2608.04902"},"observation_digest":"sha256:6005ac490dddfa98b9d5dc4c1c416c64e6ab7f5174c504cd764b2e49b5e8a2be","observation_id":"2f9cbe26-a44d-4c5a-8ffd-a1aca9ac9a19","resolution":{"observed_at":"2026-08-06T14:02:31.356595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:02:31.439332Z","title":"InICML, 21450–21474","venue":null,"work_id":"4a980b18-6cd7-4798-bd50-6c0c865d7f22","year":2026},"citing_paper":{"arxiv_id":"2608.04902","last_updated":"2026-08-05T14:28:05Z","snapshot_observed_at":"2026-08-08T23:13:24.230013Z","submitted_at":"2026-08-05T14:28:05Z","title":"Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T14:02:31.090647Z"},"links":{"citing_paper":"/paper/2608.04902"},"observation_digest":"sha256:5a8e63c39d5bf8f2f7202ebd2993f11f47b7bb10b704ebac90a72ed01b1988d7","observation_id":"301fe667-d513-4690-8b29-1bcc1ac6b95f","resolution":{"observed_at":"2026-08-06T14:02:31.443727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:02:31.395847Z","title":"InICML, 46804–46822","venue":null,"work_id":"73f66639-b40a-4bf9-8a8d-7ca9c2f83a71","year":1988},"citing_paper":{"arxiv_id":"2608.04902","last_updated":"2026-08-05T14:28:05Z","snapshot_observed_at":"2026-08-08T23:13:24.230013Z","submitted_at":"2026-08-05T14:28:05Z","title":"Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T14:02:31.108705Z"},"links":{"citing_paper":"/paper/2608.04902"},"observation_digest":"sha256:4d68e00c2537f817e414e6e2f2a07a78c2ce3ee6e27a523beb303ad6ac1da4e4","observation_id":"5de61743-68ed-4801-ae66-0c8a82a90731","resolution":{"observed_at":"2026-08-06T14:02:31.400600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:02:31.467372Z","title":null,"venue":null,"work_id":"296126d2-f783-4ef0-8ccf-eca255ecb6b5","year":2013},"citing_paper":{"arxiv_id":"2608.04902","last_updated":"2026-08-05T14:28:05Z","snapshot_observed_at":"2026-08-08T23:13:24.230013Z","submitted_at":"2026-08-05T14:28:05Z","title":"Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T14:02:31.081777Z"},"links":{"citing_paper":"/paper/2608.04902"},"observation_digest":"sha256:bb28c38b40e809df41cf075c98db260e436f16269431c3d4e9799c9acd7fd257","observation_id":"7e551071-0bbc-4330-9fb5-20bc92722f03","resolution":{"observed_at":"2026-08-06T14:02:31.471592Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2606.15956","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:02:31.287161Z","title":"arXiv:2606.15956","venue":null,"work_id":"fb4c9d4f-9e8d-4bef-93c1-45fc8860a2d0","year":null},"citing_paper":{"arxiv_id":"2608.04902","last_updated":"2026-08-05T14:28:05Z","snapshot_observed_at":"2026-08-08T23:13:24.230013Z","submitted_at":"2026-08-05T14:28:05Z","title":"Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-06T14:02:31.076800Z"},"links":{"citing_paper":"/paper/2608.04902"},"observation_digest":"sha256:05d805bb0f8dd47b2a51946db7e315f00d9077dddf11f119da89679174c91ec2","observation_id":"3cdb3f24-129f-4066-a256-8e4cced7f829","resolution":{"observed_at":"2026-08-06T14:02:31.296477Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.04902","last_updated":"2026-08-05T14:28:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T23:13:24.230013Z","submitted_at":"2026-08-05T14:28:05Z","title":"Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 0 inbound Pith citation observations for arXiv:2608.04902."}