{"as_of":"2026-08-07T01:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f54a020bcbf9bd57b388c73e6e84df8e53efe144244f70006b8ea8f67e8eb440","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:13:52.600060Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":6,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.17395","last_updated":"2024-07-18T22:20:31Z","snapshot_observed_at":"2026-07-06T15:10:08.462773Z","submitted_at":"2023-03-30T14:07:47Z","title":"WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research","version":2},"cited_work":{"arxiv_id":"2303.17395","doi":"10.48550/arxiv.2303.17395","metadata_source":"pith","pith_arxiv_id":"2303.17395","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavCaps : A ChatGPT -assisted weakly-labelled audio captioning dataset for audio-language multimodal research","venue":"eess.AS","work_id":"f26ff948-0db7-4e7f-80f9-0f137afa72a7","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2303.17395","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:95cb585345ca422deef7808c1bb842096e8c69bd19d5fb5bdfaeae23a778140c","observation_id":"e00eb565-7121-43ac-9e4b-f5ca2226e330","resolution":{"observed_at":"2026-05-16T02:56:42.641261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17395","last_updated":"2024-07-18T22:20:31Z","snapshot_observed_at":"2026-07-06T15:10:08.462773Z","submitted_at":"2023-03-30T14:07:47Z","title":"WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research","version":2},"cited_work":{"arxiv_id":"2303.17395","doi":"10.48550/arxiv.2303.17395","metadata_source":"pith","pith_arxiv_id":"2303.17395","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavCaps : A ChatGPT -assisted weakly-labelled audio captioning dataset for audio-language multimodal research","venue":"eess.AS","work_id":"f26ff948-0db7-4e7f-80f9-0f137afa72a7","year":2023},"citing_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"reference_index":275,"source":"pdf_text","source_observed_at":"2026-05-19T20:28:38.900026Z"},"links":{"cited_paper":"/paper/2303.17395","citing_paper":"/paper/2307.06435"},"observation_digest":"sha256:6b561df1acbf71d46f5944d8213fc1003930d5a66dc0f7f6a143815d7fe2d706","observation_id":"4d86672d-158f-4db5-897e-765259e9911e","resolution":{"observed_at":"2026-05-19T20:28:39.229271Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17395","last_updated":"2024-07-18T22:20:31Z","snapshot_observed_at":"2026-07-06T15:10:08.462773Z","submitted_at":"2023-03-30T14:07:47Z","title":"WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research","version":2},"cited_work":{"arxiv_id":"2303.17395","doi":"10.48550/arxiv.2303.17395","metadata_source":"pith","pith_arxiv_id":"2303.17395","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavCaps : A ChatGPT -assisted weakly-labelled audio captioning dataset for audio-language multimodal research","venue":"eess.AS","work_id":"f26ff948-0db7-4e7f-80f9-0f137afa72a7","year":2023},"citing_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-18T02:29:46.242983Z"},"links":{"cited_paper":"/paper/2303.17395","citing_paper":"/paper/2310.13289"},"observation_digest":"sha256:a92414e7c703162dd386d7f251ba89f0c6d00c2b37c69e3795e22091d6e5d557","observation_id":"06a0a052-5378-44a7-8f70-e2a218a0ab74","resolution":{"observed_at":"2026-05-18T02:29:46.317296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17395","last_updated":"2024-07-18T22:20:31Z","snapshot_observed_at":"2026-07-06T15:10:08.462773Z","submitted_at":"2023-03-30T14:07:47Z","title":"WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research","version":2},"cited_work":{"arxiv_id":"2303.17395","doi":"10.48550/arxiv.2303.17395","metadata_source":"pith","pith_arxiv_id":"2303.17395","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavCaps : A ChatGPT -assisted weakly-labelled audio captioning dataset for audio-language multimodal research","venue":"eess.AS","work_id":"f26ff948-0db7-4e7f-80f9-0f137afa72a7","year":2023},"citing_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T02:44:53.284345Z"},"links":{"cited_paper":"/paper/2303.17395","citing_paper":"/paper/2406.07476"},"observation_digest":"sha256:dd8b15cba1fee7c44f1939f228260253df8cb772c912080a2f3bf9c3b8bbb393","observation_id":"6a592bd0-e2d4-47da-a507-a6e6606fd5df","resolution":{"observed_at":"2026-05-11T02:44:53.586093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17395","last_updated":"2024-07-18T22:20:31Z","snapshot_observed_at":"2026-07-06T15:10:08.462773Z","submitted_at":"2023-03-30T14:07:47Z","title":"WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research","version":2},"cited_work":{"arxiv_id":"2303.17395","doi":"10.48550/arxiv.2303.17395","metadata_source":"pith","pith_arxiv_id":"2303.17395","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavCaps : A ChatGPT -assisted weakly-labelled audio captioning dataset for audio-language multimodal research","venue":"eess.AS","work_id":"f26ff948-0db7-4e7f-80f9-0f137afa72a7","year":2023},"citing_paper":{"arxiv_id":"2606.02739","last_updated":"2026-06-01T18:05:18Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T18:05:18Z","title":"EntangleCodec: A Unified Discrete Audio Tokenizer via Semantic-Acoustic Entanglement","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-28T12:34:06.024192Z"},"links":{"cited_paper":"/paper/2303.17395","citing_paper":"/paper/2606.02739"},"observation_digest":"sha256:feff87b5af40624f2e2107c1d8a854cf6d4f16a4f621a776b89a68356ef60c47","observation_id":"f421ccc4-8eac-4592-a2c8-eb53ca8900b1","resolution":{"observed_at":"2026-06-28T12:42:08.965410Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17395","last_updated":"2024-07-18T22:20:31Z","snapshot_observed_at":"2026-07-06T15:10:08.462773Z","submitted_at":"2023-03-30T14:07:47Z","title":"WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research","version":2},"cited_work":{"arxiv_id":"2303.17395","doi":"10.48550/arxiv.2303.17395","metadata_source":"pith","pith_arxiv_id":"2303.17395","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavCaps : A ChatGPT -assisted weakly-labelled audio captioning dataset for audio-language multimodal research","venue":"eess.AS","work_id":"f26ff948-0db7-4e7f-80f9-0f137afa72a7","year":2023},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":287,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2303.17395","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:cc6a43137adc8781ebe9988adf7202f9706af745883459f25e35e110a8c41758","observation_id":"9d8406a0-425f-411c-8591-7d69b41a268f","resolution":{"observed_at":"2026-07-04T06:39:37.644127Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17395","last_updated":"2024-07-18T22:20:31Z","snapshot_observed_at":"2026-07-06T15:10:08.462773Z","submitted_at":"2023-03-30T14:07:47Z","title":"WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research","version":2},"cited_work":{"arxiv_id":"2303.17395","doi":"10.48550/arxiv.2303.17395","metadata_source":"pith","pith_arxiv_id":"2303.17395","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavCaps : A ChatGPT -assisted weakly-labelled audio captioning dataset for audio-language multimodal research","venue":"eess.AS","work_id":"f26ff948-0db7-4e7f-80f9-0f137afa72a7","year":2023},"citing_paper":{"arxiv_id":"2607.07222","last_updated":"2026-07-08T10:04:58Z","snapshot_observed_at":"2026-08-03T07:57:48.453935Z","submitted_at":"2026-07-08T10:04:58Z","title":"Quantum Computing : A New Frontier for Science and Society","version":1},"reference_index":191,"source":"arxiv_source","source_observed_at":"2026-07-09T17:01:49.230563Z"},"links":{"cited_paper":"/paper/2303.17395","citing_paper":"/paper/2607.07222"},"observation_digest":"sha256:17a5a1abed4ace3f36949e507c445bc00a79ee3add6e1817c900e7c6e96fd896","observation_id":"fbf7f9ca-b8b5-41f9-bfeb-b9bb79684f0e","resolution":{"observed_at":"2026-07-09T17:06:21.742250Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17395","last_updated":"2024-07-18T22:20:31Z","snapshot_observed_at":"2026-07-06T15:10:08.462773Z","submitted_at":"2023-03-30T14:07:47Z","title":"WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17395","snapshot_observed_at":"2026-08-01T14:46:36.312770Z","title":"Plumbley, Yuexian Zou, and Wenwu Wang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-06T07:56:47.796949Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:36.312770Z"},"links":{"cited_paper":"/paper/2303.17395","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:d50a51be90dd1eb2912e48c3d930fd5e5e1368922fc49e0f2b7ade376b2f157f","observation_id":"97cd49ab-0e2e-4030-b8c0-f60474ab909f","resolution":{"observed_at":"2026-08-01T14:46:36.312770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17395","last_updated":"2024-07-18T22:20:31Z","snapshot_observed_at":"2026-07-06T15:10:08.462773Z","submitted_at":"2023-03-30T14:07:47Z","title":"WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17395","snapshot_observed_at":"2026-08-07T00:13:52.600060Z","title":"Niklas Muennighoff, Nouamane Tazi, Loïc Magne, and Nils Reimers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-07T00:07:02.163437Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:52.600060Z"},"links":{"cited_paper":"/paper/2303.17395","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:da61ea7761561a95e07fa3f5eaf6c22669cfd4bec86a0096fa482fa257cfc322","observation_id":"a028c132-d4b3-4f80-80f1-0c0b5f449658","resolution":{"observed_at":"2026-08-07T00:13:52.600060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2303.17395/citation-record","integrity":"/paper/2303.17395/integrity","json":"/paper/2303.17395/citation-record.json","paper":"/paper/2303.17395"},"outbound":[],"paper":{"arxiv_id":"2303.17395","last_updated":"2024-07-18T22:20:31Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-06T15:10:08.462773Z","submitted_at":"2023-03-30T14:07:47Z","title":"WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2303.17395."}