{"as_of":"2026-08-08T05:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fb9e665321f3aa56a315ea6dd1c4938c106ab393b4fc03e59d25686dc45c623f","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:01:35.993878Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:01:33.023609Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:01:36.150100Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"cited_work":{"arxiv_id":"2506.00800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00800","snapshot_observed_at":"2026-08-07T12:01:36.150100Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","venue":"eess.AS","work_id":"f694bd23-1829-4bef-9ce5-018a6384971b","year":2025},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.023609Z"},"links":{"cited_paper":"/paper/2506.00800","citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:51faf0545f24fb8633f837c6fb968e7d8b84901a42f97086d141bd2c97ec42df","observation_id":"d9fec535-2a2f-45d1-8589-33a4efdc3814","resolution":{"observed_at":"2026-08-07T12:01:36.208170Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00800/citation-record","integrity":"/paper/2506.00800/integrity","json":"/paper/2506.00800/citation-record.json","paper":"/paper/2506.00800"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"cited_work":{"arxiv_id":"2506.00800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00800","snapshot_observed_at":"2026-08-07T12:01:36.150100Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","venue":"eess.AS","work_id":"f694bd23-1829-4bef-9ce5-018a6384971b","year":2025},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.023609Z"},"links":{"cited_paper":"/paper/2506.00800","citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:51faf0545f24fb8633f837c6fb968e7d8b84901a42f97086d141bd2c97ec42df","observation_id":"d9fec535-2a2f-45d1-8589-33a4efdc3814","resolution":{"observed_at":"2026-08-07T12:01:36.208170Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.668205Z","title":"Automated Audio Captioning Methods using Pre- trained Language Model Pre-trained language models have been utilized in some stud- ies to improve AAC performance [4–11]","venue":null,"work_id":"d7cf8e78-54ab-426d-a7dd-28ccb93227e5","year":null},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.069426Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:1e17b219a338e4a831e6a02979231fd8642843507cd6c5262f8575e66a9d34de","observation_id":"c26a34a6-401c-444b-b56b-9d4426b7316c","resolution":{"observed_at":"2026-08-07T12:01:40.671760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.658678Z","title":"First, En- CLAP transforms an input audio waveform into a CLAP audio embedding and EnCodec discrete tokens","venue":null,"work_id":"303fdaf7-7f53-433b-874f-562a98b5ff3f","year":null},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.141557Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:cc0399d45531910c742379f6c76bbb508841c483e73eaf9194c4db7195684471","observation_id":"22ad47f7-076f-4c97-94c5-2ddeb94a5f13","resolution":{"observed_at":"2026-08-07T12:01:40.662089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.649312Z","title":null,"venue":null,"work_id":"976a24bf-6496-4b09-9108-00c47670cb32","year":null},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.268808Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:7abb237e3415a62b26c2c488c22a4c9dcf2c6d53d22b2272ca5cd5eba92a8d21","observation_id":"2b899848-a6e9-43d5-a3ab-5cb4e692de14","resolution":{"observed_at":"2026-08-07T12:01:40.652837Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.640403Z","title":"Experimental Setup We conducted experiments on two AAC datasets: Audio- Caps [23] and Clotho [24]","venue":null,"work_id":"e638ba76-fb27-41d5-b6b4-21a3a7be9ee5","year":null},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.325366Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:65d1a94d92f7cc075741a987e6c9be0e9c33fd8877acfbcdbfddfa0a8fd8e870","observation_id":"d9178af3-636b-4d95-b1ab-9fbb316c1c21","resolution":{"observed_at":"2026-08-07T12:01:40.643800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.630388Z","title":"semantic-rich and discrete","venue":null,"work_id":"4c2ffba3-c5ce-4080-af5c-da67baf19f54","year":null},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.360355Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:ef3a317e26933ae399205928065d153c59ca239a053c962bea0d9576658423a7","observation_id":"c9cbd217-355f-43af-8165-8c4a49217fbf","resolution":{"observed_at":"2026-08-07T12:01:40.633679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.621068Z","title":null,"venue":null,"work_id":"b143b796-59e2-4b9c-8d89-87cb7928e5be","year":null},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.427951Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:3b2bc4bb8a58136a2e598372bd2ac1000708d4193062a66681763c652db24fe4","observation_id":"e5b382c7-cdf9-45c2-ae30-53407d95080f","resolution":{"observed_at":"2026-08-07T12:01:40.624033Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.612387Z","title":"Automated audio captioning with recurrent neural networks,","venue":null,"work_id":"0a580d42-6a77-4dcf-b438-8f77c573f16d","year":2017},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.508524Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:737f4b9b8f28d0471797fe8c474cb68e7c9b9e0b546af734c7210d1d1027a3a1","observation_id":"2b8053d3-a6a5-4e22-bdb8-2f33fd944383","resolution":{"observed_at":"2026-08-07T12:01:40.615126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.603713Z","title":"Automated audio captioning: An overview of recent progress and new challenges,","venue":null,"work_id":"0dfeeb9e-3228-417f-b1e6-d745435e7619","year":2022},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.600862Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:d1852ee89e0b273c20c04503110ce061c0f3c97ace896ce6b99e22e5d6dc137a","observation_id":"21aaba24-c546-4ab3-a3fd-5ecc41bf560d","resolution":{"observed_at":"2026-08-07T12:01:40.606743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.593822Z","title":"Beyond the status quo: A contemporary survey of advances and challenges in audio cap- tioning,","venue":null,"work_id":"82b6483d-4701-40b1-9df9-d1ae4017169c","year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.656600Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:27fdcee6d4c8ec553db0ead445496041a87b103a794864bd1bc0c829e82264e4","observation_id":"327d26fd-73b7-45c0-9581-f4d75e449ba1","resolution":{"observed_at":"2026-08-07T12:01:40.597069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.07331","last_updated":"2020-12-14T08:27:36Z","snapshot_observed_at":"2026-07-06T10:24:05.835424Z","submitted_at":"2020-12-14T08:27:36Z","title":"Audio Captioning using Pre-Trained Large-Scale Language Model Guided by Audio-based Similar Caption Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.07331","snapshot_observed_at":"2026-08-07T12:01:33.727705Z","title":"Audio captioning using pre-trained large-scale language model guided by audio-based similar caption retrieval,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.727705Z"},"links":{"cited_paper":"/paper/2012.07331","citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:b09bb13d596bb4dcc3e7eae5f9b34b7ee895ccbe7f9c16889fd67958da81b23f","observation_id":"c32a6fbe-9650-4e07-b6a3-7baa2371cee5","resolution":{"observed_at":"2026-08-07T12:01:33.727705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.583090Z","title":"Automated audio cap- tioning by fine-tuning bart with audioset tags,","venue":null,"work_id":"da7255cd-73e2-4b5f-8de1-57972b7a748c","year":2021},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.801814Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:050ae8ff1085fd49729c7a4cec0f3354072274deb9e1224f356dee3b118ea410","observation_id":"b6605451-fc0a-494c-abe4-d485ddffa251","resolution":{"observed_at":"2026-08-07T12:01:40.586909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.509723Z","title":"Enclap: Combining neural audio codec and audio-text joint embedding for automated audio captioning,","venue":null,"work_id":"43657336-96fe-4c4e-8f5e-9ff132126835","year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.866374Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:4ad85bca1ec1f9003bc9067b2e526f190346c518a07067c686bc3cc198d99297","observation_id":"405f177c-82a0-4e4f-b9b0-fbffb039535e","resolution":{"observed_at":"2026-08-07T12:01:40.572547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.257404Z","title":"Wavcaps: A chatgpt-assisted weakly- labelled audio captioning dataset for audio-language multimodal research,","venue":null,"work_id":"9c9e7128-b0a7-4f7c-ad6e-9980e1866402","year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.905971Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:b9d004497e838eb98318de04cf743091ea0998d3b31aebf3d55d0bfa2a85fbf7","observation_id":"b04eacd2-2fe4-4413-a3e5-caf3b85c35fb","resolution":{"observed_at":"2026-08-07T12:01:40.432143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.195759Z","title":"Improving audio captioning models with fine- grained audio features, text embedding supervision, and llm mix- up augmentation,","venue":null,"work_id":"8fae9209-964d-4057-94fc-cdb97f418ad9","year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:33.966127Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:e594d13ca59050c3d0ac0fa10b224bf8f204e87f7e6ac4ec81466f259277aa80","observation_id":"fd3a5ab3-c46d-4b97-8b81-c063f3e49c89","resolution":{"observed_at":"2026-08-07T12:01:40.220996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:40.081221Z","title":"Recap: Retrieval-augmented audio captioning,","venue":null,"work_id":"5a4b39e4-7ee4-4217-a7eb-be01b77030e7","year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.051316Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:97b5b073506705e5f8389dd83868cd88ae87a4ceb429a02d85a30a508ee6eaf6","observation_id":"0199daa7-7f7b-48a3-8f11-3e7babeef12a","resolution":{"observed_at":"2026-08-07T12:01:40.143102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","snapshot_observed_at":"2026-08-06T10:03:42.383298Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19388","snapshot_observed_at":"2026-08-07T12:01:34.136572Z","title":"Taming data and transformers for audio generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.136572Z"},"links":{"cited_paper":"/paper/2406.19388","citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:2481944edbc0ff1e77ab6a2fc8b76e20545682f85c5a99d25e35875fa957aeef","observation_id":"ab9921c6-7f27-4813-8fdb-9715031c8ae5","resolution":{"observed_at":"2026-08-07T12:01:34.136572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:39.845992Z","title":"Enhancing automated audio captioning via large language models with optimized audio encoding,","venue":null,"work_id":"05353160-eded-45c6-9b47-1614e6f2b8ec","year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.232063Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:7e83461abc81a1d4defae32c909dbff4c8a440d2d538b47ce10d19f68b5ed254","observation_id":"95fd2992-8ce8-463c-ad70-4910f955bce7","resolution":{"observed_at":"2026-08-07T12:01:39.973182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:39.718677Z","title":"BEATs: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":"228643e5-3a5a-4f20-a41e-216b13028c83","year":2023},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.312586Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:bf7f95effec99bb8d8465d1ebd59a86ef5047ecbbe3e370485c6baa06012adaf","observation_id":"e5fb0d28-9ed9-4735-b5bf-fa0b242bd93f","resolution":{"observed_at":"2026-08-07T12:01:39.792153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:39.501958Z","title":"Audio Set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":"90cba74e-64e6-4c45-9e28-0ee1c49c12d9","year":2017},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.374746Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:7539efea01d9d081abcf60d27fecd8bf4dadbe6df7cc72f4f805c19a3919cba4","observation_id":"1c71dbdf-29d1-4713-b39f-5cc7e576fecd","resolution":{"observed_at":"2026-08-07T12:01:39.645364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:39.333180Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"2f5838a5-f844-456c-984d-a7e1bf36ea81","year":2023},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.445594Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:d277c835d261cea8c2caa76a2728fae71bad5ca0c5254f52c88cf8de5c0e3fc8","observation_id":"0e361f16-f008-4518-b797-c9ae4fd2cf9d","resolution":{"observed_at":"2026-08-07T12:01:39.413088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:39.065453Z","title":"High fidelity neural audio compression,","venue":null,"work_id":"c4c04fd9-f18c-472f-b937-c8b7de1a1f73","year":2023},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.506940Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:3601038c3839529832ca9d12b6d1028cec343b1ac718cbe00725b3df59d9404d","observation_id":"849d4c47-fa88-4064-a327-d07ebe4e913d","resolution":{"observed_at":"2026-08-07T12:01:39.203206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:38.813246Z","title":"BART: Denoising sequence-to-sequence pre-training for natural language genera- tion, translation, and comprehension,","venue":null,"work_id":"a8a50cdc-ff77-4a1a-80a0-731c431d3f92","year":2020},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.589090Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:26685aa24e6232e169cda03dc440208bcd83d59d2f507eeb891f5e7fed73bf7e","observation_id":"39e2a501-5016-464b-ac77-b9882674171b","resolution":{"observed_at":"2026-08-07T12:01:38.968506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00233","last_updated":"2024-11-28T12:31:04Z","snapshot_observed_at":"2026-07-06T18:08:00.410061Z","submitted_at":"2024-04-30T22:51:36Z","title":"SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00233","snapshot_observed_at":"2026-08-07T12:01:34.694185Z","title":"Semanticodec: An ultra low bitrate semantic audio codec for general sound,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.694185Z"},"links":{"cited_paper":"/paper/2405.00233","citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:92e3470b8dcfcdb844dd130a5c4886a9de833731ec33ba25f54aa461141d7fd0","observation_id":"7244c56a-c1e5-4a44-bd02-48dcc4a1123e","resolution":{"observed_at":"2026-08-07T12:01:34.694185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:38.585306Z","title":"Speechtok- enizer: Unified speech tokenizer for speech language models,","venue":null,"work_id":"0c7d0fc4-a503-4326-99ed-84f4d93dac10","year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.783763Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:fd48438e1380dd2d08d124fe6f4d8d5d6b0d4fa71a7ebbe8c78f3e918ffb2254","observation_id":"1daff668-6f25-4c57-859f-d70c503c2e27","resolution":{"observed_at":"2026-08-07T12:01:38.710089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:38.274072Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"6b5cf204-b18e-4155-b240-0ff87162c18c","year":2021},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.886016Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:d77f5a54f4f2ed4dcad133dd56b3d1d7cc569110d51313e39c3a18cb554e1bcf","observation_id":"825707c1-2a9f-4374-806e-0fcdaa537847","resolution":{"observed_at":"2026-08-07T12:01:38.416120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:38.137526Z","title":"SoundStream: An end-to-end neural audio codec,","venue":null,"work_id":"3d853843-3142-474f-b32c-3fdfb46109ec","year":2022},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.967305Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:6744d0483c9c19f90fe61807ea7b8cf3e8333b144d72647078e858403074366f","observation_id":"dde80387-82ca-484d-9e41-15118b8e9377","resolution":{"observed_at":"2026-08-07T12:01:38.234586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:37.958579Z","title":"vq- wav2vec: Self-supervised learning of discrete speech representa- tions,","venue":null,"work_id":"8d0987b5-8f75-4772-a706-611d3ae81a9b","year":2020},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.045177Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:702a6175ae49a0272a4755d1f8a176e74295bcc59845cce21011e08f66c52e66","observation_id":"cad56588-70cf-4805-afe2-cb9b317a6268","resolution":{"observed_at":"2026-08-07T12:01:38.051717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:37.803967Z","title":"How should we extract discrete audio tokens from self-supervised models?,","venue":null,"work_id":"8afc0918-ff93-4d63-af3e-e58fadb342ee","year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.127376Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:2f9ae1632bf43a4781a0e69e53c6c821dc8ddc726fa732b9146455f67cb40e8a","observation_id":"dacc8b28-076a-42f1-999d-7607c3e29081","resolution":{"observed_at":"2026-08-07T12:01:37.876465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:37.650393Z","title":"Audiocaps: Generating captions for audios in the wild,","venue":null,"work_id":"ecebdd45-e89b-4981-a580-b09c4df743b4","year":2019},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.207642Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:7d151983908bda4affa74cb22b192fe93c06d620bdb61a8f79a09dd09403838e","observation_id":"a310985e-a820-492c-96f7-f08ca33af77f","resolution":{"observed_at":"2026-08-07T12:01:37.725909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:37.459383Z","title":"Clotho: An audio cap- tioning dataset,","venue":null,"work_id":"b165f1ae-8c18-42d6-a70d-bfd843ed2508","year":2020},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.295830Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:92707cc9308013f861bd51f9f49ae0c2f527c748896f6ff2df85cad1d622656a","observation_id":"6b35c6c1-310e-4ee6-8a4e-c1c384c400d2","resolution":{"observed_at":"2026-08-07T12:01:37.529375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T12:01:35.359333Z","title":"Decoupled weight decay regulariza- tion,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.359333Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:07ed6ae3ad4d4714ad2eb348495f30289eed6c8842ef27d6949b0e005d41fb11","observation_id":"78e4e4d8-f205-4695-a62a-f2b7e767aa50","resolution":{"observed_at":"2026-08-07T12:01:35.359333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:37.284167Z","title":"Meteor universal: Language spe- cific translation evaluation for any target language,","venue":null,"work_id":"347ee875-8ccb-4b13-a2a9-9594e349f88e","year":2014},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.442458Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:7e3fe17b93b7b161893258db3ccab9106cce87f3a77b718bde4ac9ceb7ccc2d6","observation_id":"e32cd370-503b-4519-ad3a-18545a2f37e6","resolution":{"observed_at":"2026-08-07T12:01:37.362079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:37.125482Z","title":"CIDEr: Consensus-based image description evaluation,","venue":null,"work_id":"3d07bccc-4f03-4cb6-b8b8-1d2ca3297547","year":2015},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.563960Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:1be1dc67a2c74422d57d809d5e145817245f9756fa1e1fafc9ba6c6592b8e0a1","observation_id":"61ddb5b5-50de-4892-bba4-d68103ef3633","resolution":{"observed_at":"2026-08-07T12:01:37.197754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:36.952743Z","title":"SPICE: Semantic propositional image caption evaluation,","venue":null,"work_id":"7f95bb87-10ff-4c4f-890d-74b1818981a4","year":2016},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.643613Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:9bc805da240913bc2340247f9271a9c09e538c1e6f7544e07d6b88a87c8cc4ec","observation_id":"89e7d13c-cac2-43b4-b452-0bba65e4a275","resolution":{"observed_at":"2026-08-07T12:01:37.030840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:36.767599Z","title":"Improved image captioning via policy gradient optimization of spider,","venue":null,"work_id":"7b03fa94-66d6-414a-b789-220221124136","year":2017},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.725864Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:05ecf026229c9986dd0a73ebd47f827143c8269ec9febaa8a298e0d20324b87a","observation_id":"a78f4136-0a21-428d-a152-04d6e1cace00","resolution":{"observed_at":"2026-08-07T12:01:36.844380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:36.623668Z","title":"Can audio captions be evaluated with image caption metrics?,","venue":null,"work_id":"0bca6486-b32d-4662-8063-387a7a0a9649","year":2022},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.799846Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:3feffed10c29bbe32de67212e705435dacdab55ca0e56476955947d30e36ae87","observation_id":"ffd1cc54-6e51-4411-8c84-438a46ef7573","resolution":{"observed_at":"2026-08-07T12:01:36.701552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:36.475716Z","title":"Enclap++: Ana- lyzing the enclap framework for optimizing automated audio cap- tioning performance,","venue":null,"work_id":"f9f5db32-2781-4196-86c6-631c70060eb1","year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.906298Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:f67a7796883f7ee16d6217ede6cb09b8910b063d69c39c2b0f19fc4bb7357331","observation_id":"0e90ee26-cb6f-4015-84ee-ea6ba9f10b91","resolution":{"observed_at":"2026-08-07T12:01:36.552520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:36.284937Z","title":"Slam-aac: Enhancing audio captioning with paraphras- ing augmentation and clap-refine through llms,","venue":null,"work_id":"57ab8105-8905-4792-b3ee-2b3c62b7f023","year":2025},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:35.993878Z"},"links":{"citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:1620edd9893ff3564d25162c2d83d151874edc39617df3a5a9be5f41ed5d1bde","observation_id":"0a1131d4-b1e1-4a29-91fa-1082570c3239","resolution":{"observed_at":"2026-08-07T12:01:36.366008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T23:25:02.559135Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2506.00800."}