{"as_of":"2026-08-08T07:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7af9a8694122daeac08b250bf496f7985de28a11de744feee52024f11fb7ec80","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:29:41.089739Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:29:37.637530Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T15:29:41.315494Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"cited_work":{"arxiv_id":"2505.14989","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.14989","snapshot_observed_at":"2026-08-07T15:29:41.315494Z","title":"Discrete Audio Representations for Automated Audio Captioning","venue":"cs.SD","work_id":"784d7fad-d6ec-474b-b138-1e12e23aed7b","year":2025},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:37.637530Z"},"links":{"cited_paper":"/paper/2505.14989","citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:05297583a0d464f61fb2dcb3bc4d40d65e52179e4a321835921aaefd3033726d","observation_id":"99f40907-dc3f-4326-98e4-a199b836bdaa","resolution":{"observed_at":"2026-08-07T15:29:41.407940Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14989/citation-record","integrity":"/paper/2505.14989/integrity","json":"/paper/2505.14989/citation-record.json","paper":"/paper/2505.14989"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"cited_work":{"arxiv_id":"2505.14989","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.14989","snapshot_observed_at":"2026-08-07T15:29:41.315494Z","title":"Discrete Audio Representations for Automated Audio Captioning","venue":"cs.SD","work_id":"784d7fad-d6ec-474b-b138-1e12e23aed7b","year":2025},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:37.637530Z"},"links":{"cited_paper":"/paper/2505.14989","citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:05297583a0d464f61fb2dcb3bc4d40d65e52179e4a321835921aaefd3033726d","observation_id":"99f40907-dc3f-4326-98e4-a199b836bdaa","resolution":{"observed_at":"2026-08-07T15:29:41.407940Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:43.962012Z","title":"We construct BART-based and GPT-2 XL-based AAC systems, both utilizing semantic and acoustic tokens","venue":null,"work_id":"53bf1f90-2397-4350-99fc-0ad776d3bb6e","year":null},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:37.685143Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:cd05e48281be2d453dedf054a1b0155fb94042080df3b723810360f81aa5196b","observation_id":"33ad1828-4fd5-4d8e-bb50-0923888c62ad","resolution":{"observed_at":"2026-08-07T15:29:44.012926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:43.814305Z","title":null,"venue":null,"work_id":"e71f0f02-4a23-4c8f-9456-379d2bbf5502","year":null},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:37.771872Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:906cb24990bbc381f2395645df8da44bff921bd8d5cb03e64464aa4ddc38f2a7","observation_id":"cefd1b20-81c4-4ea7-a9c9-c6e2de374566","resolution":{"observed_at":"2026-08-07T15:29:43.877697Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:43.677664Z","title":"Our findings indicate that semantic tokens significantly outperform acoustic tokens in this context","venue":null,"work_id":"5620e7de-6a79-4e05-8cfa-7ae9f9655ee0","year":null},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:37.837897Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:7e964ad35b825caabbaeb91cf7ecefa6a8eba3e6c779b1d81044dd97b2421344","observation_id":"72d3ae5e-6dc2-4d14-8e49-086a70a44d25","resolution":{"observed_at":"2026-08-07T15:29:43.729200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:43.549115Z","title":"Automated audio captioning: An overview of recent progress and new challenges,","venue":null,"work_id":"a6b35b31-0e47-48aa-b96b-09a140402a97","year":2022},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:37.933826Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:c45e1c59d9da6fc6a1214a8db832a34b9f34fffee572f04539c2810ef8bb7e82","observation_id":"603fc8e4-6430-4c5f-b5f4-a5dffa6819bf","resolution":{"observed_at":"2026-08-07T15:29:43.606953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:43.388001Z","title":"Audio captioning based on transformer and pre-trained cnn,","venue":null,"work_id":"66707fef-0a14-492c-a0fa-964108c55b4b","year":2020},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:38.002613Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:d10021d80e31482d2c0a309e5096e1b0bd1cfcd4c5f3a76d0fd5d675de004163","observation_id":"c8825f6b-0b1c-4c98-b2d7-44a980073a55","resolution":{"observed_at":"2026-08-07T15:29:43.460031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:43.259787Z","title":"Automated audio caption- ing by fine-tuning bart with audioset tags,","venue":null,"work_id":"25c4a80c-0f22-4b90-964a-fcf18e1f1d75","year":2021},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:38.078918Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:d8bc069739a211d5823360207042a0986bd13836a9c7122e00990413859378ac","observation_id":"59b5a379-4928-4a17-ad1d-929c748ca906","resolution":{"observed_at":"2026-08-07T15:29:43.305054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:43.102623Z","title":"Leveraging pre-trained bert for audio captioning,","venue":null,"work_id":"bec0367c-2d80-49ae-bdc8-8462a2b779fa","year":2022},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:38.173354Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:e168e1d38b38681157319f31c595727f184767757f52fec9f17f175d36bf0900","observation_id":"f8b710d6-2282-4147-9d68-64b5259cbd75","resolution":{"observed_at":"2026-08-07T15:29:43.170929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:42.963724Z","title":"Conette: An efficient au- dio captioning system leveraging multiple datasets with task em- bedding,","venue":null,"work_id":"10821f7a-51fb-4cb7-986f-fc502b5537e2","year":2024},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:38.274473Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:e4b59ab4ccddb30515f2cbd912aae1e03c67ede9dfbda9de3789c9d24bb4b501","observation_id":"83fc5ec3-ab4e-4553-bf30-3d2aac66599b","resolution":{"observed_at":"2026-08-07T15:29:43.032026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:42.829172Z","title":"Improving audio captioning mod- els with fine-grained audio features, text embedding supervision, and llm mix-up augmentation,","venue":null,"work_id":"b9a76502-4289-4be7-93ec-6e8b92cca1d0","year":2024},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:38.375285Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:fadca4509755d648c6e7cc616e7c8af730680024a035f9cb753caaebf1c0b1ba","observation_id":"e6243da2-8ba2-4ee1-ac41-5b5c5bb07e3f","resolution":{"observed_at":"2026-08-07T15:29:42.889413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:38.478425Z","title":"Panns: Large-scale pretrained audio neural networks for audio pattern recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:38.478425Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:9953a74e490db4a037699629815bb81cd85061461ca60fdfad9e1239fdd98b5e","observation_id":"35d13838-760a-4507-a964-a3d39b0c42e4","resolution":{"observed_at":"2026-08-07T15:29:38.478425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:42.666667Z","title":"Adapting a convnext model to audio classification on au- dioset,","venue":null,"work_id":"3be3f9ed-9c9c-48e6-8472-0c98b9376f87","year":2023},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:38.560986Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:deb7b12dfbeb768883d6cef5572506896212cd848fb5cfde8b3164137356ee09","observation_id":"bb3ef9d7-fdaa-49fb-a8eb-c94b7d2dcecf","resolution":{"observed_at":"2026-08-07T15:29:42.746482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:42.494919Z","title":"Beats: audio pre-training with acoustic tok- enizers,","venue":null,"work_id":"493dea96-79cb-4f8b-9dc2-a6184549c089","year":2023},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:38.654264Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:d3dad34275d1e33bc65734220fe35df32a3e402b24bd57b61d1a34f13eb11144","observation_id":"46b92cf6-81f9-48cc-933a-4c058438af93","resolution":{"observed_at":"2026-08-07T15:29:42.551062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T15:29:38.730373Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:38.730373Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:6a432f9031eb3836b21a802c79694d2f4accefe549cfd312289f158e3c8f71a4","observation_id":"6b9661e5-d984-425b-8ea9-a1c8e8aff9c9","resolution":{"observed_at":"2026-08-07T15:29:38.730373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.13461","last_updated":"2019-10-29T18:01:00Z","snapshot_observed_at":"2026-07-06T08:33:12.534026Z","submitted_at":"2019-10-29T18:01:00Z","title":"BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.13461","snapshot_observed_at":"2026-08-07T15:29:38.816322Z","title":"Bart: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:38.816322Z"},"links":{"cited_paper":"/paper/1910.13461","citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:8292df8155c7c94645534307f046de65111147569fb8e82b204d44f600fe106e","observation_id":"f97881d5-1890-40a5-8d5a-44f7c8b214a5","resolution":{"observed_at":"2026-08-07T15:29:38.816322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:38.907144Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:38.907144Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:b65f6e35699d7f48fbc0127c351dc4f97aa3be195470bab69c7ef93c991c31e4","observation_id":"faeb6c81-bccb-4221-a163-554f51667a31","resolution":{"observed_at":"2026-08-07T15:29:38.907144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02384","last_updated":"2024-09-04T02:20:59Z","snapshot_observed_at":"2026-08-01T18:34:49.824481Z","submitted_at":"2024-09-04T02:20:59Z","title":"STAB: Speech Tokenizer Assessment Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02384","snapshot_observed_at":"2026-08-07T15:29:39.010252Z","title":"Stab: Speech tokenizer assessment benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:39.010252Z"},"links":{"cited_paper":"/paper/2409.02384","citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:0d18920cc7203cb90394693c6c0981fa1135cf0147e5513ba28b39d8c6166c10","observation_id":"6c960552-04af-4b3a-ba53-1ebb82abe3a5","resolution":{"observed_at":"2026-08-07T15:29:39.010252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:39.090136Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:39.090136Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:95d8957879f36b752c4b509ead9a81bea7f11b65f4d9c0eec06e861c5a8ed8d4","observation_id":"1bf8414e-bbe7-412c-926d-3c551e889850","resolution":{"observed_at":"2026-08-07T15:29:39.090136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T15:29:39.236427Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:39.236427Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:c724e228290133d1294eb5e64eb1bd085c90cc4ded9b8d0a5274c9e15a5094ce","observation_id":"604426d6-34a9-45e0-8b98-d9a7518c4e3a","resolution":{"observed_at":"2026-08-07T15:29:39.236427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:39.371761Z","title":"High-fidelity audio compression with improved rvqgan,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:39.371761Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:76f66d2e74ff957406089f261574cf79ab7a1fbdbb3f706180afb5383f263344","observation_id":"a635e2e1-ee8c-4774-a573-a3dd8fd5abe8","resolution":{"observed_at":"2026-08-07T15:29:39.371761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:39.476168Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:39.476168Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:f00528a576e55ec93fb75afd4752e592c6b04cd79244a4dcbb37c430c302038a","observation_id":"db345d99-1cc7-44c3-b2e9-cff7d83fdb29","resolution":{"observed_at":"2026-08-07T15:29:39.476168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:39.544115Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:39.544115Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:125889072d3c07988dbb3d889c375b04b2ddbae1435120d734b497da39e5374c","observation_id":"d440acd7-51cc-45cf-99e7-d54ad8af7e6c","resolution":{"observed_at":"2026-08-07T15:29:39.544115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:42.290872Z","title":"RepCodec: A speech represen- tation codec for speech tokenization,","venue":null,"work_id":"95b99ea1-19b5-40ef-abb7-ef1c2489351a","year":2024},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:39.614586Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:196ec0bb89457437967bc361d6c857053a7e5f731fc0ee30e771969c6019ba28","observation_id":"820f0797-cf0f-4bd5-aad6-9be4af9109d9","resolution":{"observed_at":"2026-08-07T15:29:42.358530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T15:29:39.691319Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:39.691319Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:17d76adf1895e67b53cbbe0f7ef04c1710783f19861ee460977cf58e27aa3fd4","observation_id":"2365d3a4-9a06-480b-a9e9-738cec03d94e","resolution":{"observed_at":"2026-08-07T15:29:39.691319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-08-07T15:29:39.917468Z","title":"Base tts: Lessons from building a billion-parameter text-to-speech model on 100k hours of data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:39.917468Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:3e28f95a396f05b81fc7c9ef152d947b5fc1d136a12f73dcbb22c47a61263047","observation_id":"7e1079c0-39a2-4f82-bd04-ba21a7d587b4","resolution":{"observed_at":"2026-08-07T15:29:39.917468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:42.161399Z","title":"Exploration of efficient end-to-end asr using discretized input from self-supervised learning,","venue":null,"work_id":"ab332195-8989-4f14-9e09-1b30b814b559","year":2023},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:40.021098Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:dbe280f822bc42089e701f5156bb23cc9b9b0b6250f5a9c94abbc69302d761f5","observation_id":"d6434d90-b764-4b0a-b87d-a5606774bcdf","resolution":{"observed_at":"2026-08-07T15:29:42.206416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:40.136058Z","title":"How should we extract discrete audio tokens from self-supervised models?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:40.136058Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:f24199c0d8a9d45f59e741848370d7e9d8084d9b8e293cf31a925b3aa13450fc","observation_id":"9031b10f-1abd-4b2c-9429-6d768514a162","resolution":{"observed_at":"2026-08-07T15:29:40.136058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:42.022078Z","title":"Discrete audio representation as an alternative to mel-spectrograms for speaker and speech recognition,","venue":null,"work_id":"e4270c00-4487-401b-8894-a2f4a87c043b","year":2024},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:40.274350Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:0dcfeb07aa024a567c57601b52fa13d1640626e86043a1fb3e31ea4190f30969","observation_id":"f071cc86-68db-4404-ba0a-947998171708","resolution":{"observed_at":"2026-08-07T15:29:42.081468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:41.881060Z","title":"Enclap: Combining neu- ral audio codec and audio-text joint embedding for automated au- dio captioning,","venue":null,"work_id":"ce635d33-b793-4361-8cd9-09f41e5a4254","year":2024},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:40.400959Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:b2de136cf50e4c00eace85449f1191e7732b681e74037b96d3286bb314f0df6f","observation_id":"e716f219-6b97-4506-b963-09661381826f","resolution":{"observed_at":"2026-08-07T15:29:41.951056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:40.513005Z","title":"Neural discrete represen- tation learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:40.513005Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:86a94649eb7698d26793e486ebc9eda5557e5eb506e1ec2cf866d235635cc9c4","observation_id":"559d8f9d-1118-412f-8dc3-f2ee8e0538a6","resolution":{"observed_at":"2026-08-07T15:29:40.513005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:41.781981Z","title":"Investigating lo- cal and global information for automated audio captioning with transfer learning,","venue":null,"work_id":"678ee17e-3d02-4ec6-9d8c-664ad16f31a6","year":2021},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:40.581171Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:d0c6163fe4bfa32c0a2d632ba6fc248dd5d833e3ad09e2c26cc4493649181689","observation_id":"5ca75e92-a442-4ac8-9b6b-6902dbdd3bb9","resolution":{"observed_at":"2026-08-07T15:29:41.823902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:41.647697Z","title":"Prefix tuning for auto- mated audio captioning,","venue":null,"work_id":"40a7fc63-04fd-4e8f-bb01-7a35163d4140","year":2023},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:40.658035Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:4cd37d1dd27a2ab4bcf45ffe4f029e4ad588c390859c61e83345f8fd6d19f995","observation_id":"a11eb655-7160-47d5-9313-fe082c58d128","resolution":{"observed_at":"2026-08-07T15:29:41.713383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:40.769821Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:40.769821Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:92964160f478db263c2a5ac63aba2909e807456f4e09fa864ea8814ec914aa72","observation_id":"fa09ffca-3051-4b66-b7ac-c9a49cbceec3","resolution":{"observed_at":"2026-08-07T15:29:40.769821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:40.890406Z","title":"Clotho: An audio cap- tioning dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:40.890406Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:4270eb828cb53f7995effb6e0fca2fc48e4d57d1c8197f651877870bef1a275d","observation_id":"6c7a4798-49e0-4a63-8e6a-5c18735ef4c8","resolution":{"observed_at":"2026-08-07T15:29:40.890406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:40.981070Z","title":"Improved image captioning via policy gradient optimization of spider,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:40.981070Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:d9a5e544e21f1cf309eee968786fc380f4d7681e391546df7ca2fe309599acde","observation_id":"ca949e47-509f-4b35-9b34-a44501a28463","resolution":{"observed_at":"2026-08-07T15:29:40.981070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:41.472383Z","title":"Can audio captions be evaluated with image caption metrics?","venue":null,"work_id":"908294f5-4f51-4024-a6e6-060187c323aa","year":2022},"citing_paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:41.089739Z"},"links":{"citing_paper":"/paper/2505.14989"},"observation_digest":"sha256:8d397ec7f9e5baa4587bb82958c39564cf214329a33c40d71c0ec5db15fd3531","observation_id":"5e43b8e5-c476-4d03-a339-29dcf1715581","resolution":{"observed_at":"2026-08-07T15:29:41.528936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.14989","last_updated":"2025-05-21T00:27:38Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T15:23:40.228446Z","submitted_at":"2025-05-21T00:27:38Z","title":"Discrete Audio Representations for Automated Audio Captioning"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2505.14989."}