{"as_of":"2026-08-22T23:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0290bfcff8c2abd888879e46eb24dd8ec841eaf46eae1fae0866730aaa4bd018","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T21:06:13.173892Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T06:28:49.998236Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16757","snapshot_observed_at":"2026-08-01T06:28:49.998236Z","title":"Re- visiting audio-language pretraining for learning general-purpose audio representation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21857","last_updated":"2026-07-23T22:58:24Z","snapshot_observed_at":"2026-08-19T20:02:59.479949Z","submitted_at":"2026-07-23T22:58:24Z","title":"SoundscapeAgent: Agentic Soundscape Construction for Controllable Synthesis and Scalable Audio-Language Supervision","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T06:28:49.998236Z"},"links":{"cited_paper":"/paper/2511.16757","citing_paper":"/paper/2607.21857"},"observation_digest":"sha256:65e7ea2c17d64da515f30e5524e8c698a53d4dc807168b7396243507b1e20ab2","observation_id":"a8b7fc15-ce07-44c9-9380-e6ffe9713782","resolution":{"observed_at":"2026-08-01T06:28:49.998236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.16757/citation-record","integrity":"/paper/2511.16757/integrity","json":"/paper/2511.16757/citation-record.json","paper":"/paper/2511.16757"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1609.08675","last_updated":"2016-09-27T21:21:49Z","snapshot_observed_at":"2026-08-14T21:37:52.670253Z","submitted_at":"2016-09-27T21:21:49Z","title":"YouTube-8M: A Large-Scale Video Classification Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08675","snapshot_observed_at":"2026-08-03T21:06:07.064176Z","title":"Youtube-8m: A large-scale video classification benchmark.arXiv preprint arXiv:1609.08675,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:07.064176Z"},"links":{"cited_paper":"/paper/1609.08675","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:8a0614d143b2dc200dbbefc9102a392c863644721de5c13b79aff83c55437b61","observation_id":"ce739042-061b-4cb0-8cc6-c22fbdc75922","resolution":{"observed_at":"2026-08-03T21:06:07.064176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-03T21:06:07.490691Z","title":"Common voice: A massively-multilingual speech corpus.arXiv preprint arXiv:1912.06670,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:07.490691Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:c443c3ae6c0e9ea9fcebc819bad9e58fe2b7420ca54df693172a05bc45859e9c","observation_id":"d6b5de18-f890-4206-93bc-4bd68033e922","resolution":{"observed_at":"2026-08-03T21:06:07.490691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-21T09:09:11.945819Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01111","snapshot_observed_at":"2026-08-03T21:06:08.068024Z","title":"Fusionaudio-1.2 m: Towards fine-grained audio captioning with multimodal contextual fusion.arXiv preprint arXiv:2506.01111,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:08.068024Z"},"links":{"cited_paper":"/paper/2506.01111","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:e8571f3c0b96e3a5ba063aa8a66088dd7464eec888bd71ac7613a50671b01434","observation_id":"2dca371f-5f41-4521-8e81-5b79e200dd2f","resolution":{"observed_at":"2026-08-03T21:06:08.068024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-03T21:06:08.175687Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:08.175687Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:230928e478b15cef85f41bf3f219d057b54b1d359f7380ff6ea556b717c1fcd9","observation_id":"757193c3-f9c7-4b35-b7af-7d9caf4bc02b","resolution":{"observed_at":"2026-08-03T21:06:08.175687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:09.162666Z","title":"Midashenglm: Efficient audio understanding with general audio captions.arXiv preprint arXiv:2508.03983,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:09.162666Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:59213ef6698963a74a721c3e16ddda4b5928c44c6d600d16b6a24efc0013cd3f","observation_id":"1f57623f-60c2-4210-ab8a-0d3b36eb8654","resolution":{"observed_at":"2026-08-03T21:06:09.162666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:09.242369Z","title":"Scaling rich style-prompted text- to-speech datasets.arXiv preprint arXiv:2503.04713,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:09.242369Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:b39cc08e93a3f9e2fc0adc9e5827ca77889d17d96e0e15eef0e1d960f0917d6b","observation_id":"1c5f3008-b2be-4e24-ae04-917548a25f26","resolution":{"observed_at":"2026-08-03T21:06:09.242369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:09.324790Z","title":"Clotho: An audio captioning dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:09.324790Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:178b014ea5efd4711a39121f7aa881496eb1e9faadc188bdfd6e689a36d5a571","observation_id":"c73e955d-b0cc-40f7-b1be-502aa5bbf469","resolution":{"observed_at":"2026-08-03T21:06:09.324790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:09.390675Z","title":"Threshold independent evaluation of sound event detection scores","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:09.390675Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:5ddab62c15e840800c6eadc8b4cd3ecfb060b96116c68e214ed6c5e05623128a","observation_id":"9d4e6e2c-d6cf-4df0-b13f-13feba227ed4","resolution":{"observed_at":"2026-08-03T21:06:09.390675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:09.467312Z","title":"Clap learning audio concepts from natural language supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:09.467312Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:2a25f944c704e2a4935c10d7e9015f996624ad8f3ef5cc586d345885fe71def0","observation_id":"85a23a6c-3396-45dd-ae43-fa5e3796ae36","resolution":{"observed_at":"2026-08-03T21:06:09.467312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08128","last_updated":"2025-07-28T22:53:43Z","snapshot_observed_at":"2026-08-17T22:20:20.496099Z","submitted_at":"2025-07-10T19:40:21Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.08128","snapshot_observed_at":"2026-08-03T21:06:09.712057Z","title":"Audio flamingo 3: Advancing audio intelligence with fully open large audio language models.arXiv preprint arXiv:2507.08128,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:09.712057Z"},"links":{"cited_paper":"/paper/2507.08128","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:54878657072c7b510d99f03906117391920b86d70a1ea540b07297e374cd1d3c","observation_id":"ef0f3a52-89c0-4f58-866f-3797e15bbf98","resolution":{"observed_at":"2026-08-03T21:06:09.712057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:09.825665Z","title":"Ast: Audio spectrogram transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:09.825665Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:f94b1f08b7d56f6c268f2a59c974cb0281efaa538002f8048ce8f288cfe59b28","observation_id":"04b5af39-f331-434e-8f89-d572b3de60d2","resolution":{"observed_at":"2026-08-03T21:06:09.825665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07839","last_updated":"2023-04-11T22:47:19Z","snapshot_observed_at":"2026-08-20T16:54:03.874432Z","submitted_at":"2022-10-02T07:29:57Z","title":"Contrastive Audio-Visual Masked Autoencoder","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07839","snapshot_observed_at":"2026-08-03T21:06:09.947756Z","title":"Ssast: Self-supervised audio spectrogram transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:09.947756Z"},"links":{"cited_paper":"/paper/2210.07839","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:b293d92a2e352e6208bd6ec7bea901ac75a216daa5ceb7d573aff925a676c2b7","observation_id":"0b1f7c7a-b55a-4d1e-b348-b32c898633d5","resolution":{"observed_at":"2026-08-03T21:06:09.947756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:10.072808Z","title":"The benefit of temporally-strong labels in audio event classification","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:10.072808Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:909e4be573b2c0614770090fb08137324abda9dddbf18359b64be29f1f255d75","observation_id":"d3fc791d-3b12-4f09-a897-e58df262fbf4","resolution":{"observed_at":"2026-08-03T21:06:10.072808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:10.192703Z","title":"Audiocaps: Generating captions for audios in the wild","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:10.192703Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:d94905235b712a1ac2f43f25be1a6637078020d3a5a83eb6f202cc6a06c848d8","observation_id":"fe928ae7-8709-4edf-a97e-74d858049082","resolution":{"observed_at":"2026-08-03T21:06:10.192703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:10.308807Z","title":"Bootstrap- ping language-audio pre-training for music captioning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:10.308807Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:756508eb83ff9452e2fcb0315bd580f558fa025a5cdaaf3efa8d41a29335987f","observation_id":"c57a7e6f-9813-476f-a697-ffe5175a3ab7","resolution":{"observed_at":"2026-08-03T21:06:10.308807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1510.03055","last_updated":"2016-06-10T22:03:28Z","snapshot_observed_at":"2026-08-19T21:34:57.724125Z","submitted_at":"2015-10-11T14:04:57Z","title":"A Diversity-Promoting Objective Function for Neural Conversation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.03055","snapshot_observed_at":"2026-08-03T21:06:10.418194Z","title":"A diversity-promoting objective function for neural conversation models.arXiv preprint arXiv:1510.03055,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:10.418194Z"},"links":{"cited_paper":"/paper/1510.03055","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:9debe0b26c804ed0f8a06cf95341d1447cf5e30fa4f38cae97fb56eba96e6215","observation_id":"8cb5d8aa-187c-4b0c-b7f8-9a9eb6fec207","resolution":{"observed_at":"2026-08-03T21:06:10.418194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:10.566293Z","title":"Music understanding llama: Advancing text-to-music generation with question answering and captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:10.566293Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:884e29d82088143f03d5314677ff2366ff5423221410200c43cd145a467e3b81","observation_id":"c4ce15a0-f12f-43a9-9ab7-1316e2bdc2ba","resolution":{"observed_at":"2026-08-03T21:06:10.566293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-03T21:06:10.633950Z","title":"Roberta: A robustly optimized bert pretraining approach.arXiv preprint arXiv:1907.11692,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:10.633950Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:4b9a4abe49de44cc0b50b7bfa89774f4ceaaf69d45a59d46232b2bea764e8820","observation_id":"bd121fca-7daf-49e3-b6ae-7a1c0ac820ab","resolution":{"observed_at":"2026-08-03T21:06:10.633950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13032","last_updated":"2025-05-19T12:18:42Z","snapshot_observed_at":"2026-08-20T13:35:17.416522Z","submitted_at":"2025-05-19T12:18:42Z","title":"MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13032","snapshot_observed_at":"2026-08-03T21:06:10.705003Z","title":"Mmar: A challenging benchmark for deep rea- soning in speech, audio, music, and their mix.arXiv preprint arXiv:2505.13032,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:10.705003Z"},"links":{"cited_paper":"/paper/2505.13032","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:733d9e9f8d24b3400714c8fed363a36ac6ea1d7ca855c8e970be6d7a9aca6b80","observation_id":"c171446b-c51c-4493-9a76-50842f872cfe","resolution":{"observed_at":"2026-08-03T21:06:10.705003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:10.775784Z","title":"Expresso: A benchmark and analysis of discrete expressive speech resynthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:10.775784Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:2418a9bf254fbbb8653480690dc0a17a70279424d19337ea1db4b14a69eb7c23","observation_id":"615dafb6-a46e-4309-9fdc-cd1f6b58f6fd","resolution":{"observed_at":"2026-08-03T21:06:10.775784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02032","last_updated":"2024-06-04T07:17:44Z","snapshot_observed_at":"2026-08-18T11:22:59.793912Z","submitted_at":"2024-06-04T07:17:44Z","title":"M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02032","snapshot_observed_at":"2026-08-03T21:06:10.841830Z","title":"M2d-clap: Masked modeling duo meets clap for learning general- purpose audio-language representation.arXiv preprint arXiv:2406.02032,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:10.841830Z"},"links":{"cited_paper":"/paper/2406.02032","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:4e6996363e0776449f0b276c1463c7449c7c0e8fea15f8c8946470068270ea91","observation_id":"ed604b87-016f-4410-a5d2-8b5f8682cee0","resolution":{"observed_at":"2026-08-03T21:06:10.841830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:10.915628Z","title":"M2d2: Exploring general-purpose audio-language representations beyond clap","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:10.915628Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:3a363e64dec64cfd7f9366ac501b0ccb43216746561ea14deeb3506100e17b2a","observation_id":"d96523a0-8922-43e6-9e09-2bc2a24d2d48","resolution":{"observed_at":"2026-08-03T21:06:10.915628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-03T21:06:11.032587Z","title":"Representation learning with contrastive predic- tive coding.arXiv preprint arXiv:1807.03748,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:11.032587Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:8e903a805bf14c1b4b8c34b0b7298a7a9f572868ae164a515794a1a019af9ee8","observation_id":"7017ae55-494d-4018-bbba-7d7c1f050101","resolution":{"observed_at":"2026-08-03T21:06:11.032587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02508","last_updated":"2019-06-04T12:33:49Z","snapshot_observed_at":"2026-08-18T11:18:27.643786Z","submitted_at":"2018-10-05T03:50:24Z","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02508","snapshot_observed_at":"2026-08-03T21:06:11.114113Z","title":"Meld: A multimodal multi-party dataset for emotion recognition in conversations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:11.114113Z"},"links":{"cited_paper":"/paper/1810.02508","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:00eaacf93dcc5d3b6b4497c881a8d1775f89890b3137c0ac6ada1d313e0ebc98","observation_id":"dbc2b25d-b38f-466c-9474-26e972a603c6","resolution":{"observed_at":"2026-08-03T21:06:11.114113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-08-14T05:02:11.716316Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-03T21:06:11.188963Z","title":"Sentence-bert: Sentence embeddings using siamese bert- networks.arXiv preprint arXiv:1908.10084,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:11.188963Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:624b0946598c2428b1b2b5e801430a28422bdebb31caec62284bc4ef398e353b","observation_id":"0e47b155-47ef-4a4c-9af1-7c81fcf94e81","resolution":{"observed_at":"2026-08-03T21:06:11.188963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:11.260914Z","title":"Ears: An anechoic fullband speech dataset benchmarked for speech enhancement and dereverberation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:11.260914Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:e7ae58ef5244d228ba017dfda3a7dbeeff9226cc20117348057344edf140807b","observation_id":"c40cd07d-aa01-47c4-b07d-6516381f5823","resolution":{"observed_at":"2026-08-03T21:06:11.260914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07461","last_updated":"2025-05-16T07:57:01Z","snapshot_observed_at":"2026-08-14T07:32:27.094406Z","submitted_at":"2025-02-11T11:12:19Z","title":"JamendoMaxCaps: A Large Scale Music-caption Dataset with Imputed Metadata","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07461","snapshot_observed_at":"2026-08-03T21:06:11.334903Z","title":"Jamendomaxcaps: A large scale music-caption dataset with imputed metadata.arXiv preprint arXiv:2502.07461,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:11.334903Z"},"links":{"cited_paper":"/paper/2502.07461","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:0aecaa5ebeaeb7afd6ea05f3c4e6e833a439897f122374586eee5dcda5f19f7c","observation_id":"537edd05-764f-4232-9357-53816e6f6c68","resolution":{"observed_at":"2026-08-03T21:06:11.334903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-19T23:01:24.892193Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15177","snapshot_observed_at":"2026-08-03T21:06:11.400124Z","title":"Audio-language models for audio-centric tasks: A survey.arXiv preprint arXiv:2501.15177,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:11.400124Z"},"links":{"cited_paper":"/paper/2501.15177","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:b24f166814096f330dc2c0786dbdac48dad97faa1a1be1d8e36b1daf760c366f","observation_id":"0168ded6-1ca9-410c-b702-a6f097fbf190","resolution":{"observed_at":"2026-08-03T21:06:11.400124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:11.476479Z","title":"Hear: Holistic evaluation of audio representations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:11.476479Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:1b5d00ed6d34b27d84fd1a958925c6afa4979be5f3b9cffe97233b8962f3d0e5","observation_id":"f9652705-8b00-4560-b9a1-ad4bf3f5b834","resolution":{"observed_at":"2026-08-03T21:06:11.476479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:11.497545Z","title":"Towards learning universal audio representations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:11.497545Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:1b95e978cc9806037ced0c0d178d827a798e40114c630e567e5be06fb8647ec6","observation_id":"ebb0f9fa-5e98-466b-86ef-b27020d59182","resolution":{"observed_at":"2026-08-03T21:06:11.497545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:11.511640Z","title":"Wav2clip: Learning robust audio representations from clip","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:11.511640Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:e63412b8ac76bb6da8a29757152800bdaa152fa1fb974553543a4c29d35cef65","observation_id":"5f39bf62-dda9-404d-80e7-c689903a62ab","resolution":{"observed_at":"2026-08-03T21:06:11.511640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:11.655197Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:11.655197Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:f561f278d467a94ea9b5200c4b360fbf061900f00dc14ba1dd30130ef10f2bc3","observation_id":"a645b7a2-ed46-446e-a966-78c3b632861d","resolution":{"observed_at":"2026-08-03T21:06:11.655197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-03T21:06:11.795076Z","title":"qwen2.5 technical report.arXiv preprint arXiv:2412.15115, 2024a","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:11.795076Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:7f4873a65d31bc5b402d859b3317144ed035b6f9022e81c65cfb9ad9cd8bf888","observation_id":"5290700a-c99c-4190-b100-73ddc28758a2","resolution":{"observed_at":"2026-08-03T21:06:11.795076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:12.049728Z","title":"Speech self- supervised representation benchmarking: Are we doing it right? InInterspeech 2023, pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:12.049728Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:24e786021e205d8396636888482c4f11f5d1bc4c318dc85608bba6e041371272","observation_id":"32d11406-f61d-48f6-8d96-a004bf39d094","resolution":{"observed_at":"2026-08-03T21:06:12.049728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:12.221734Z","title":"Xiaohua Zhai, Xiao Wang, Basil Mustafa, Andreas Steiner, Daniel Keysers, Alexander Kolesnikov, and Lucas Beyer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:12.221734Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:ecd83e7bc87ddf8e0967f7192176b439be2d66bd47459234c660b12cd588837f","observation_id":"34f80b2d-5844-41fe-98f7-cc8dcdbdee82","resolution":{"observed_at":"2026-08-03T21:06:12.221734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01108","last_updated":"2025-01-03T08:35:34Z","snapshot_observed_at":"2026-08-21T21:42:21.094554Z","submitted_at":"2025-01-02T07:08:29Z","title":"MuQ: Self-Supervised Music Representation Learning with Mel Residual Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01108","snapshot_observed_at":"2026-08-03T21:06:12.382168Z","title":"Muq: Self-supervised music representation learning with mel residual vector quantization.arXiv preprint arXiv:2501.01108,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:12.382168Z"},"links":{"cited_paper":"/paper/2501.01108","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:d27cd4a5263548f84a6a3bbc87dcb0948213a729ac40cd617d047864b9919355","observation_id":"1f31a174-8633-4e17-9659-dab533bdfcf6","resolution":{"observed_at":"2026-08-03T21:06:12.382168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:12.550088Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:12.550088Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:b6623eb62c54234ef55a55b311c88aad874f359c45acf8254bfd5f0db5e9f952","observation_id":"d7e2a49a-a2bb-48fa-8a53-f1bb106aefca","resolution":{"observed_at":"2026-08-03T21:06:12.550088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:12.720421Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:12.720421Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:e5a57c40f291aa75171a31165427b8208684d454f22ba1350f9ddf380ca6c68e","observation_id":"d305ed88-57b4-4a52-ac45-b4292756d9d8","resolution":{"observed_at":"2026-08-03T21:06:12.720421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:12.895160Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:12.895160Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:ea5e905dde82eac6e60aef851ce676e26f36741efaca1273bcf245fc62522294","observation_id":"a311440c-b7a8-416b-9802-b704963ea926","resolution":{"observed_at":"2026-08-03T21:06:12.895160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:13.035165Z","title":"The architecture employs a U-Net-inspired design with six Transformer stages that process sequences at multiple temporal resolutions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:13.035165Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:f554c6f16b1bb3cdd7a9bdb5e3df4a91ad38d04727828a08984d57d123cd140d","observation_id":"9ead360e-496e-41d7-aacb-c35a78841280","resolution":{"observed_at":"2026-08-03T21:06:13.035165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:13.173892Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:13.173892Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:23f2909dd4ce6818f46cd15c774dd11f217e98f226762432f4d61ceedd580f2d","observation_id":"8aa230fa-7631-42be-b74e-14a8343967dc","resolution":{"observed_at":"2026-08-03T21:06:13.173892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.12076","last_updated":"2022-09-23T06:06:18Z","snapshot_observed_at":"2026-08-18T20:14:32.367789Z","submitted_at":"2022-04-26T05:10:25Z","title":"ATST: Audio Representation Learning with Teacher-Student Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.12076","snapshot_observed_at":"2026-08-03T21:06:10.496343Z","title":"Atst: Audio representation learning with teacher-student transformer.arXiv preprint arXiv:2204.12076,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:10.496343Z"},"links":{"cited_paper":"/paper/2204.12076","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:76078c695a95161aeace54f98f80445fcd26f1f92f0cb0cbb288c97e516a2b86","observation_id":"0edf5fba-f34d-41b8-a3ae-311d3e6b0463","resolution":{"observed_at":"2026-08-03T21:06:10.496343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-20T13:40:28.954978Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-03T21:06:07.208641Z","title":"Musiclm: Generating music from text.arXiv preprint arXiv:2301.11325,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:07.208641Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:a883d3a861895ee466e63fd9a9400f180e76a7077d00b6cd2288a01e2eaa6e77","observation_id":"fff260b9-0970-433a-a3d5-522553d1d05d","resolution":{"observed_at":"2026-08-03T21:06:07.208641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:09.587432Z","title":"Gama: A large audio-language model with advanced audio understanding and complex reasoning abilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:09.587432Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:c2f8145ee706b3fa53be4b106865a09c87d68a8250aa9351ab859261df6ac030","observation_id":"bf63c450-d9dc-4046-9236-8c7c6b994720","resolution":{"observed_at":"2026-08-03T21:06:09.587432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:08.501672Z","title":"Look, listen, and learn more: Design choices for deep audio embeddings","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:08.501672Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:9cf087d25876aae3640d75d4c262fe829ba422ec1af534321aac5c3465b079e0","observation_id":"03dc1531-4719-4696-9910-0733bb3d7b61","resolution":{"observed_at":"2026-08-03T21:06:08.501672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:09.076370Z","title":"Scaling up masked audio encoder learning for general audio classification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:09.076370Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:877af8e355aee37c4e0f2d22ea1ab9846ea4dc2bc67f7e20c9ad754a6e53c015","observation_id":"3bdd87a5-184b-4737-94c4-aecfa217fecd","resolution":{"observed_at":"2026-08-03T21:06:09.076370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:08.928487Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:08.928487Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:7014abee757d0a32794d7c20c0f8be0a6756d8ac38fdbc24b3247a755d3ef935","observation_id":"bae167f7-1436-4d5b-ad13-6f556a13f876","resolution":{"observed_at":"2026-08-03T21:06:08.928487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:07.900028Z","title":"Vggsound: A large-scale audio- visual dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:07.900028Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:695230646d445d2af9765b6256ee740d8fe39f16ea8a6bd48d2c36fea96a8aa2","observation_id":"e99ea17d-78c8-4096-b2c1-476e33bc9d56","resolution":{"observed_at":"2026-08-03T21:06:07.900028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-16T12:49:35.884517Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-03T21:06:08.738117Z","title":"Ecapa-tdnn: Emphasized chan- nel attention, propagation and aggregation in tdnn based speaker verification.arXiv preprint arXiv:2005.07143,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:08.738117Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:a3427a88bd8c2f9fb9cca7823a4686c0d85f6a6fd3838edac98845ff3433ee7f","observation_id":"dad4edd1-5800-4821-a31b-d0a2090f0f3b","resolution":{"observed_at":"2026-08-03T21:06:08.738117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:07.316713Z","title":"Efficient supervised training of audio transformers for music representation learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:07.316713Z"},"links":{"citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:7158f6051036505cc1d779358923ed9e3604f7d2d95a079a17403f0f72db9ef0","observation_id":"36034fc8-1f4e-4a03-8780-8f0aa5dbafb4","resolution":{"observed_at":"2026-08-03T21:06:07.316713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05622","last_updated":"2018-06-27T01:49:17Z","snapshot_observed_at":"2026-08-15T02:39:00.334605Z","submitted_at":"2018-06-14T15:59:12Z","title":"VoxCeleb2: Deep Speaker Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05622","snapshot_observed_at":"2026-08-03T21:06:08.388565Z","title":"V oxceleb2: Deep speaker recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:08.388565Z"},"links":{"cited_paper":"/paper/1806.05622","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:396d028da091ce2fc0ccdfa560adbb4f75ad9df6d181a70987334cf741c4f2bb","observation_id":"bcab7841-040c-4567-820b-9a2a5c149269","resolution":{"observed_at":"2026-08-03T21:06:08.388565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14129","last_updated":"2026-07-13T00:23:40Z","snapshot_observed_at":"2026-08-13T08:54:20.630927Z","submitted_at":"2025-07-18T17:57:46Z","title":"OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.14129","snapshot_observed_at":"2026-08-03T21:06:07.665524Z","title":"Openbeats: A fully open-source general-purpose audio encoder","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:07.665524Z"},"links":{"cited_paper":"/paper/2507.14129","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:1eff6c3724a8ab71f72afc4e413ae886218e9f7244279de9533397ea23353224","observation_id":"84d977bf-7ef6-491a-bfea-26e008035d6d","resolution":{"observed_at":"2026-08-03T21:06:07.665524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-16T14:57:20.088308Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 1 inbound Pith citation observation for arXiv:2511.16757."}