{"as_of":"2026-08-07T15:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e6848f9d9c5e033a1942972764126d25da1e9cf109cf788d0fb62293bc3da436","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T01:52:01.164694Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.14231/citation-record","integrity":"/paper/2605.14231/integrity","json":"/paper/2605.14231/citation-record.json","paper":"/paper/2605.14231"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.05843","last_updated":"2023-09-11T22:03:34Z","snapshot_observed_at":"2026-08-05T23:02:25.412811Z","submitted_at":"2023-09-11T22:03:34Z","title":"Optimizing Audio Augmentations for Contrastive Learning of Health-Related Acoustic Signals","version":1},"cited_work":{"arxiv_id":"2309.05843","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05843","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimizing audio augmentations for contrastive learn- ing of health-related acoustic signals.arXiv preprint arXiv:2309.05843","venue":null,"work_id":"a3358304-8e36-4f08-a2d9-5da59630762a","year":null},"citing_paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","snapshot_observed_at":"2026-08-01T16:03:09.685528Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:01.164694Z"},"links":{"cited_paper":"/paper/2309.05843","citing_paper":"/paper/2605.14231"},"observation_digest":"sha256:03bc1916c769a0c50eb95a550640b3e242da595ec049bd50a95e9616155be19c","observation_id":"961a22ce-e646-4a7a-b214-b8478e94086f","resolution":{"observed_at":"2026-05-15T01:53:28.881087Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15830","last_updated":"2024-01-11T13:16:43Z","snapshot_observed_at":"2026-07-06T16:53:05.949503Z","submitted_at":"2023-11-27T13:53:53Z","title":"A-JEPA: Joint-Embedding Predictive Architecture Can Listen","version":3},"cited_work":{"arxiv_id":"2311.15830","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.15830","snapshot_observed_at":"2026-07-04T20:50:12.632993Z","title":"A-jepa: Joint-embedding predictive architecture can listen","venue":null,"work_id":"cf2ef9fd-18d7-410e-843d-32334e6ae7a9","year":2023},"citing_paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","snapshot_observed_at":"2026-08-01T16:03:09.685528Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:01.164694Z"},"links":{"cited_paper":"/paper/2311.15830","citing_paper":"/paper/2605.14231"},"observation_digest":"sha256:3cdeb4fb93675ab86e53b6bed55a68a557cb53fc5090cf5970c126e3f89a3aca","observation_id":"c5a1aaf1-6513-4c58-8e53-97280eaa76c2","resolution":{"observed_at":"2026-05-15T01:53:28.868746Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08128","last_updated":"2025-07-28T22:53:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-10T19:40:21Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","version":2},"cited_work":{"arxiv_id":"2507.08128","doi":"10.48550/arxiv.2507.08128","metadata_source":"pith","pith_arxiv_id":"2507.08128","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","venue":"cs.SD","work_id":"67c2892d-8e27-4da1-8198-71c48e673e96","year":2025},"citing_paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","snapshot_observed_at":"2026-08-01T16:03:09.685528Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:01.164694Z"},"links":{"cited_paper":"/paper/2507.08128","citing_paper":"/paper/2605.14231"},"observation_digest":"sha256:5022ed9853cbdb57963cdee65c40957a07f1db360782f074ca7825810bd65174","observation_id":"5ce69e51-48d6-495d-9ed8-3da424fc931d","resolution":{"observed_at":"2026-05-15T03:42:46.422993Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ast: Audio spectro- gram transformer","venue":null,"work_id":"63149a19-14f4-4ed6-b5c9-f4ecbdae3608","year":2021},"citing_paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","snapshot_observed_at":"2026-08-01T16:03:09.685528Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:01.164694Z"},"links":{"citing_paper":"/paper/2605.14231"},"observation_digest":"sha256:cac270dcd4838ef597f7790e081df895e39ca02338944cf18c5601f25222531d","observation_id":"6ee27fac-4b9b-460a-ac4c-7ef2b50795d1","resolution":{"observed_at":"2026-05-15T08:20:18.430043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sheet: A multi- purpose open-source speech human evaluation estimation toolkit","venue":null,"work_id":"6968eb5b-a178-41d4-8914-706bb21c13ca","year":2025},"citing_paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","snapshot_observed_at":"2026-08-01T16:03:09.685528Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:01.164694Z"},"links":{"citing_paper":"/paper/2605.14231"},"observation_digest":"sha256:34e50e37396b98bb1b91c4a9c82ce3e63ea49feef6658ee754302ff9c9a25015","observation_id":"0b14bd4e-3dfa-4ee1-a336-b0e809aa504a","resolution":{"observed_at":"2026-05-15T08:20:18.434392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2508.21376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21376","snapshot_observed_at":"2026-07-04T13:59:52.874154Z","title":"arXiv preprint arXiv:2508.21376 , year=","venue":null,"work_id":"a56c2721-5ed0-4324-8477-082878ecad65","year":2025},"citing_paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","snapshot_observed_at":"2026-08-01T16:03:09.685528Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:01.164694Z"},"links":{"cited_paper":"/paper/2508.21376","citing_paper":"/paper/2605.14231"},"observation_digest":"sha256:fb58e025b700124ef76daf8afef6265e16a27968d6efae18dd3bc79b264ae700","observation_id":"ec1072ce-d1cb-4a1e-97ae-f072a79f6845","resolution":{"observed_at":"2026-05-15T01:53:28.861492Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08962","last_updated":"2025-08-12T14:25:55Z","snapshot_observed_at":"2026-08-07T05:14:55.078958Z","submitted_at":"2025-08-12T14:25:55Z","title":"Selection of Layers from Self-supervised Learning Models for Predicting Mean-Opinion-Score of Speech","version":1},"cited_work":{"arxiv_id":"2508.08962","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08962","snapshot_observed_at":"2026-07-04T14:39:57.477580Z","title":"K., Schuldt, C., and Chatterjee, S","venue":null,"work_id":"835869ec-d7e5-436b-b75a-65b632f9990d","year":2025},"citing_paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","snapshot_observed_at":"2026-08-01T16:03:09.685528Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:01.164694Z"},"links":{"cited_paper":"/paper/2508.08962","citing_paper":"/paper/2605.14231"},"observation_digest":"sha256:df2c5c65ef52e5cafe9e36a7ee13d17df03fb2689cb33e2fa3180cf7db49ca47","observation_id":"79cee91e-fdd0-429e-bf36-7ddac2a43092","resolution":{"observed_at":"2026-05-15T01:53:28.877532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Acoustic scene classification: an overview of dcase 2017 challenge en- tries","venue":null,"work_id":"8b544ff6-e52b-419d-84bc-4b6cc58e6987","year":2017},"citing_paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","snapshot_observed_at":"2026-08-01T16:03:09.685528Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:01.164694Z"},"links":{"citing_paper":"/paper/2605.14231"},"observation_digest":"sha256:8062ea958f052b154190b54e67beb83b111f652e6648f2e217b5a660111ea6dc","observation_id":"6cacd83a-3e74-4d9b-8c46-8adfe7ebd0a4","resolution":{"observed_at":"2026-05-15T08:20:18.436530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.12260","last_updated":"2022-04-26T12:32:10Z","snapshot_observed_at":"2026-08-07T05:19:10.506439Z","submitted_at":"2022-04-26T12:32:10Z","title":"Masked Spectrogram Modeling using Masked Autoencoders for Learning General-purpose Audio Representation","version":1},"cited_work":{"arxiv_id":"2204.12260","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2204.12260","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked spectrogram modeling using masked autoencoders for learning general-purpose audio repre- sentation.arXiv preprint arXiv:2204.12260","venue":null,"work_id":"6401d260-65b7-4b41-b1f5-956099bfb7ca","year":null},"citing_paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","snapshot_observed_at":"2026-08-01T16:03:09.685528Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:01.164694Z"},"links":{"cited_paper":"/paper/2204.12260","citing_paper":"/paper/2605.14231"},"observation_digest":"sha256:b3f9b9167ca4186ad24962c4af33366d6b673fa873272d7d9664a01bb0b88207","observation_id":"fafeee34-0fbe-40bf-8a46-52e1c9d03d0d","resolution":{"observed_at":"2026-05-15T01:53:28.865087Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","snapshot_observed_at":"2026-08-01T16:03:09.685528Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:01.164694Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2605.14231"},"observation_digest":"sha256:f29909300952c75ac36059485f18b313a2d556e18bbdb9b1903cf268bc2f3e4c","observation_id":"f46b6721-cd00-4a59-a4a9-22fb9796d812","resolution":{"observed_at":"2026-05-15T01:53:28.857982Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The kaldi speech recognition toolkit","venue":null,"work_id":"0bbf1222-b896-438a-a349-b2bc18260675","year":2011},"citing_paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","snapshot_observed_at":"2026-08-01T16:03:09.685528Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:01.164694Z"},"links":{"citing_paper":"/paper/2605.14231"},"observation_digest":"sha256:46fdbce5676b82b44364623f0941a0280478ef5cd7a8bb1ce3abb6ce500cf850","observation_id":"3488ce68-9a17-456d-a8e6-4a18a5351dae","resolution":{"observed_at":"2026-05-15T08:20:18.432079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24901","last_updated":"2026-05-29T15:48:51Z","snapshot_observed_at":"2026-08-04T13:51:39.702206Z","submitted_at":"2025-09-29T15:11:18Z","title":"Unmute the Patch Tokens: Rethinking Probing in Multi-Label Audio Classification","version":4},"cited_work":{"arxiv_id":"2509.24901","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.24901","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unmute the patch tokens: Rethinking probing in multi-label audio classification","venue":null,"work_id":"1e32f6c3-f8ae-4d02-87fe-edf7f2a0b1a0","year":null},"citing_paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","snapshot_observed_at":"2026-08-01T16:03:09.685528Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:01.164694Z"},"links":{"cited_paper":"/paper/2509.24901","citing_paper":"/paper/2605.14231"},"observation_digest":"sha256:a83299a14eb990411bcac0551f9c8408faf42952650980d4f783d83a12c9bd01","observation_id":"05f792ba-a12e-4388-9066-1c2db1efbf8a","resolution":{"observed_at":"2026-06-01T03:02:52.993424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","snapshot_observed_at":"2026-08-01T16:03:09.685528Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:01.164694Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2605.14231"},"observation_digest":"sha256:caf2a3e23cf35ced9345f2c2e719e724dca1c0f78c40f3b429f24c2851e664a1","observation_id":"9ddf441b-6201-4d9d-b4e6-7383bdb30365","resolution":{"observed_at":"2026-05-15T01:53:28.871557Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03209","last_updated":"2018-04-09T19:58:17Z","snapshot_observed_at":"2026-07-06T06:32:32.083176Z","submitted_at":"2018-04-09T19:58:17Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","version":1},"cited_work":{"arxiv_id":"1804.03209","doi":"10.48550/arxiv.1804.03209","metadata_source":"pith","pith_arxiv_id":"1804.03209","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","venue":"cs.CL","work_id":"f4d53a51-5741-47e1-b328-d6503065d1bd","year":2018},"citing_paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","snapshot_observed_at":"2026-08-01T16:03:09.685528Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:01.164694Z"},"links":{"cited_paper":"/paper/1804.03209","citing_paper":"/paper/2605.14231"},"observation_digest":"sha256:dd0b83bc2a3b48ba5296c9680c1d9607905721d39f5c498d609e97ea160fcd11","observation_id":"0e4ca1b0-23e7-40b3-8f73-2e802a075736","resolution":{"observed_at":"2026-05-15T01:53:28.874553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-07-06T11:05:55.984799Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","snapshot_observed_at":"2026-08-01T16:03:09.685528Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:01.164694Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2605.14231"},"observation_digest":"sha256:e31b73216e7fc081e7d60ac62b5db3e7231c0e4d9b71da24a225adf86b7e4cb5","observation_id":"4bcd3ac3-e213-4e36-8687-991e32b4b297","resolution":{"observed_at":"2026-05-15T01:53:28.854680Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.04529","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:13:45.455667Z","title":"Esdd 2026: Environmental sound deepfake detection challenge evalu- ation plan","venue":null,"work_id":"8997fd5f-979f-49a5-b0f6-e8b0eb732c61","year":2026},"citing_paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","snapshot_observed_at":"2026-08-01T16:03:09.685528Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:01.164694Z"},"links":{"citing_paper":"/paper/2605.14231"},"observation_digest":"sha256:1c57dd98ad1c336f1aceab2169986aa62e0a1fc4c5ec0fa21b121dc8c75b6963","observation_id":"f74a1083-df1d-4a18-843b-2412e7f37e7f","resolution":{"observed_at":"2026-05-15T01:53:28.851304Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Experimental Settings Table 6 summarizes the detailed experimental settings for both pre-training and fine-tuning, while Table 7 reports the settings used for linear probing","venue":null,"work_id":"ab0834e3-5fca-429e-9a92-077dd39a674c","year":2018},"citing_paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","snapshot_observed_at":"2026-08-01T16:03:09.685528Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:01.164694Z"},"links":{"citing_paper":"/paper/2605.14231"},"observation_digest":"sha256:f6df8d5719e86d84d32b26953bc105555ef753ff7613417924fed7fc79f2d07d","observation_id":"69e99cf6-99e5-4429-80a3-8aa52bf612cb","resolution":{"observed_at":"2026-05-15T08:20:18.425788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9928b264-7270-4e0a-a026-abf5d0ae1aca","year":2023},"citing_paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","snapshot_observed_at":"2026-08-01T16:03:09.685528Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:01.164694Z"},"links":{"citing_paper":"/paper/2605.14231"},"observation_digest":"sha256:a151912ed925524cf3536a0fc86d3eeb78729e07013212c22ad49169681ebaf9","observation_id":"3bd612a9-a124-47e2-a4b3-9ae0a2464653","resolution":{"observed_at":"2026-05-15T08:20:18.427948Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-01T16:03:09.685528Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":1,"verified_exact":8,"verified_fuzzy":5},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2605.14231."}