{"as_of":"2026-08-14T09:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c1a11ca61ecdc54600937f02895f212851b17bf1dc402d677758a33bf26e995c","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:14:04.684278Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:14:04.604966Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T20:14:04.732612Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"cited_work":{"arxiv_id":"2412.05951","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.05951","snapshot_observed_at":"2026-08-11T20:14:04.732612Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","venue":"cs.SD","work_id":"f7dce55e-9d61-45c1-9d85-2fda0fe518e2","year":2024},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.604966Z"},"links":{"cited_paper":"/paper/2412.05951","citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:bf298a0e5c9e33d2903046435c26bae7772359ce2cb6827507f723bd0b566f80","observation_id":"928da2d0-e5ed-4448-957d-dc448909679a","resolution":{"observed_at":"2026-08-11T20:14:04.735553Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.05951/citation-record","integrity":"/paper/2412.05951/integrity","json":"/paper/2412.05951/citation-record.json","paper":"/paper/2412.05951"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"cited_work":{"arxiv_id":"2412.05951","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.05951","snapshot_observed_at":"2026-08-11T20:14:04.732612Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","venue":"cs.SD","work_id":"f7dce55e-9d61-45c1-9d85-2fda0fe518e2","year":2024},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.604966Z"},"links":{"cited_paper":"/paper/2412.05951","citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:bf298a0e5c9e33d2903046435c26bae7772359ce2cb6827507f723bd0b566f80","observation_id":"928da2d0-e5ed-4448-957d-dc448909679a","resolution":{"observed_at":"2026-08-11T20:14:04.735553Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.912289Z","title":null,"venue":null,"work_id":"53ee518e-f1a1-43ed-9059-4b2b23b8f36c","year":null},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.608375Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:c49c3384057ddbdbbab9e0ec0fa62bf72957e9b6452d361a8257075855a72618","observation_id":"fd972f38-384f-42ac-a977-031faf73fd03","resolution":{"observed_at":"2026-08-11T20:14:04.914715Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.904329Z","title":null,"venue":null,"work_id":"7bbf524d-95e8-49f2-9d25-a79bf7873964","year":null},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.611142Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:68e5da77a137ae2b51bfd496cedf6b7fe5e8e3c9f10825abb893d9cd6890af0c","observation_id":"4dd49a8e-defb-488f-91c7-3c04c684030e","resolution":{"observed_at":"2026-08-11T20:14:04.906867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.896973Z","title":null,"venue":null,"work_id":"805dc0af-1914-4850-904b-9989c4594dfd","year":null},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.614284Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:72f22808f56f800eb291465a713925756bc587e2afd9be11830df74ebea98381","observation_id":"105172e6-8449-4542-8999-f178ed866e85","resolution":{"observed_at":"2026-08-11T20:14:04.899616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.887705Z","title":"However, it is challenging due to the need of substantial audio data and a well-designed learning objective for large-scale audio pretraining","venue":null,"work_id":"db3cecfb-fb10-4586-931c-8828f822ccad","year":null},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.616982Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:589cc265baa7e9019a2ae30dd08741031d3e1b74f864aa2ee62b71ca1b70ca63","observation_id":"48a2ea91-8b9f-4250-a958-7199251ade32","resolution":{"observed_at":"2026-08-11T20:14:04.890997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.619642Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.619642Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:74cdafdc571d3bb3603732c830ac059d9e6a6b45c005d225b95fd7a1bc571f1a","observation_id":"53d31062-d117-42c8-8db4-2eb126aab1e6","resolution":{"observed_at":"2026-08-11T20:14:04.619642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.876788Z","title":"Emerging properties in self-supervised vision transformers,","venue":null,"work_id":"daa9e70d-8168-40f9-97a7-e8e700b6d42e","year":2021},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.622371Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:44e9f3e5ff0bcba123f942b017ad4e25d91506d1dcb3b0a5d69b11ec4c1998a3","observation_id":"1f51dcf8-28c7-4c46-b3f6-2597a2f93d77","resolution":{"observed_at":"2026-08-11T20:14:04.879575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.868840Z","title":"Exploring simple siamese representation learning,","venue":null,"work_id":"a9019e77-8ae0-4a7f-a4e5-22d744475535","year":2021},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.624800Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:76b297f0c2de9cfc5236222db48257f20a1b9e1aeab77c54533392cf2e9a88d4","observation_id":"1be0c2ca-9334-4302-875f-e00274961bb5","resolution":{"observed_at":"2026-08-11T20:14:04.871647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.627315Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.627315Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:141ca1ddf8e69d3cee44124c015cac81c02141b5924384815754c4789596804c","observation_id":"d36d1d93-2314-4bc0-814d-ebb892e4b9a6","resolution":{"observed_at":"2026-08-11T20:14:04.627315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.857022Z","title":"Epic- sounds: A large-scale dataset of actions that sound,","venue":null,"work_id":"e047840a-fa8e-460c-8cdf-97b9df0ffb02","year":2023},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.629781Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:da8cc9879c18aa8f85964c58640327c8468fd875297ff005160365d6c526a65e","observation_id":"50a3b51e-f62b-4bc3-beef-abeadc0f17e8","resolution":{"observed_at":"2026-08-11T20:14:04.860008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.632410Z","title":"Im- agenet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.632410Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:5bd3a6cd4d624547f73e8b1ce89d985700061740f9c942df856c5551d8bab0c2","observation_id":"18bc56ce-18e1-4243-9668-9ab11b1ec1d7","resolution":{"observed_at":"2026-08-11T20:14:04.632410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.11154","last_updated":"2020-11-13T19:09:09Z","snapshot_observed_at":"2026-08-13T10:14:31.550038Z","submitted_at":"2020-07-22T01:31:44Z","title":"Rethinking CNN Models for Audio Classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.11154","snapshot_observed_at":"2026-08-11T20:14:04.635047Z","title":"Rethinking cnn mod- els for audio classification,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.635047Z"},"links":{"cited_paper":"/paper/2007.11154","citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:05ad94047b8c000a06cd5f3b689937ef21913d7bed3fcc27f1877f5cf5b6af7e","observation_id":"0a4970a3-2b5d-4aeb-b0be-93ce7c21489a","resolution":{"observed_at":"2026-08-11T20:14:04.635047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.845976Z","title":"AST: Audio Spectrogram Transformer,","venue":null,"work_id":"25818c64-e1e1-437b-b709-efc6ae4dfe09","year":2021},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.637822Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:58a99e55ce1dc75ae02842b858da22b2130990f283d2992661fd67845fac99be","observation_id":"f5320e5c-31f3-49d3-bff8-b3870d9fd8ca","resolution":{"observed_at":"2026-08-11T20:14:04.848572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.838785Z","title":"PANNs: Large-scale pretrained audio neural networks for audio pattern recognition,","venue":null,"work_id":"8179d0b3-f066-4d18-b62c-b7d2cec7aa1a","year":2020},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.640335Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:ce4b9c81ae0d3f8f0cf0356af961b0099edd4d7a8512ada4a9a5765d99a59727","observation_id":"98f49bf0-1d34-43b8-bd74-0a152181e903","resolution":{"observed_at":"2026-08-11T20:14:04.841444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.832131Z","title":"SSAST: Self- Supervised Audio Spectrogram Transformer,","venue":null,"work_id":"39ab6bcb-e2bc-45d9-abab-ee12169a3a35","year":2022},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.642631Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:f958487a3f6defa84e16881cc8cd293a881d2f2662f8649bd4c7b48ae9f0870c","observation_id":"e45e73d2-ec9e-4098-b822-ae77037c7de5","resolution":{"observed_at":"2026-08-11T20:14:04.834793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.825175Z","title":"Masked autoencoders that lis- ten,","venue":null,"work_id":"f7b59d9a-e964-4de7-bb96-114b937b8e3a","year":2022},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.645144Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:07ac7c66f51eb35d8a219685d229fd6a80cff479d27ef9802b796b3e0e2b77c0","observation_id":"af538c4e-92e4-4c09-a782-951c86fc6d49","resolution":{"observed_at":"2026-08-11T20:14:04.827915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.07039","last_updated":"2022-08-09T10:40:06Z","snapshot_observed_at":"2026-08-13T15:04:01.538708Z","submitted_at":"2022-07-14T16:32:28Z","title":"Convolutional Bypasses Are Better Vision Transformer Adapters","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.07039","snapshot_observed_at":"2026-08-11T20:14:04.647561Z","title":"Convolutional bypasses are better vision transformer adapters,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.647561Z"},"links":{"cited_paper":"/paper/2207.07039","citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:8295092ff1b08adbc158b58268fff5cee435e715d059f120250c26c77c15437f","observation_id":"c044a19d-cbbc-4095-a327-76a980e29120","resolution":{"observed_at":"2026-08-11T20:14:04.647561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.817201Z","title":"ESC: Dataset for environmental sound classifica- tion,","venue":null,"work_id":"8b245c57-072a-4d70-9c2c-6e961bbf55dc","year":2015},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.650227Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:12bb2b406497010068cae7610e5604b79ac84d623e0221113c0c84e96ca9eb0c","observation_id":"0a14f0d7-d139-4306-9c3a-4259a9d91a87","resolution":{"observed_at":"2026-08-11T20:14:04.820942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03209","last_updated":"2018-04-09T19:58:17Z","snapshot_observed_at":"2026-07-06T06:32:32.083176Z","submitted_at":"2018-04-09T19:58:17Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03209","snapshot_observed_at":"2026-08-11T20:14:04.654272Z","title":"Speech commands: A dataset for limited-vocabulary speech recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.654272Z"},"links":{"cited_paper":"/paper/1804.03209","citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:7c93d5e8da2966707c6982f64b13e7c52e9efe34ef6c8027fd130181a1e59546","observation_id":"e5934044-b9f1-481c-a2f9-85cd464ca6e5","resolution":{"observed_at":"2026-08-11T20:14:04.654272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.809998Z","title":"Learning multiple visual domains with residual adapters,","venue":null,"work_id":"38a458d4-9603-407a-87ed-cb7969461392","year":2017},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.657323Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:319663a07f62fdd6e6608a4c65aeebf315d926ecea5e4310190d434db1887af7","observation_id":"cbff193e-e60f-4620-a787-46224a732387","resolution":{"observed_at":"2026-08-11T20:14:04.812687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.801613Z","title":"Parameter-efficient transfer learning for NLP,","venue":null,"work_id":"9afef3d2-06ff-4e46-b4f3-bbf65bd2c873","year":2019},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.659728Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:5dd83ed9c86ad2850d93b07ca91596616b863fe4c79c5b8909579b951092ba02","observation_id":"9bba5d8d-8b40-42c9-93cc-b32a0f14d7e6","resolution":{"observed_at":"2026-08-11T20:14:04.804721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.793521Z","title":"LoRA: Low-rank adaptation of large lan- guage models,","venue":null,"work_id":"9a9b424d-1457-4473-b4ad-e373d0cbfb93","year":2022},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.662309Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:46a26af7a2db6018648c6f3b353b174c85b540f7255c91b8efcd88dba4d11f56","observation_id":"247b8584-efbd-4cfa-a63e-9b57eef58906","resolution":{"observed_at":"2026-08-11T20:14:04.796317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.784653Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning,","venue":null,"work_id":"0d7e8320-f159-4248-bc4a-c1c8f6690717","year":2021},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.665270Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:a7e8ac7b6658b5ccc46308d08ee9bb33a2af1ea62fd317c3bfb76b4ff26aa62b","observation_id":"1f648361-37f7-4506-bb8b-df13ddee32d9","resolution":{"observed_at":"2026-08-11T20:14:04.787855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.776148Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation,","venue":null,"work_id":"23d37dd6-fd7b-422f-b110-04e5663070c5","year":2021},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.667760Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:b6043593d8c90841b3e6a448f6140457bf96a673f16098d7330aeee0de4c5620","observation_id":"e6c20f61-70bb-423f-b366-845a8501edff","resolution":{"observed_at":"2026-08-11T20:14:04.779774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.767841Z","title":"Contrastive audio-visual masked autoencoder,","venue":null,"work_id":"1d82c544-f132-41ff-83fc-da41ebe73623","year":2023},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.670751Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:7cf6e2c62173f8b2b46b5c74d69dd19ed41c2be267b03aae66e724b998337c82","observation_id":"d4e44f1a-3ac8-4e5e-a34b-cf4ce38c3fbc","resolution":{"observed_at":"2026-08-11T20:14:04.770538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.760261Z","title":"MAE- AST: Masked Autoencoding Audio Spectrogram Trans- former,","venue":null,"work_id":"71328a86-c34b-41c8-b728-be89cb2e343d","year":2022},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.674220Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:0ec73e0ead72387323128a90571467c24330cdd3291243b085281535fbedd039","observation_id":"2d269064-a615-481d-b295-34dedd95ce4e","resolution":{"observed_at":"2026-08-11T20:14:04.763286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.751459Z","title":"Masked spectrogram prediction for self-supervised audio pre-training,","venue":null,"work_id":"635771d1-47f9-4a04-b4d6-c69c21f3b0ab","year":2023},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.676637Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:c7454caf31c116e8239057714f247b43e64b527b3cedec315613fe458e2b1937","observation_id":"d29d7a09-995c-4874-b445-9015cb6aecfe","resolution":{"observed_at":"2026-08-11T20:14:04.754507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.678989Z","title":"Lib- rispeech: An asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.678989Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:ca3a7130863de75a2005ce8c7f864204e7fa9d8974096d678a6d0a036e27342b","observation_id":"1b008e05-1d11-4c02-9eaa-588048e9a67b","resolution":{"observed_at":"2026-08-11T20:14:04.678989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:14:04.740307Z","title":"To- wards a unified view of parameter-efficient transfer learning,","venue":null,"work_id":"b30aeb80-6fe8-4c3b-84fb-79ab47037445","year":2022},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.681736Z"},"links":{"citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:ced345b2469cda27e68c4dc23cd8b61a2c4e69cba7cb83cd64f0e64c899bb2e2","observation_id":"b6a40fb1-54c1-4b42-86c8-4a96dc31c7e5","resolution":{"observed_at":"2026-08-11T20:14:04.743198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02122","last_updated":"2024-02-07T07:36:34Z","snapshot_observed_at":"2026-08-13T04:49:10.729481Z","submitted_at":"2024-01-04T08:11:33Z","title":"PEFT for Speech: Unveiling Optimal Placement, Merging Strategies, and Ensemble Techniques","version":2},"cited_work":{"arxiv_id":"2401.02122","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.02122","snapshot_observed_at":"2026-08-11T20:14:04.703732Z","title":"PEFT for Speech: Unveiling Optimal Placement, Merging Strategies, and Ensemble Techniques","venue":"cs.CL","work_id":"da669b94-0546-4a4f-9d58-95864ead1952","year":2024},"citing_paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T20:14:04.684278Z"},"links":{"cited_paper":"/paper/2401.02122","citing_paper":"/paper/2412.05951"},"observation_digest":"sha256:63bbcb3d011e9a5027286a5adcac9563c125d2440a0717ef35f567a0c2892ee8","observation_id":"bcdfcc39-39eb-4141-964b-fb8984e8c848","resolution":{"observed_at":"2026-08-11T20:14:04.708744Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.05951","last_updated":"2024-12-08T14:14:30Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T06:40:38.227623Z","submitted_at":"2024-12-08T14:14:30Z","title":"When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":10,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 1 inbound Pith citation observation for arXiv:2412.05951."}