Pith. sign in

Paper Citation Record · LEDGER

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining

As of 14 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 1 inbound Pith citation observation for arXiv:2412.05951.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.05951 v1

Coverage vector

measured 30 of 30 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T20:14:04.684278Z

measured 31 of 31 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-11T20:14:04.604966Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-11T20:14:04.732612Z

Reference resolution

30 of 30 outbound references displayed

  • verified exact1
  • verified fuzzy18
  • unresolved10
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 928da2d0-e5ed-4448-957d-dc448909679a · outbound

This paper cites When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining

Reference 1

Resolution
metadata mismatch
local_arxiv, observed 2026-08-11T20:14:04.735553Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.604966Z digest=sha256:bf298a0e5c9e33d2903046435c26bae7772359ce2cb6827507f723bd0b566f80

Observation fd972f38-384f-42ac-a977-031faf73fd03 · outbound

This paper cites an unresolved cited work.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Unresolved cited work

Reference 2

Resolution
unresolved
raw_fallback, observed 2026-08-11T20:14:04.914715Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.608375Z digest=sha256:c49c3384057ddbdbbab9e0ec0fa62bf72957e9b6452d361a8257075855a72618

Observation 4dd49a8e-defb-488f-91c7-3c04c684030e · outbound

This paper cites an unresolved cited work.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-11T20:14:04.906867Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.611142Z digest=sha256:68e5da77a137ae2b51bfd496cedf6b7fe5e8e3c9f10825abb893d9cd6890af0c

Observation 105172e6-8449-4542-8999-f178ed866e85 · outbound

This paper cites an unresolved cited work.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-08-11T20:14:04.899616Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.614284Z digest=sha256:72f22808f56f800eb291465a713925756bc587e2afd9be11830df74ebea98381

Observation 48a2ea91-8b9f-4250-a958-7199251ade32 · outbound

This paper cites However, it is challenging due to the need of substantial audio data and a well-designed learning objective for large-scale audio pretraining.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining However, it is challenging due to the need of substantial audio data and a well-designed learning objective for large-scale audio pretraining

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.890997Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.616982Z digest=sha256:589cc265baa7e9019a2ae30dd08741031d3e1b74f864aa2ee62b71ca1b70ca63

Observation 53d31062-d117-42c8-8db4-2eb126aab1e6 · outbound

This paper cites Attention is all you need,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Attention is all you need,

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-11T20:14:04.619642Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:14:04.619642Z digest=sha256:74cdafdc571d3bb3603732c830ac059d9e6a6b45c005d225b95fd7a1bc571f1a

Observation 1f51dcf8-28c7-4c46-b3f6-2597a2f93d77 · outbound

This paper cites Emerging properties in self-supervised vision transformers,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Emerging properties in self-supervised vision transformers,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.879575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.622371Z digest=sha256:44e9f3e5ff0bcba123f942b017ad4e25d91506d1dcb3b0a5d69b11ec4c1998a3

Observation 1be0c2ca-9334-4302-875f-e00274961bb5 · outbound

This paper cites Exploring simple siamese representation learning,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Exploring simple siamese representation learning,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.871647Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.624800Z digest=sha256:76b297f0c2de9cfc5236222db48257f20a1b9e1aeab77c54533392cf2e9a88d4

Observation d36d1d93-2314-4bc0-814d-ebb892e4b9a6 · outbound

This paper cites Audio set: An ontology and human-labeled dataset for audio events,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Audio set: An ontology and human-labeled dataset for audio events,

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-11T20:14:04.627315Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:14:04.627315Z digest=sha256:141ca1ddf8e69d3cee44124c015cac81c02141b5924384815754c4789596804c

Observation 50a3b51e-f62b-4bc3-beef-abeadc0f17e8 · outbound

This paper cites Epic- sounds: A large-scale dataset of actions that sound,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Epic- sounds: A large-scale dataset of actions that sound,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.860008Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.629781Z digest=sha256:da8cc9879c18aa8f85964c58640327c8468fd875297ff005160365d6c526a65e

Observation 18bc56ce-18e1-4243-9668-9ab11b1ec1d7 · outbound

This paper cites Im- agenet: A large-scale hierarchical image database,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Im- agenet: A large-scale hierarchical image database,

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T20:14:04.632410Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:14:04.632410Z digest=sha256:5bd3a6cd4d624547f73e8b1ce89d985700061740f9c942df856c5551d8bab0c2

Observation 0a4970a3-2b5d-4aeb-b0be-93ce7c21489a · outbound

This paper cites Rethinking CNN Models for Audio Classification.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Rethinking CNN Models for Audio Classification

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-11T20:14:04.635047Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:14:04.635047Z digest=sha256:05ad94047b8c000a06cd5f3b689937ef21913d7bed3fcc27f1877f5cf5b6af7e

Observation f5320e5c-31f3-49d3-bff8-b3870d9fd8ca · outbound

This paper cites AST: Audio Spectrogram Transformer,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining AST: Audio Spectrogram Transformer,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.848572Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.637822Z digest=sha256:58a99e55ce1dc75ae02842b858da22b2130990f283d2992661fd67845fac99be

Observation 98f49bf0-1d34-43b8-bd74-0a152181e903 · outbound

This paper cites PANNs: Large-scale pretrained audio neural networks for audio pattern recognition,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining PANNs: Large-scale pretrained audio neural networks for audio pattern recognition,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.841444Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.640335Z digest=sha256:ce4b9c81ae0d3f8f0cf0356af961b0099edd4d7a8512ada4a9a5765d99a59727

Observation e45e73d2-ec9e-4098-b822-ae77037c7de5 · outbound

This paper cites SSAST: Self- Supervised Audio Spectrogram Transformer,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining SSAST: Self- Supervised Audio Spectrogram Transformer,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.834793Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.642631Z digest=sha256:f958487a3f6defa84e16881cc8cd293a881d2f2662f8649bd4c7b48ae9f0870c

Observation af538c4e-92e4-4c09-a782-951c86fc6d49 · outbound

This paper cites Masked autoencoders that lis- ten,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Masked autoencoders that lis- ten,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.827915Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.645144Z digest=sha256:07ac7c66f51eb35d8a219685d229fd6a80cff479d27ef9802b796b3e0e2b77c0

Observation c044a19d-cbbc-4095-a327-76a980e29120 · outbound

This paper cites Convolutional Bypasses Are Better Vision Transformer Adapters.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Convolutional Bypasses Are Better Vision Transformer Adapters

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-11T20:14:04.647561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:14:04.647561Z digest=sha256:8295092ff1b08adbc158b58268fff5cee435e715d059f120250c26c77c15437f

Observation 0a14f0d7-d139-4306-9c3a-4259a9d91a87 · outbound

This paper cites ESC: Dataset for environmental sound classifica- tion,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining ESC: Dataset for environmental sound classifica- tion,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.820942Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.650227Z digest=sha256:12bb2b406497010068cae7610e5604b79ac84d623e0221113c0c84e96ca9eb0c

Observation e5934044-b9f1-481c-a2f9-85cd464ca6e5 · outbound

This paper cites Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-11T20:14:04.654272Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:14:04.654272Z digest=sha256:7c93d5e8da2966707c6982f64b13e7c52e9efe34ef6c8027fd130181a1e59546

Observation cbff193e-e60f-4620-a787-46224a732387 · outbound

This paper cites Learning multiple visual domains with residual adapters,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Learning multiple visual domains with residual adapters,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.812687Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.657323Z digest=sha256:319663a07f62fdd6e6608a4c65aeebf315d926ecea5e4310190d434db1887af7

Observation 9bba5d8d-8b40-42c9-93cc-b32a0f14d7e6 · outbound

This paper cites Parameter-efficient transfer learning for NLP,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Parameter-efficient transfer learning for NLP,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.804721Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.659728Z digest=sha256:5dd83ed9c86ad2850d93b07ca91596616b863fe4c79c5b8909579b951092ba02

Observation 247b8584-efbd-4cfa-a63e-9b57eef58906 · outbound

This paper cites LoRA: Low-rank adaptation of large lan- guage models,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining LoRA: Low-rank adaptation of large lan- guage models,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.796317Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.662309Z digest=sha256:46a26af7a2db6018648c6f3b353b174c85b540f7255c91b8efcd88dba4d11f56

Observation 1f648361-37f7-4506-bb8b-df13ddee32d9 · outbound

This paper cites The Power of Scale for Parameter-Efficient Prompt Tuning,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining The Power of Scale for Parameter-Efficient Prompt Tuning,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.787855Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.665270Z digest=sha256:a7e8ac7b6658b5ccc46308d08ee9bb33a2af1ea62fd317c3bfb76b4ff26aa62b

Observation e6c20f61-70bb-423f-b366-845a8501edff · outbound

This paper cites Prefix-Tuning: Optimizing Continuous Prompts for Generation,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Prefix-Tuning: Optimizing Continuous Prompts for Generation,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.779774Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.667760Z digest=sha256:b6043593d8c90841b3e6a448f6140457bf96a673f16098d7330aeee0de4c5620

Observation d4e44f1a-3ac8-4e5e-a34b-cf4ce38c3fbc · outbound

This paper cites Contrastive audio-visual masked autoencoder,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Contrastive audio-visual masked autoencoder,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.770538Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.670751Z digest=sha256:7cf6e2c62173f8b2b46b5c74d69dd19ed41c2be267b03aae66e724b998337c82

Observation 2d269064-a615-481d-b295-34dedd95ce4e · outbound

This paper cites MAE- AST: Masked Autoencoding Audio Spectrogram Trans- former,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining MAE- AST: Masked Autoencoding Audio Spectrogram Trans- former,

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.763286Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.674220Z digest=sha256:0ec73e0ead72387323128a90571467c24330cdd3291243b085281535fbedd039

Observation d29d7a09-995c-4874-b445-9015cb6aecfe · outbound

This paper cites Masked spectrogram prediction for self-supervised audio pre-training,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Masked spectrogram prediction for self-supervised audio pre-training,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.754507Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.676637Z digest=sha256:c7454caf31c116e8239057714f247b43e64b527b3cedec315613fe458e2b1937

Observation 1b008e05-1d11-4c02-9eaa-588048e9a67b · outbound

This paper cites Lib- rispeech: An asr corpus based on public domain audio books,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Lib- rispeech: An asr corpus based on public domain audio books,

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-11T20:14:04.678989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:14:04.678989Z digest=sha256:ca3a7130863de75a2005ce8c7f864204e7fa9d8974096d678a6d0a036e27342b

Observation b6a40fb1-54c1-4b42-86c8-4a96dc31c7e5 · outbound

This paper cites To- wards a unified view of parameter-efficient transfer learning,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining To- wards a unified view of parameter-efficient transfer learning,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.743198Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.681736Z digest=sha256:ced345b2469cda27e68c4dc23cd8b61a2c4e69cba7cb83cd64f0e64c899bb2e2

Observation bcdfcc39-39eb-4141-964b-fb8984e8c848 · outbound

This paper cites PEFT for Speech: Unveiling Optimal Placement, Merging Strategies, and Ensemble Techniques.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining PEFT for Speech: Unveiling Optimal Placement, Merging Strategies, and Ensemble Techniques

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-08-11T20:14:04.708744Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.684278Z digest=sha256:63bbcb3d011e9a5027286a5adcac9563c125d2440a0717ef35f567a0c2892ee8

Pith citing papers

Observation 928da2d0-e5ed-4448-957d-dc448909679a · inbound

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining cites this paper.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining

Reference 1

Resolution
metadata mismatch
local_arxiv, observed 2026-08-11T20:14:04.735553Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-11T20:14:04.604966Z digest=sha256:bf298a0e5c9e33d2903046435c26bae7772359ce2cb6827507f723bd0b566f80