Pith. sign in

Paper Citation Record · LEDGER

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining

As of 15 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 1 inbound Pith citation observation for arXiv:2412.05951.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.05951 v1

Coverage vector

measured 30 of 30 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T20:14:04.684278Z

measured 31 of 31 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-11T20:14:04.604966Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-11T20:14:04.732612Z

Reference resolution

30 of 30 outbound references displayed

  • verified exact1
  • verified fuzzy18
  • unresolved10
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 928da2d0-e5ed-4448-957d-dc448909679a · outbound

This paper cites When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining

Reference 1

Resolution
metadata mismatch
local_arxiv, observed 2026-08-11T20:14:04.735553Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.604966Z digest=sha256:8b1794fb2b6cedb91516a1af1d641476037072684c7d6ce25d4070a106623936

Observation fd972f38-384f-42ac-a977-031faf73fd03 · outbound

This paper cites an unresolved cited work.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Unresolved cited work

Reference 2

Resolution
unresolved
raw_fallback, observed 2026-08-11T20:14:04.914715Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.608375Z digest=sha256:8d66ef5abe89968d0e49c8da9a166a74526572c8838ea71abaddb2a9bd875d73

Observation 4dd49a8e-defb-488f-91c7-3c04c684030e · outbound

This paper cites an unresolved cited work.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-11T20:14:04.906867Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.611142Z digest=sha256:791aace715e49767ca66207227209aaa6995208e08c267d2e2c3c614106ab46a

Observation 105172e6-8449-4542-8999-f178ed866e85 · outbound

This paper cites an unresolved cited work.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-08-11T20:14:04.899616Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.614284Z digest=sha256:d6b44a2d84dea0baecf820a8620f270d032e382cf183da1eb763a1395e32e64a

Observation 48a2ea91-8b9f-4250-a958-7199251ade32 · outbound

This paper cites However, it is challenging due to the need of substantial audio data and a well-designed learning objective for large-scale audio pretraining.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining However, it is challenging due to the need of substantial audio data and a well-designed learning objective for large-scale audio pretraining

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.890997Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.616982Z digest=sha256:6d3a16bd4808fb84a94aeb3da94f3ec00da34bea69e8386ebc01bef9059e3553

Observation 53d31062-d117-42c8-8db4-2eb126aab1e6 · outbound

This paper cites Attention is all you need,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Attention is all you need,

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-11T20:14:04.619642Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:14:04.619642Z digest=sha256:180f81024e133fbd44e9d52225e76752962a94a1b00fb2f89896e27210ec43d0

Observation 1f51dcf8-28c7-4c46-b3f6-2597a2f93d77 · outbound

This paper cites Emerging properties in self-supervised vision transformers,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Emerging properties in self-supervised vision transformers,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.879575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.622371Z digest=sha256:a021fdf98b6b8db51860f65dec72c028abdd08729788826ad5402cf3e2db8aa1

Observation 1be0c2ca-9334-4302-875f-e00274961bb5 · outbound

This paper cites Exploring simple siamese representation learning,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Exploring simple siamese representation learning,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.871647Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.624800Z digest=sha256:be3d5eb0970e9facc25128f74713a486c2b70a26af0a7206d3ee5de90a5fc0c1

Observation d36d1d93-2314-4bc0-814d-ebb892e4b9a6 · outbound

This paper cites Audio set: An ontology and human-labeled dataset for audio events,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Audio set: An ontology and human-labeled dataset for audio events,

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-11T20:14:04.627315Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:14:04.627315Z digest=sha256:31754279397bb32c7cc0defafa04d9eb192b6ad332b288b8b6c7eb4bf828d377

Observation 50a3b51e-f62b-4bc3-beef-abeadc0f17e8 · outbound

This paper cites Epic- sounds: A large-scale dataset of actions that sound,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Epic- sounds: A large-scale dataset of actions that sound,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.860008Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.629781Z digest=sha256:8ba6483c827c925f9148112e3ee4cc7e9c7e3bd42df1f33e2180785f52a229f9

Observation 18bc56ce-18e1-4243-9668-9ab11b1ec1d7 · outbound

This paper cites Im- agenet: A large-scale hierarchical image database,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Im- agenet: A large-scale hierarchical image database,

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T20:14:04.632410Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:14:04.632410Z digest=sha256:f9edc9370066aa113bf27781d3bd7a60a49188829deabd3b7c4dc9df2946ff71

Observation 0a4970a3-2b5d-4aeb-b0be-93ce7c21489a · outbound

This paper cites Rethinking CNN Models for Audio Classification.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Rethinking CNN Models for Audio Classification

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-11T20:14:04.635047Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:14:04.635047Z digest=sha256:367c9243e9e99120a42217ea4a4f00646881c47c1994aaae820f6527e0b4e867

Observation f5320e5c-31f3-49d3-bff8-b3870d9fd8ca · outbound

This paper cites AST: Audio Spectrogram Transformer,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining AST: Audio Spectrogram Transformer,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.848572Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.637822Z digest=sha256:4a82256fd2e87461021487c25c841fafcdbcfbecb9bd0a8860449b8e5aa7ecec

Observation 98f49bf0-1d34-43b8-bd74-0a152181e903 · outbound

This paper cites PANNs: Large-scale pretrained audio neural networks for audio pattern recognition,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining PANNs: Large-scale pretrained audio neural networks for audio pattern recognition,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.841444Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.640335Z digest=sha256:a0b804ef22aa29c5ee2f9cc54992b5d8ca3b8faab391f8b95489477b34b0ac93

Observation e45e73d2-ec9e-4098-b822-ae77037c7de5 · outbound

This paper cites SSAST: Self- Supervised Audio Spectrogram Transformer,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining SSAST: Self- Supervised Audio Spectrogram Transformer,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.834793Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.642631Z digest=sha256:d9e193a2980febc86ea893fc9d13889af2b74f0b0d25cf617b00f9657a6d65a7

Observation af538c4e-92e4-4c09-a782-951c86fc6d49 · outbound

This paper cites Masked autoencoders that lis- ten,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Masked autoencoders that lis- ten,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.827915Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.645144Z digest=sha256:120b9a5c4090a47077fffee1a837c6279e9c52f26707f0b40f609e3a5ad4b32a

Observation c044a19d-cbbc-4095-a327-76a980e29120 · outbound

This paper cites Convolutional Bypasses Are Better Vision Transformer Adapters.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Convolutional Bypasses Are Better Vision Transformer Adapters

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-11T20:14:04.647561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:14:04.647561Z digest=sha256:26ff259c845872b6c70830b3b2dd1b29ba657c9525930804793a1aa90b3cceaa

Observation 0a14f0d7-d139-4306-9c3a-4259a9d91a87 · outbound

This paper cites ESC: Dataset for environmental sound classifica- tion,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining ESC: Dataset for environmental sound classifica- tion,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.820942Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.650227Z digest=sha256:1f5b5d2959583e9310181e403dde0d820e92481ce6069e24c0f1b78a09a79788

Observation e5934044-b9f1-481c-a2f9-85cd464ca6e5 · outbound

This paper cites Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-11T20:14:04.654272Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:14:04.654272Z digest=sha256:587fa9379e28eedc11de4842fd8109f561cabfdbbb5fa03e966c16109fd2dc50

Observation cbff193e-e60f-4620-a787-46224a732387 · outbound

This paper cites Learning multiple visual domains with residual adapters,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Learning multiple visual domains with residual adapters,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.812687Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.657323Z digest=sha256:b3ea300e06dd52703224899ce9059fd849e3ffa43b72890adcc0611e78b9959a

Observation 9bba5d8d-8b40-42c9-93cc-b32a0f14d7e6 · outbound

This paper cites Parameter-efficient transfer learning for NLP,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Parameter-efficient transfer learning for NLP,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.804721Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.659728Z digest=sha256:8effd098179a6bb39f5c8b5c43912b10bf72fd86bd1a7ec6297734d30525d0ed

Observation 247b8584-efbd-4cfa-a63e-9b57eef58906 · outbound

This paper cites LoRA: Low-rank adaptation of large lan- guage models,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining LoRA: Low-rank adaptation of large lan- guage models,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.796317Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.662309Z digest=sha256:334cfaffc174c282ffd749511ee8f27b31a0a1c113161e0bf9cff21e777e4aa2

Observation 1f648361-37f7-4506-bb8b-df13ddee32d9 · outbound

This paper cites The Power of Scale for Parameter-Efficient Prompt Tuning,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining The Power of Scale for Parameter-Efficient Prompt Tuning,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.787855Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.665270Z digest=sha256:2764ad6797c9064d216b070f33dad7e7f84e093791024c06f44ae7c356c36329

Observation e6c20f61-70bb-423f-b366-845a8501edff · outbound

This paper cites Prefix-Tuning: Optimizing Continuous Prompts for Generation,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Prefix-Tuning: Optimizing Continuous Prompts for Generation,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.779774Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.667760Z digest=sha256:321805bb0fb8099ce401818a27fe57088dd72012ce06c9db83d7d5e7314b448d

Observation d4e44f1a-3ac8-4e5e-a34b-cf4ce38c3fbc · outbound

This paper cites Contrastive audio-visual masked autoencoder,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Contrastive audio-visual masked autoencoder,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.770538Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.670751Z digest=sha256:8552f2d8530c6c9524906c9aa00474d483e1bec1449458820c58c3987ebea33f

Observation 2d269064-a615-481d-b295-34dedd95ce4e · outbound

This paper cites MAE- AST: Masked Autoencoding Audio Spectrogram Trans- former,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining MAE- AST: Masked Autoencoding Audio Spectrogram Trans- former,

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.763286Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.674220Z digest=sha256:a3a4bc49da9e2520c64bbecf0877c06b3dbdf459d06e962a385f0677bf3ddc8f

Observation d29d7a09-995c-4874-b445-9015cb6aecfe · outbound

This paper cites Masked spectrogram prediction for self-supervised audio pre-training,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Masked spectrogram prediction for self-supervised audio pre-training,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.754507Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.676637Z digest=sha256:08865add90f00bb12a9876d3c0e13d265c86e13bd969fb414eda554573edf914

Observation 1b008e05-1d11-4c02-9eaa-588048e9a67b · outbound

This paper cites Lib- rispeech: An asr corpus based on public domain audio books,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Lib- rispeech: An asr corpus based on public domain audio books,

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-11T20:14:04.678989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:14:04.678989Z digest=sha256:43599c481c9b5184b979e995f5a5a06cacd329d818a89996470f2cedd8bae51c

Observation b6a40fb1-54c1-4b42-86c8-4a96dc31c7e5 · outbound

This paper cites To- wards a unified view of parameter-efficient transfer learning,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining To- wards a unified view of parameter-efficient transfer learning,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.743198Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.681736Z digest=sha256:10721a1850fd14886e5639099efee73a1a862da7c56f2e61447f09e33ec4898b

Observation bcdfcc39-39eb-4141-964b-fb8984e8c848 · outbound

This paper cites PEFT for Speech: Unveiling Optimal Placement, Merging Strategies, and Ensemble Techniques.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining PEFT for Speech: Unveiling Optimal Placement, Merging Strategies, and Ensemble Techniques

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-08-11T20:14:04.708744Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.684278Z digest=sha256:b3ad35d695b12a423ce699a70b5ef6af244b7ced062649c296ad8335bec7c4ac

Pith citing papers

Observation 928da2d0-e5ed-4448-957d-dc448909679a · inbound

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining cites this paper.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining

Reference 1

Resolution
metadata mismatch
local_arxiv, observed 2026-08-11T20:14:04.735553Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-11T20:14:04.604966Z digest=sha256:8b1794fb2b6cedb91516a1af1d641476037072684c7d6ce25d4070a106623936