Pith. sign in

Paper Citation Record · LEDGER

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining

As of 14 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 1 inbound Pith citation observation for arXiv:2412.05951.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.05951 v1

Coverage vector

measured 30 of 30 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T20:14:04.684278Z

measured 31 of 31 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-13T06:32:02.005865+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-11T20:14:04.604966Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-11T20:14:04.732612Z

Reference resolution

30 of 30 outbound references displayed

  • verified exact1
  • verified fuzzy18
  • unresolved10
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 928da2d0-e5ed-4448-957d-dc448909679a · outbound

This paper cites When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining

Reference 1

Resolution
metadata mismatch
local_arxiv, observed 2026-08-11T20:14:04.735553Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.604966Z digest=sha256:2c11889737f90bed163464b4f77cdaaa0d221a24c4886bdfd8e21f82925946af

Observation fd972f38-384f-42ac-a977-031faf73fd03 · outbound

This paper cites an unresolved cited work.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Unresolved cited work

Reference 2

Resolution
unresolved
raw_fallback, observed 2026-08-11T20:14:04.914715Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.608375Z digest=sha256:74d34e721179444d9c6573393a9b635914d798cf1cb6c2358449c2034d9fe449

Observation 4dd49a8e-defb-488f-91c7-3c04c684030e · outbound

This paper cites an unresolved cited work.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-11T20:14:04.906867Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.611142Z digest=sha256:0318ee9c1ba9ef96170add268370c3b1816a4dc8e6c377220b9b39524ed4c55f

Observation 105172e6-8449-4542-8999-f178ed866e85 · outbound

This paper cites an unresolved cited work.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-08-11T20:14:04.899616Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.614284Z digest=sha256:a0bd0f522083dfe6abe0ae65ac15457d4c6849eb96872b851db10f5df5dbf57c

Observation 48a2ea91-8b9f-4250-a958-7199251ade32 · outbound

This paper cites However, it is challenging due to the need of substantial audio data and a well-designed learning objective for large-scale audio pretraining.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining However, it is challenging due to the need of substantial audio data and a well-designed learning objective for large-scale audio pretraining

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.890997Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.616982Z digest=sha256:b28d471d79be1d785e7311692eacb3bc98e396c213c463b11d256a5afd96b159

Observation 53d31062-d117-42c8-8db4-2eb126aab1e6 · outbound

This paper cites Attention is all you need,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Attention is all you need,

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-11T20:14:04.619642Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:14:04.619642Z digest=sha256:74cdafdc571d3bb3603732c830ac059d9e6a6b45c005d225b95fd7a1bc571f1a

Observation 1f51dcf8-28c7-4c46-b3f6-2597a2f93d77 · outbound

This paper cites Emerging properties in self-supervised vision transformers,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Emerging properties in self-supervised vision transformers,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.879575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.622371Z digest=sha256:43b3c86ba46265a1aee6a1393cf99edf07cdaf064551923ef52c0d5e93dbed5c

Observation 1be0c2ca-9334-4302-875f-e00274961bb5 · outbound

This paper cites Exploring simple siamese representation learning,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Exploring simple siamese representation learning,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.871647Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.624800Z digest=sha256:e8d373c7806324eaaec747f7eff160e64a37498a77fda78e3b41d962438e76f6

Observation d36d1d93-2314-4bc0-814d-ebb892e4b9a6 · outbound

This paper cites Audio set: An ontology and human-labeled dataset for audio events,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Audio set: An ontology and human-labeled dataset for audio events,

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-11T20:14:04.627315Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:14:04.627315Z digest=sha256:141ca1ddf8e69d3cee44124c015cac81c02141b5924384815754c4789596804c

Observation 50a3b51e-f62b-4bc3-beef-abeadc0f17e8 · outbound

This paper cites Epic- sounds: A large-scale dataset of actions that sound,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Epic- sounds: A large-scale dataset of actions that sound,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.860008Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.629781Z digest=sha256:22e811c85596fd424c34cae1e86d192314f8562ad6b418f2eb5dff9de8727004

Observation 18bc56ce-18e1-4243-9668-9ab11b1ec1d7 · outbound

This paper cites Im- agenet: A large-scale hierarchical image database,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Im- agenet: A large-scale hierarchical image database,

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T20:14:04.632410Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:14:04.632410Z digest=sha256:5bd3a6cd4d624547f73e8b1ce89d985700061740f9c942df856c5551d8bab0c2

Observation 0a4970a3-2b5d-4aeb-b0be-93ce7c21489a · outbound

This paper cites Rethinking CNN Models for Audio Classification.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Rethinking CNN Models for Audio Classification

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-11T20:14:04.635047Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:14:04.635047Z digest=sha256:05ad94047b8c000a06cd5f3b689937ef21913d7bed3fcc27f1877f5cf5b6af7e

Observation f5320e5c-31f3-49d3-bff8-b3870d9fd8ca · outbound

This paper cites AST: Audio Spectrogram Transformer,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining AST: Audio Spectrogram Transformer,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.848572Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.637822Z digest=sha256:537ba5f677618750572d089eb7e1e9d2d91af5e56140d685443de9adf033d736

Observation 98f49bf0-1d34-43b8-bd74-0a152181e903 · outbound

This paper cites PANNs: Large-scale pretrained audio neural networks for audio pattern recognition,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining PANNs: Large-scale pretrained audio neural networks for audio pattern recognition,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.841444Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.640335Z digest=sha256:e6fc378b17b24168f0af1ba0d08c65b591a814b4305fe3aa74c99837211c0e0f

Observation e45e73d2-ec9e-4098-b822-ae77037c7de5 · outbound

This paper cites SSAST: Self- Supervised Audio Spectrogram Transformer,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining SSAST: Self- Supervised Audio Spectrogram Transformer,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.834793Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.642631Z digest=sha256:f1b39d4d239b5cbb615c7a9782efc3e3f863e2a964c7e9bbbfe02d17d7b0e434

Observation af538c4e-92e4-4c09-a782-951c86fc6d49 · outbound

This paper cites Masked autoencoders that lis- ten,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Masked autoencoders that lis- ten,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.827915Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.645144Z digest=sha256:2d3f45cd2bf39b3215b3af3c455cdfb13739cd224694889cc4024976bd90a715

Observation c044a19d-cbbc-4095-a327-76a980e29120 · outbound

This paper cites Convolutional Bypasses Are Better Vision Transformer Adapters.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Convolutional Bypasses Are Better Vision Transformer Adapters

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-11T20:14:04.647561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:14:04.647561Z digest=sha256:8295092ff1b08adbc158b58268fff5cee435e715d059f120250c26c77c15437f

Observation 0a14f0d7-d139-4306-9c3a-4259a9d91a87 · outbound

This paper cites ESC: Dataset for environmental sound classifica- tion,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining ESC: Dataset for environmental sound classifica- tion,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.820942Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.650227Z digest=sha256:3de4aae77fb0a6cc44579ba5665c2987ff7d6532937d281206394cf52ab4656c

Observation e5934044-b9f1-481c-a2f9-85cd464ca6e5 · outbound

This paper cites Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-11T20:14:04.654272Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:14:04.654272Z digest=sha256:7c93d5e8da2966707c6982f64b13e7c52e9efe34ef6c8027fd130181a1e59546

Observation cbff193e-e60f-4620-a787-46224a732387 · outbound

This paper cites Learning multiple visual domains with residual adapters,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Learning multiple visual domains with residual adapters,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.812687Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.657323Z digest=sha256:595a961b89b83e3025533fe711cb1b15041c217790cd0199e889d15592f73f4d

Observation 9bba5d8d-8b40-42c9-93cc-b32a0f14d7e6 · outbound

This paper cites Parameter-efficient transfer learning for NLP,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Parameter-efficient transfer learning for NLP,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.804721Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.659728Z digest=sha256:44ed6474aacdc5818b068b4f7e4b54f83b056798ba6a3ab3f2d37b945cdb1e26

Observation 247b8584-efbd-4cfa-a63e-9b57eef58906 · outbound

This paper cites LoRA: Low-rank adaptation of large lan- guage models,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining LoRA: Low-rank adaptation of large lan- guage models,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.796317Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.662309Z digest=sha256:8cb1b2e13a1c9f39bbf55f4f67822a12d726ea962574e84aa9a39b16474c6369

Observation 1f648361-37f7-4506-bb8b-df13ddee32d9 · outbound

This paper cites The Power of Scale for Parameter-Efficient Prompt Tuning,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining The Power of Scale for Parameter-Efficient Prompt Tuning,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.787855Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.665270Z digest=sha256:64fb249af9b7aca7113f9c9b196b01fc863c0dd40e67dfbbfa7d7f9a6d4d785e

Observation e6c20f61-70bb-423f-b366-845a8501edff · outbound

This paper cites Prefix-Tuning: Optimizing Continuous Prompts for Generation,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Prefix-Tuning: Optimizing Continuous Prompts for Generation,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.779774Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.667760Z digest=sha256:a4ff129fe1da4055ac51d24d0e8b61aa7596c22d92ae00658cc2770da0a5a47d

Observation d4e44f1a-3ac8-4e5e-a34b-cf4ce38c3fbc · outbound

This paper cites Contrastive audio-visual masked autoencoder,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Contrastive audio-visual masked autoencoder,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.770538Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.670751Z digest=sha256:6a7a420a70ed2ecf7e991182153265561328828ffb7ef624eaca51f0043dc4eb

Observation 2d269064-a615-481d-b295-34dedd95ce4e · outbound

This paper cites MAE- AST: Masked Autoencoding Audio Spectrogram Trans- former,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining MAE- AST: Masked Autoencoding Audio Spectrogram Trans- former,

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.763286Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.674220Z digest=sha256:20ee040d9d7169f53fcb30fb3df26171d676624b4ae23a3256e114989e299a04

Observation d29d7a09-995c-4874-b445-9015cb6aecfe · outbound

This paper cites Masked spectrogram prediction for self-supervised audio pre-training,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Masked spectrogram prediction for self-supervised audio pre-training,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.754507Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.676637Z digest=sha256:ef5e883258ee38cdf470cfea75fc948e1046b2bc81c48b9a021f87a1c2895cd8

Observation 1b008e05-1d11-4c02-9eaa-588048e9a67b · outbound

This paper cites Lib- rispeech: An asr corpus based on public domain audio books,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining Lib- rispeech: An asr corpus based on public domain audio books,

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-11T20:14:04.678989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:14:04.678989Z digest=sha256:ca3a7130863de75a2005ce8c7f864204e7fa9d8974096d678a6d0a036e27342b

Observation b6a40fb1-54c1-4b42-86c8-4a96dc31c7e5 · outbound

This paper cites To- wards a unified view of parameter-efficient transfer learning,.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining To- wards a unified view of parameter-efficient transfer learning,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T20:14:04.743198Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.681736Z digest=sha256:557a6204bc1f04f179404c2e0510ff2a4a2b891051c725173fc706b8bba365e7

Observation bcdfcc39-39eb-4141-964b-fb8984e8c848 · outbound

This paper cites PEFT for Speech: Unveiling Optimal Placement, Merging Strategies, and Ensemble Techniques.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining PEFT for Speech: Unveiling Optimal Placement, Merging Strategies, and Ensemble Techniques

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-08-11T20:14:04.708744Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.684278Z digest=sha256:b4e946aad694f86fe8f38e12997571a208d5ab371f3c788997572a429a5b9862

Pith citing papers

Observation 928da2d0-e5ed-4448-957d-dc448909679a · inbound

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining cites this paper.

When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining

Reference 1

Resolution
metadata mismatch
local_arxiv, observed 2026-08-11T20:14:04.735553Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T20:14:04.604966Z digest=sha256:2c11889737f90bed163464b4f77cdaaa0d221a24c4886bdfd8e21f82925946af