Pith. sign in

Paper Citation Record · LEDGER

SpeechBERT: An Audio-and-text Jointly Learned Language Model for End-to-end Spoken Question Answering

As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:1910.11559.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
1910.11559 v4

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 8 of 8 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 8 of 8 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-12T05:15:07.759304Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-17T22:45:24.330275Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation efa611c9-0a04-4472-b68e-fd9508ebc822 · inbound

From Audio Deepfake Detection to AI-Generated Music Detection -- A Pathway and Overview cites this paper.

From Audio Deepfake Detection to AI-Generated Music Detection -- A Pathway and Overview SpeechBERT: An Audio-and-text Jointly Learned Language Model for End-to-end Spoken Question Answering

Reference 142

Resolution
unresolved
no resolver link, observed 2026-08-12T05:15:07.759304Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T05:15:07.759304Z digest=sha256:c28d89c89fffe13f177b1846ba5df11408116073bcd49f09ac72153fcf263813

Observation 51a67ffe-e91a-40c1-aa01-4775cd0ba3ec · inbound

Speech Retrieval-Augmented Generation without Automatic Speech Recognition cites this paper.

Speech Retrieval-Augmented Generation without Automatic Speech Recognition SpeechBERT: An Audio-and-text Jointly Learned Language Model for End-to-end Spoken Question Answering

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-11T10:34:01.513076Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:34:01.513076Z digest=sha256:e3867dadea037d8751a3c582d82f72ecc5c6317a26e3a5d3e68b1e3300d7d53e

Observation 2bd9026c-0b57-489c-98fa-7eea38878b04 · inbound

WhiSPA: Semantically and Psychologically Aligned Whisper with Self-Supervised Contrastive and Student-Teacher Learning cites this paper.

WhiSPA: Semantically and Psychologically Aligned Whisper with Self-Supervised Contrastive and Student-Teacher Learning SpeechBERT: An Audio-and-text Jointly Learned Language Model for End-to-end Spoken Question Answering

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-10T20:27:22.423222Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T20:27:22.423222Z digest=sha256:2da3868702f5291ee9e989e1aaed8690a5de52695b4b051958ffd44cc17e471a

Observation f26246e6-ec86-4efd-a0b7-f86657cc9403 · inbound

Spoken question answering for visual queries cites this paper.

Spoken question answering for visual queries SpeechBERT: An Audio-and-text Jointly Learned Language Model for End-to-end Spoken Question Answering

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T12:52:39.184008Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:52:39.184008Z digest=sha256:718184c4a4499898c1d0e16e449f1322c1138aeec65f582c22a0400e84933800

Observation fd5d21fa-3fc5-49d1-85db-b13ec0454e93 · inbound

Reasoning-Based Approach with Chain-of-Thought for Alzheimer's Detection Using Speech and Large Language Models cites this paper.

Reasoning-Based Approach with Chain-of-Thought for Alzheimer's Detection Using Speech and Large Language Models SpeechBERT: An Audio-and-text Jointly Learned Language Model for End-to-end Spoken Question Answering

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T11:40:12.061556Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:40:12.061556Z digest=sha256:9052c4bc52d6294f899eb66f5ba249c8acd95c0292641064e6bbb53b520fe347

Observation f8f00b46-0b68-4800-8e03-04f7680dc0a4 · inbound

DeepEmoNet: Building Machine Learning Models for Automatic Emotion Recognition in Human Speeches cites this paper.

DeepEmoNet: Building Machine Learning Models for Automatic Emotion Recognition in Human Speeches SpeechBERT: An Audio-and-text Jointly Learned Language Model for End-to-end Spoken Question Answering

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T18:31:36.143610Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T18:31:36.143610Z digest=sha256:92ff6610b8c4b8abc0fb14ba4b5a29437a943cb72eef970894483c78401b1124

Observation d97dea7c-61bd-4a1b-bfe3-56310cf66e5d · inbound

Amplifying Emotional Signals: Data-Efficient Deep Learning for Robust Speech Emotion Recognition cites this paper.

Amplifying Emotional Signals: Data-Efficient Deep Learning for Robust Speech Emotion Recognition SpeechBERT: An Audio-and-text Jointly Learned Language Model for End-to-end Spoken Question Answering

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T15:51:22.740660Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T15:51:22.740660Z digest=sha256:9240da2da53f897cdaa71a9354cf34aea3843658981670a2b07a54f127d3e15b

Observation d534fa49-fb0a-4f40-95e5-2624614331c9 · inbound

End-to-end Contrastive Language-Speech Pretraining Model For Long-form Spoken Question Answering cites this paper.

End-to-end Contrastive Language-Speech Pretraining Model For Long-form Spoken Question Answering SpeechBERT: An Audio-and-text Jointly Learned Language Model for End-to-end Spoken Question Answering

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-05-17T22:45:24.333218Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-05-17T22:44:49.949759Z digest=sha256:f0db60f3ebfdd2b0d2ec4122291acbaa626a82c8358dfca64cbeba7c24b8254d