{"as_of":"2026-08-08T10:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c1acacc748dd3361c1758592513bf751b39cf3f604f85f503e4b6b0213ee35f5","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:55:23.650061Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:55:19.199833Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:55:23.785586Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"cited_work":{"arxiv_id":"2506.01133","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01133","snapshot_observed_at":"2026-08-07T11:55:23.785586Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","venue":"cs.CL","work_id":"827c220c-30bd-425a-a1c2-a839ad12f9e7","year":2025},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.199833Z"},"links":{"cited_paper":"/paper/2506.01133","citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:16c5b3316e7bba565c4823d3b3f83bcebe9316d44c8da037506ab0d6d81bd933","observation_id":"ff3e0a17-38ff-4eb3-88ca-76261b5660ad","resolution":{"observed_at":"2026-08-07T11:55:23.792506Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01133/citation-record","integrity":"/paper/2506.01133/integrity","json":"/paper/2506.01133/citation-record.json","paper":"/paper/2506.01133"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:27.705821Z","title":"Among these, large language models (LLMs) have demonstrated emer- gent capabilities once thought to require human intelligence","venue":null,"work_id":"5e6084b7-fa4a-4556-8b04-b5cd3a2b9f52","year":null},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.162130Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:deb9d4856e1e528787828641971da4ae394ccc3ce1488a8c0410554e9d131e65","observation_id":"f91442a7-2fc5-4d1a-b385-d937125a5a34","resolution":{"observed_at":"2026-08-07T11:55:27.712585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"cited_work":{"arxiv_id":"2506.01133","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01133","snapshot_observed_at":"2026-08-07T11:55:23.785586Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","venue":"cs.CL","work_id":"827c220c-30bd-425a-a1c2-a839ad12f9e7","year":2025},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.199833Z"},"links":{"cited_paper":"/paper/2506.01133","citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:16c5b3316e7bba565c4823d3b3f83bcebe9316d44c8da037506ab0d6d81bd933","observation_id":"ff3e0a17-38ff-4eb3-88ca-76261b5660ad","resolution":{"observed_at":"2026-08-07T11:55:23.792506Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:27.677984Z","title":"We investigate both unimodal and multimodal models, focusing on HuBERT, BERT, Seamless M4T, and SpeechT5","venue":null,"work_id":"159f3e06-53f7-4761-95a6-4a570b2fafb3","year":null},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.267030Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:08cba78ed3fb1c84c89e4c418b1efa17c8a76d2fac1fce4de0725e89c01a43c2","observation_id":"ee33b07d-9131-4069-a6d5-f7c695aeb71a","resolution":{"observed_at":"2026-08-07T11:55:27.693002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:27.647373Z","title":"w_1\", \"w_2","venue":null,"work_id":"188251ae-6fcd-4a84-9fcd-44f3fe1d8214","year":null},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.331834Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:b8ef05f7f6e532b74f7c9042c72110c9b13e0a3ac8e7966fad4851a72caa88ff","observation_id":"c5de2cd0-74f2-400a-94cc-e59b14b90cd6","resolution":{"observed_at":"2026-08-07T11:55:27.662099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:27.514068Z","title":null,"venue":null,"work_id":"f4712252-a05f-417e-b4b4-a0d8a3e9bbd6","year":null},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.417471Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:29d3fb86dba949f29eef2e86d6364593b40c13cc6c7ca0760fe68c3402838c3b","observation_id":"6c2ac4f5-3bf7-4b3e-9044-572dd89044ef","resolution":{"observed_at":"2026-08-07T11:55:27.556058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:27.261383Z","title":null,"venue":null,"work_id":"912a25fb-5f46-4614-a4bd-169a08330d7f","year":null},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.504535Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:cef3626d01a17cd2d0c2294b8b630cbea27b2d7dd514ed5c43eeb0727d287e00","observation_id":"cf97432e-1b33-4b8e-8820-c6950a0eac18","resolution":{"observed_at":"2026-08-07T11:55:27.387066Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:27.069103Z","title":"Sparks of artificial general intelligence: Early experiments with GPT-4,","venue":null,"work_id":"ef8ee178-b46b-4cf8-8584-9ee54087fc65","year":2023},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.583130Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:60e9f811b7719a7d5ce69b9e829f57b50e389d917b8e7e7914ca10b7b32a835b","observation_id":"4aa22244-a4b7-4eb8-a778-35ff77b33a6b","resolution":{"observed_at":"2026-08-07T11:55:27.220805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T11:55:19.678444Z","title":"Holistic evaluation of language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.678444Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:2f49dcb634c0b0b341901f63ed481c3acebf7ce81c5fc42814e7e1c40c2a5dca","observation_id":"651a6269-6e48-46a1-b3f1-48a56e9347e9","resolution":{"observed_at":"2026-08-07T11:55:19.678444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T11:55:19.822671Z","title":"LLaMA: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.822671Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:c26610a290553034714f60253d02df551753fd239de15cb46c84be3ae12bcb12","observation_id":"ffb8be02-a770-43d3-bfa3-2b9563656d3c","resolution":{"observed_at":"2026-08-07T11:55:19.822671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T11:55:19.917109Z","title":"Qwen2-audio technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.917109Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:a7aaf2ee1a77acc144f05b96253a8556bbcc9630db6bd895761d3fae2f19decf","observation_id":"3ec040d0-97c7-4bd1-87e6-6d063b702c32","resolution":{"observed_at":"2026-08-07T11:55:19.917109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15111","last_updated":"2025-01-25T07:26:37Z","snapshot_observed_at":"2026-08-07T11:56:57.969083Z","submitted_at":"2025-01-25T07:26:37Z","title":"HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15111","snapshot_observed_at":"2026-08-07T11:55:19.930713Z","title":"Humanomni: A large vision-speech language model for human-centric video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.930713Z"},"links":{"cited_paper":"/paper/2501.15111","citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:03a4a57f69f6fd78c771381e79d24e17ebe1ff837b7e5cd4ce78b6af555d5082","observation_id":"6a2b2aea-b7d0-4516-80ab-a56c46060c39","resolution":{"observed_at":"2026-08-07T11:55:19.930713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:26.795021Z","title":"Chatgpt makes medicine easy to swallow: An exploratory case study on simplified radiology reports,","venue":null,"work_id":"794ce83b-b25d-4119-9189-129dfeb1b279","year":2022},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:20.085297Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:69fb7fb9c60e0f9ea50db56db247180ee5c8ef5d13ace178b81896f21eec5cb5","observation_id":"3e4f3261-254a-4e83-90a7-ff72616d9a5f","resolution":{"observed_at":"2026-08-07T11:55:26.928313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:26.516913Z","title":"Where do you know what you know? the representation of semantic knowledge in the human brain,","venue":null,"work_id":"72679e0e-26f4-4a8e-88c0-132f51c35985","year":2007},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:20.213457Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:d2fb4d96c3dce174e017eb43a2d4f93e3a03349807ebb3f9cb8205ddb2073ef6","observation_id":"3574e071-210c-4673-b75e-8b7572492bea","resolution":{"observed_at":"2026-08-07T11:55:26.649923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:26.247646Z","title":"Discovering latent concepts learned in BERT,","venue":null,"work_id":"9461a58c-7427-42ba-a2ce-602e61c456f3","year":2022},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:20.278799Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:f1d2504e099031d0777e6648771806689e994288b948809e28231cefe8dbd881","observation_id":"a86651e7-ab95-439e-800f-460cfb06a8a5","resolution":{"observed_at":"2026-08-07T11:55:26.404067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:26.015777Z","title":"Asking without telling: Exploring latent ontologies in contextual representations,","venue":null,"work_id":"3f228497-afad-4c78-a8ed-0fd5a5e99faa","year":2020},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:20.386867Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:7d0e80d5aa02d45e0b61826fc5983c0b7a89ad59884e0cb9f78475140f7a5fe1","observation_id":"44907d11-e6c7-4baa-aaa6-ef31c6a3d378","resolution":{"observed_at":"2026-08-07T11:55:26.128856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:25.743824Z","title":"Acoustic word embeddings for untranscribed target languages with con- tinued pretraining and learned pooling,","venue":null,"work_id":"80866745-1c30-45cf-8d4b-601d5b789147","year":2023},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:20.549216Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:cb50f55999c44b1059d87476cfb513655f093c127db5e554edbec2cc9ec506be","observation_id":"6f34368a-90b5-40ea-8d8d-3fa1d0b611fd","resolution":{"observed_at":"2026-08-07T11:55:25.860399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:25.569491Z","title":"Scaling up discovery of latent concepts in deep NLP models,","venue":null,"work_id":"1023e7dd-416b-4feb-85e8-79c90cb6a918","year":2024},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:20.672485Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:de369808f41b1675f25c764d4d3a517c420d365e041a9d42304cb55ae68b38c0","observation_id":"aa5e3386-fc3c-4045-9202-201ae47d99cd","resolution":{"observed_at":"2026-08-07T11:55:25.678059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:20.796229Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:20.796229Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:25efba6d3e5b8785c63bf2da99a0d166f1c7a2be1997feb9b037074619777a90","observation_id":"a3c011e6-a16b-45fa-b5a7-befe2d8c2545","resolution":{"observed_at":"2026-08-07T11:55:20.796229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:25.293314Z","title":"BERT: Pre- training of deep bidirectional transformers for language under- standing,","venue":null,"work_id":"4c0c38dd-2f40-4898-9371-8ff9df300c00","year":2019},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:20.915431Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:9a19d9a2f4004164ac56596e3cab8f203adcc9518610d780c92e55e1a13d5d99","observation_id":"35bc41e9-76a6-460a-8124-d4965bf872a8","resolution":{"observed_at":"2026-08-07T11:55:25.429411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:25.038403Z","title":"Seamlessm4t: Massively multilingual & multimodal machine translation,","venue":null,"work_id":"4dd29d77-b67c-41a2-bb78-441528f8e4e6","year":2023},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:21.002271Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:54c80efcbc651b2e1ab397595b5f17d2673695c791b7ff9978d718b1d021cd43","observation_id":"f36093cf-aaf2-4d97-8f30-30cb5b92a0bd","resolution":{"observed_at":"2026-08-07T11:55:25.162198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.786508Z","title":"Speecht5: Unified-modal encoder-decoder pre-training for spoken language processing,","venue":null,"work_id":"6b22b33b-62f1-4fb6-ba4c-66539250e06b","year":2022},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:21.207897Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:d7d470cccfc032f76e659778ef0bb386238d2e175f29992bee67a4585ac182b1","observation_id":"b0a1f3d9-fad8-4b71-a9e0-6d1850727749","resolution":{"observed_at":"2026-08-07T11:55:24.921538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.704457Z","title":"Building a large annotated corpus of English: The Penn Treebank,","venue":null,"work_id":"50655506-b5dc-4cbe-9900-64c18276efe5","year":1993},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:21.346221Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:c9e81334c4de38d0dcd92cb81cb375b018302d486d1c18d296c3e1c59b947820","observation_id":"84a95c81-3ccd-49b1-b5dd-80f99f94c64c","resolution":{"observed_at":"2026-08-07T11:55:24.738695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.641293Z","title":"Introduction to the CoNLL-2000 shared task chunking,","venue":null,"work_id":"064bce9a-9ad3-4523-b780-240e851a25b3","year":2000},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:21.487297Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:296dab0661c88bdadfb1cfc215eaac7c9972360d725d04bd1b1267b92b25fcaa","observation_id":"72ea7388-dbe1-4226-ad6e-505cc74dd8f8","resolution":{"observed_at":"2026-08-07T11:55:24.670928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.574495Z","title":"The parallel meaning bank: Towards a multilingual corpus of translations annotated with compositional meaning representations,","venue":null,"work_id":"e9eb81bf-4924-4294-9c52-77539c14ca75","year":2017},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:21.617635Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:7d77d96457d50ae3b7ed405f9ac5a9b7e96e7b18fa0d9defa378393fd55869be","observation_id":"65fe5955-f0a3-4a0e-bead-19a0c8e8f193","resolution":{"observed_at":"2026-08-07T11:55:24.602280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.524004Z","title":"Recursive deep models for semantic composition- ality over a sentiment treebank,","venue":null,"work_id":"abc7c019-9ba1-4503-b875-12487e405fcc","year":2013},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:21.768001Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:a7fcc245fca03569bfe60c28bb54531410b87997e9e81a483133dab111f09dd4","observation_id":"48838c32-24d8-49da-9671-d6067eed0145","resolution":{"observed_at":"2026-08-07T11:55:24.553141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.454012Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"4e60440a-7821-460c-ac22-80544da28a9a","year":2015},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:21.954269Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:7687018dd273b6bb2e4494707d4110a781ecfb9e98632e3043ee1637df048cc2","observation_id":"39df574d-4f0a-44ee-b939-f568c7052dda","resolution":{"observed_at":"2026-08-07T11:55:24.498049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.410592Z","title":"Neurox library for neuron analysis of deep nlp models,","venue":null,"work_id":"213deebd-a7d5-4fdd-8aa0-073256b50580","year":2023},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:22.157959Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:681a00ec940deb06150593e5f6cf2e70de9ac9ea1949ec9c30b7b567c53697bf","observation_id":"11f5eb42-d58e-4a24-8e3d-ca9970609204","resolution":{"observed_at":"2026-08-07T11:55:24.428683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.345813Z","title":"GLUE: A multi-task benchmark and analysis platform for natu- ral language understanding,","venue":null,"work_id":"35c0c623-4e43-4f0d-a120-c49a28ab7cef","year":2018},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:22.262570Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:4e3e83652ec273b01ccd9bbeea535a28a065baf990f43266791201c5a7e84677","observation_id":"73060970-d9a3-4e2b-885f-5e320325eee1","resolution":{"observed_at":"2026-08-07T11:55:24.370606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.277490Z","title":"Slue: New benchmark tasks for spoken language un- derstanding evaluation on natural speech,","venue":null,"work_id":"0e9934f4-5029-4733-80c5-97e8455d1753","year":2022},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:22.379904Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:3f01e5788707679b5725636aa8a43705e4b992dc113802e7f3b101b14b093539","observation_id":"d2920b16-2a6f-4d31-834b-3fb5bdefb8ad","resolution":{"observed_at":"2026-08-07T11:55:24.307374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.216194Z","title":"What happens to BERT embeddings during fine-tuning?","venue":null,"work_id":"6f65a163-cb54-433e-8740-c5f11664b8e9","year":2020},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:22.505144Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:09073e58366521a146eafd628d4636f6d7a6ff4f22bcedf2d9deb15016544357","observation_id":"ac83e39d-75aa-4ef6-97c7-80cb5b2c59e5","resolution":{"observed_at":"2026-08-07T11:55:24.243320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.148973Z","title":"How transfer learning im- pacts linguistic knowledge in deep NLP models?","venue":null,"work_id":"a72cfd14-d635-4d1e-9f6b-90f5d2902b6f","year":2021},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:22.630694Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:7d0c2ed78164db81898363bff9ea6202adeb75b37a30d48df30eff043a9487da","observation_id":"6090745c-e516-4c2b-a6e9-453992f95786","resolution":{"observed_at":"2026-08-07T11:55:24.176512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.097082Z","title":"Can llms facilitate interpreta- tion of pre-trained language models?","venue":null,"work_id":"a623239f-1948-4f1e-beec-008d92893d42","year":2023},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:22.750648Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:39e200a1b66ce77511b0c1ef61abecbef5e6e1b381e933d3f7de04319e09286f","observation_id":"d3dc4dd2-ab98-4647-bcd3-5cfae5b2c37f","resolution":{"observed_at":"2026-08-07T11:55:24.122555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.045691Z","title":"BERT rediscovers the classical NLP pipeline,","venue":null,"work_id":"265804a9-fdcc-47f7-a74d-b571b77012a1","year":2019},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:22.859577Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:e17783484594310c1ac4201292d0db34435a1ea40660931e81322cde263ff843","observation_id":"f5b409b9-6284-47d6-b3d6-878277338d5f","resolution":{"observed_at":"2026-08-07T11:55:24.070758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:23.986160Z","title":"What does BERT learn about the structure of language?","venue":null,"work_id":"5a7b906f-9d79-40d7-aa7b-accd3ca47aa4","year":2019},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:22.985895Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:127ae2f05bdf50cabc969b62ff97188aeb2a2c913e85be1d25c07d2a8d2a7878","observation_id":"a65b4149-1d0c-4d98-9efe-7f5f18e107ab","resolution":{"observed_at":"2026-08-07T11:55:24.011714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:23.960999Z","title":"Analyzing encoded concepts in transformer language models,","venue":null,"work_id":"4281a4fa-e9b1-46b1-8e34-7452ee833858","year":2022},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.128424Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:2e2ce5267c34e2b58989dd25c6dfdadbb31e963cf11075f9d552eaa1b399a2b2","observation_id":"73408024-63ad-495f-8261-0888a46c1b69","resolution":{"observed_at":"2026-08-07T11:55:23.972262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:23.940367Z","title":"On the transforma- tion of latent space in fine-tuned nlp models,","venue":null,"work_id":"ceec7d4d-f0b8-4636-8859-6cac20e1b2e3","year":2022},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.299027Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:24c68f0d727dfadeb2b02e801f1bf932a4a4b4abab57abdf6b2a042ac1fef8d5","observation_id":"3356eaba-96e3-4302-bdae-defe96c35ce3","resolution":{"observed_at":"2026-08-07T11:55:23.949963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:23.917760Z","title":"What do end-to- end speech models learn about speaker, language and channel information? a layer-wise and neuron-level analysis,","venue":null,"work_id":"5b393b1d-a47c-4217-8b45-4d58a32af810","year":2024},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.462634Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:2b6a53e9c190a30f2d997fa0e6e266c5217cf1e9579c7f90d1efafb556ab8385","observation_id":"0d17e645-988c-4a2c-a0e5-06eb3ed94018","resolution":{"observed_at":"2026-08-07T11:55:23.925647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12948","last_updated":"2024-10-16T18:34:07Z","snapshot_observed_at":"2026-07-06T19:34:51.296918Z","submitted_at":"2024-10-16T18:34:07Z","title":"What Do Speech Foundation Models Not Learn About Speech?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12948","snapshot_observed_at":"2026-08-07T11:55:23.570722Z","title":"What do speech foundation models not learn about speech?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.570722Z"},"links":{"cited_paper":"/paper/2410.12948","citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:209dc88d9be85e704dfdf113016552bea3627560af08d84003f7caa09b23e9e4","observation_id":"40d3f00f-dc15-40de-ae50-6e4e6fbd9f3a","resolution":{"observed_at":"2026-08-07T11:55:23.570722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:23.898453Z","title":"Speech representation analysis based on inter-and intra-model similarities,","venue":null,"work_id":"baab08a1-f5a3-4f3f-be6b-bcad54518689","year":2024},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.604673Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:1475f1a13d1b7cff34807a169fc06b699a688efb3c6db5a55fa8d8a4ac298c5b","observation_id":"34c39925-c4be-49bc-8347-d83e20ee6de7","resolution":{"observed_at":"2026-08-07T11:55:23.905500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17666","last_updated":"2025-02-20T18:04:45Z","snapshot_observed_at":"2026-07-06T19:57:28.746485Z","submitted_at":"2024-11-26T18:29:11Z","title":"How do Multimodal Foundation Models Encode Text and Speech? An Analysis of Cross-Lingual and Cross-Modal Representations","version":2},"cited_work":{"arxiv_id":"2411.17666","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.17666","snapshot_observed_at":"2026-08-07T11:55:23.703385Z","title":"How do Multimodal Foundation Models Encode Text and Speech? An Analysis of Cross-Lingual and Cross-Modal Representations","venue":"cs.CL","work_id":"4131d4a3-99a0-4765-aa62-ee1c0b92e53c","year":2024},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.610131Z"},"links":{"cited_paper":"/paper/2411.17666","citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:80fd5297ba5e30eae4336bf05f4d6a398388e335951fc4022d0ee9da19f74c69","observation_id":"e58d2662-778b-4273-8f04-8fe485227484","resolution":{"observed_at":"2026-08-07T11:55:23.714795Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:23.877062Z","title":"Human-like linguistic biases in neural speech models: Phonetic categorization and phonotactic constraints in wav2vec2. 0,","venue":null,"work_id":"ff36d0c1-0626-41d3-bd2c-3dda2508348f","year":2024},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.615950Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:22b2b169e0d88bde097b91840634dfe0344003f9b7adb1e1cffcf3a6a30ad971","observation_id":"9df1dfe6-f19e-459b-bb87-64ea8f1580c0","resolution":{"observed_at":"2026-08-07T11:55:23.885809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:23.856122Z","title":"Probing self- supervised speech models for phonetic and phonemic informa- tion: A case study in aspiration,","venue":null,"work_id":"26cf167d-20dd-46d8-9864-7d4119dcadf7","year":2023},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.622252Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:a3fc2aaef2771b6ea9beaacd35e1921ed576d586bace80c3ee80a60322254765","observation_id":"37ba5095-d0ca-4102-970f-e089cc26f7a4","resolution":{"observed_at":"2026-08-07T11:55:23.864140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:23.837919Z","title":"SD-HuBERT: Sentence-level self-distillation in- duces syllabic organization in hubert,","venue":null,"work_id":"c3e2496c-d86c-43db-8218-edae7e667ac1","year":2024},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.628319Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:bbfea074ce38cdfbd895c93821052b5bf8178286aafe78806261083223ecc5c3","observation_id":"32d511d8-d2e6-4675-82d4-02a10a2f1c09","resolution":{"observed_at":"2026-08-07T11:55:23.846073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:23.820394Z","title":"Phonetic analysis of self- supervised representations of english speech,","venue":null,"work_id":"df7ec56a-11ea-48fa-87ec-aadc1119784a","year":2022},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.635644Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:571a7a8f5fab6dfa5e1b7cf95dd9cbd6ec22f016190ae267c5ac0ed6285e0504","observation_id":"38591ffb-30bf-4189-9955-b7b6a7490ecf","resolution":{"observed_at":"2026-08-07T11:55:23.826922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08619","last_updated":"2024-06-12T20:04:44Z","snapshot_observed_at":"2026-08-05T11:23:51.812806Z","submitted_at":"2024-06-12T20:04:44Z","title":"Self-Supervised Speech Representations are More Phonetic than Semantic","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08619","snapshot_observed_at":"2026-08-07T11:55:23.641312Z","title":"Self-supervised speech representations are more phonetic than semantic,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.641312Z"},"links":{"cited_paper":"/paper/2406.08619","citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:781f1e70175ca9896b7d40879b78cb3d06ed728d990823bc96e5c009aa3c40b2","observation_id":"1bf89544-a4f6-4900-a853-94601fe19a48","resolution":{"observed_at":"2026-08-07T11:55:23.641312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:23.801955Z","title":"What do self- supervised speech models know about words?","venue":null,"work_id":"30210a05-b39c-48b3-8bba-c105bc5ff62c","year":2024},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.650061Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:87e6d01a79df48f9153247aa35170c4ab76d0120856df276e0445457a7139dd9","observation_id":"356262e0-6cb6-4e78-a682-b65595758218","resolution":{"observed_at":"2026-08-07T11:55:23.809257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":35},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2506.01133."}