{"as_of":"2026-08-17T22:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b8cb5f7843cd43370e0c590a7453b5e37eb91f8929b40b87cef0f8f5f142f9d3","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T16:20:13.303809Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04619/citation-record","integrity":"/paper/2607.04619/integrity","json":"/paper/2607.04619/citation-record.json","paper":"/paper/2607.04619"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"AudioCaps: Generating captions for audios in the wild,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:0ebdeb6ea0d1fb66659663dac92e014ef37e67cd200f144ff718cbc6d45635c7","observation_id":"b2cb80e9-f109-4d06-a863-cdf215c098c8","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Clotho: an audio captioning dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:fcbaeb569d4f9413e437cb5c19e978b748bebab311616a3f7e5821b705aab78f","observation_id":"b95b315f-901c-4a3f-92cb-5d6d23bcaf38","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/icassp49357.20","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:07.836012Z","title":"CLAP learning audio concepts from natural language supervision,","venue":null,"work_id":"79962fc7-06f8-476e-81e4-5c39871979bd","year":2023},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:fd8e8a9c0068abc6488a193288e0bc1b7a5b32cdaddd387d6a2fe91f2481479a","observation_id":"329824d9-23c4-4478-b7f2-e52693b62a7c","resolution":{"observed_at":"2026-07-11T16:28:07.838371Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:20:16.688875+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:20:16.688875+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Enclap: Combining neural audio codec and audio-text joint embedding for automated audio captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:b60bd3a8ae9bbd038c648364c1b34fa801b2310e9c58970f122b8f0fa84d73d4","observation_id":"497fdbf0-b212-4e35-bad6-76e291da7892","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"SLAM-AAC: enhancing audio captioning with paraphrasing augmentation and clap-refine through llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:3a2eeb65c25eb2bb32722717212c95a1805d54c9a258b7a1303e327fe42ebf92","observation_id":"e60ee710-fd40-4b46-b957-5a48c1b8e6fe","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Drcap: Decoding CLAP latents with retrieval-augmented generation for zero-shot audio captioning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:8ae4169398e5e332b9885ffd2e0da486a623ed18ffb6ec8ed7837ecc66578474","observation_id":"aafbbb77-e291-4a10-8d5a-46e020e7f20d","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-16T13:42:07.484439Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Unveiling encoder-free vision-language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:081353c7cc8d7404086f415ab4f4b327d49a1a8bca2bf2ca7912f83603510c3c","observation_id":"cda596e6-7081-46cb-ba46-9774f1433403","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Available: https://api.semanticscholar.org/CorpusID: 270559398","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:fdb4e772bd08616cf0d0c4acc2e637080c9398ae047a8efbfa0385160e854bc6","observation_id":"73b72544-169a-4e8e-8433-1332e12f5897","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20680","last_updated":"2025-03-26T16:15:42Z","snapshot_observed_at":"2026-08-17T07:13:22.157727Z","submitted_at":"2025-03-26T16:15:42Z","title":"Vision as LoRA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20680","snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Vision as lora,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"cited_paper":"/paper/2503.20680","citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:2fdd07e7d117af7afd6158f4615b4d91522d9d91e7bb99c84cbf363b8c3e18a9","observation_id":"499168d0-b18a-4fe7-b6a6-0fa015b37759","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Aura: Internalizing audio understanding into llms as lora,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:b63858e252376ef89b8e9e8be3aefc62e190d9f9ae6ac456c53e3984f1947912","observation_id":"4c220655-7736-4013-8ad6-ac3f89bf8121","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13275","last_updated":"2024-06-25T08:07:36Z","snapshot_observed_at":"2026-08-16T13:41:34.555959Z","submitted_at":"2024-06-19T07:09:46Z","title":"Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13275","snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Enhancing automated audio captioning via large language models with optimized audio encoding,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"cited_paper":"/paper/2406.13275","citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:0009e1c05856d9182bee42a00ecf8927443665b4898610c00c8954a869a2775f","observation_id":"2e0f931e-e155-478c-b1d0-61010534587b","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Available: https://api.semanticscholar.org/CorpusID: 270621008","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:5bf84dbbcff68a0fc2e5eb99a3953fceeb04d36066d8649645b8b0d4ac237d75","observation_id":"a2113221-944c-495b-b382-6029eca27b7b","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/icassp48485.20","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:07.848948Z","title":"CED: consistent ensemble distillation for audio tagging,","venue":null,"work_id":"796be288-fa44-4a7f-8af3-39b462d1821a","year":2024},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:f1fe6db4798d2e29829b093e76af86acd2d21c5e86846f38b651103ecc3b1d9d","observation_id":"751c1cd3-301b-4b3d-a1f6-ff316d9dcd59","resolution":{"observed_at":"2026-07-11T16:28:07.850454Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:20:17.679856+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:20:17.679856+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Llm can read spectrogram: Encoder-free speech-language modeling,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:1e5e4b71ae305e344515ef5c2366a0fe07e37100aa359489cde77e99d1052e74","observation_id":"86073d4e-5cd6-4472-b4bf-9b10a357464b","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Available: https://api.semanticscholar.org/CorpusID: 289132537","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:a035eeeabe19b7dbbd40b862f40c758ba3e0850726531e5195131056b2cda1c4","observation_id":"f0b5ddf1-c83f-4874-b9d5-cfae8cf34cde","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Fuyu-8B: A multimodal architecture for AI agents,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:f9fa12c12b610553e2dc6933e8b869ed72ba3c85542f177b6030ab78937aecff","observation_id":"5bb30c1b-0193-43e1-90c7-d1fc821cd507","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Mono-internvl: Pushing the boundaries of monolithic multimodal large language models with endogenous visual pre- training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:b5a01765a4546b8b5db37a256c3d2fdac8eb3f042c5af7a84777f1935173accb","observation_id":"478ee192-c146-47cc-90c4-25f65decfe5d","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Gemma 4 model card,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:900f5bbe3fe08575a670fcef60485c20efb6caee255339a3881c8e4a484038f3","observation_id":"f2c2f2e9-3202-4c57-bd4b-ce561a047d67","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:f8c513629c6b8c66a75a0b52d976339ca252de8ec0494533b35111924be4d3f4","observation_id":"724a040a-aa46-4b84-b4b0-af86109996ae","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Minillm: On-policy distillation of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:7af6a61122462565e392782f2f735059021b4697744d5dba9739b11f085efa33","observation_id":"89725ebb-405d-47e0-a269-d9ffd01abb86","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:1673fea62d033bc663488dce039e32d697ffa79158ae5aac80bccd24902abbb1","observation_id":"567b2f1a-6bce-4c59-b669-576331c06f00","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:42840fc73385b6bb1a47fa3629bc6b1ac31b149a7a909cf3b7dfd1dac737cc7f","observation_id":"6ba4318d-f899-4257-8af5-3b8ad590d284","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:5347a6407851f1de670e7b93e7b34e1eb3ff4f264d1bcec9ebc286fa0e5e6eb4","observation_id":"cb08dd0a-306f-469d-b534-e96f607325cf","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"HTS-AT: A hierarchical token-semantic audio transformer for sound classification and detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:6e3ad10c7322d7f00e64fdc1dc78f3ef8b7110c408066c392e45c03c351dcf6c","observation_id":"70ec322f-199f-44c5-a93d-efafc958acee","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:e6358c64954172013c64c7b8188149a18e9370bc9c7e47d656f96117be102466","observation_id":"c42d4d08-501d-49d1-989c-da3bc21bd33c","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Wavcaps: A chatgpt-assisted weakly-labelled audio captioning dataset for audio-language multimodal research,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:e6052cfcce94465135ab05b46c0e16e16b34dd0abfd06c1d209e6f7aac4f2fc2","observation_id":"cbf35b7c-daea-48e4-b024-75f4d6e949ca","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Available: https://doi.org/10.1109/TASLP.2024.3419446","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:34a96a9226371bf305f991775f39918f8aacb6a299926371a41bd7f7c2bd6fa2","observation_id":"d3d0bf0d-195b-4907-a672-0c3d7ba10e90","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4647.368147","doi":"10.1145/3664647.3681472","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Auto-acd: A large-scale dataset for audio-language representation learning,","venue":null,"work_id":"dd870d5f-d907-4a79-b3a3-5078259d7614","year":2024},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:c7549bfbb29e747a5e2d9c0e7ba7a30e85c8687f5bf3ddbc80308f3a74062402","observation_id":"90467b0c-3fd6-40bb-8a27-5d448510226c","resolution":{"observed_at":"2026-07-11T16:28:07.857288Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:20:18.763437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:20:18.763437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Macs - multi-annotator captioned soundscapes,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:322f5cdb705d906815c5c438583be3d2e6f0dc47233779ba66756545fd1ed1cb","observation_id":"0304028a-0b4c-4b99-8830-58044652787a","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11116","last_updated":"2025-06-09T06:37:15Z","snapshot_observed_at":"2026-08-15T22:47:41.272189Z","submitted_at":"2025-06-09T06:37:15Z","title":"Infinity Instruct: Scaling Instruction Selection and Synthesis to Enhance Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11116","snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Infinity instruct: Scaling instruction selection and synthesis to enhance language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"cited_paper":"/paper/2506.11116","citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:9258d2dde0d39ef136aec7bf50d3c84cc209c8e0d064a7f30099dd2e672d4da9","observation_id":"a166d7e1-8ea9-4a93-b035-0d25475d890b","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Cider: Consensus-based image description evaluation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:4ad36a615e221065e3898bf3c2972636d552abf94745a5e9a6dd88c677a2a634","observation_id":"df0554b9-7867-45d2-a805-fc19e7265e23","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/iccv.2017.100","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improved image captioning via policy gradient optimization of spider,","venue":null,"work_id":"fac64520-d225-4190-9fbf-c9d0235a6288","year":2017},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:a532ee791f6c9e9d9fd29b828a632f323de8ede9ab6dc93ed9dafd5c19c7c020","observation_id":"9fe9598e-098c-4ea9-a1db-e947fd3bbcc5","resolution":{"observed_at":"2026-07-11T16:28:07.838639Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:20:19.245805+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:20:19.245805+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-319-46454-1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SPICE: semantic propositional image caption evaluation,","venue":"Lecture notes in computer science","work_id":"8648fe74-cd85-4b91-93ba-9330715f157c","year":2016},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:01c0fe32df6d6ff889092de931835e1ec2a2f52a34af4dd3e829f7b82875b98d","observation_id":"e7b5af90-8d46-410d-8992-333c54062544","resolution":{"observed_at":"2026-07-11T16:28:07.821580Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:20:19.489342+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:20:19.489342+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"METEOR: an automatic metric for MT evaluation with improved correlation with human judgments,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:37fb9806178ad9b556f393d9e726db94d61526d1857002c33602a6d9e3b078bc","observation_id":"4fd7b5bb-e1e5-40c8-b2ec-7d21efb79f85","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2607.04619."}