{"as_of":"2026-08-14T15:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7af93098de9cfa751183eb4cb99a74a8a0617873435d844a7502bb5bd41d3a42","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:16:20.587006Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:16:20.525225Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-12T18:16:20.673249Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.11692","last_updated":"2024-11-18T16:13:49Z","snapshot_observed_at":"2026-08-14T14:49:08.385450Z","submitted_at":"2024-11-18T16:13:49Z","title":"Do Captioning Metrics Reflect Music Semantic Alignment?","version":1},"cited_work":{"arxiv_id":"2411.11692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.11692","snapshot_observed_at":"2026-08-12T18:16:20.673249Z","title":"Do Captioning Metrics Reflect Music Semantic Alignment?","venue":"cs.SD","work_id":"532304f8-fd22-4eea-ba61-af7709d56025","year":2024},"citing_paper":{"arxiv_id":"2411.11692","last_updated":"2024-11-18T16:13:49Z","snapshot_observed_at":"2026-08-14T14:49:08.385450Z","submitted_at":"2024-11-18T16:13:49Z","title":"Do Captioning Metrics Reflect Music Semantic Alignment?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T18:16:20.525225Z"},"links":{"cited_paper":"/paper/2411.11692","citing_paper":"/paper/2411.11692"},"observation_digest":"sha256:3436cd661e0c56e4be742338858657e7ff2248f5403a6aa423b9dc05909be33f","observation_id":"bfb42475-c9ac-4817-8529-e6c86d3dfb20","resolution":{"observed_at":"2026-08-12T18:16:20.680154Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11692","last_updated":"2024-11-18T16:13:49Z","snapshot_observed_at":"2026-08-14T14:49:08.385450Z","submitted_at":"2024-11-18T16:13:49Z","title":"Do Captioning Metrics Reflect Music Semantic Alignment?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11692","snapshot_observed_at":"2026-08-04T00:29:46.542729Z","title":"Do captioning metrics reflect music semantic alignment? arXiv preprint arXiv:2411.11692, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05550","last_updated":"2026-08-07T18:02:27Z","snapshot_observed_at":"2026-08-13T23:11:02.184753Z","submitted_at":"2025-11-02T18:08:26Z","title":"Assessing Factual Music Comprehension in Large Audio Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T00:29:46.542729Z"},"links":{"cited_paper":"/paper/2411.11692","citing_paper":"/paper/2511.05550"},"observation_digest":"sha256:04044c2f3fdebff5587a04324772e165fd7df95f7197bf59c62a8d854c4f9dfe","observation_id":"033950c9-54e7-4d72-b527-22cd8b6fe934","resolution":{"observed_at":"2026-08-04T00:29:46.542729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.11692/citation-record","integrity":"/paper/2411.11692/integrity","json":"/paper/2411.11692/citation-record.json","paper":"/paper/2411.11692"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:16:20.848912Z","title":"Do Captioning Metrics reflect Mu- sic Semantic Alignment?","venue":null,"work_id":"5ec644f6-1e41-491d-9157-a2dced0f87b7","year":2024},"citing_paper":{"arxiv_id":"2411.11692","last_updated":"2024-11-18T16:13:49Z","snapshot_observed_at":"2026-08-14T14:49:08.385450Z","submitted_at":"2024-11-18T16:13:49Z","title":"Do Captioning Metrics Reflect Music Semantic Alignment?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T18:16:20.514327Z"},"links":{"citing_paper":"/paper/2411.11692"},"observation_digest":"sha256:c1bdbd216597d8d651dbd8a2f8bcf3c6f2ca2a97ef1bce156a91c0705fb13bb4","observation_id":"3b169d13-7e36-4792-8a53-901b86d34e52","resolution":{"observed_at":"2026-08-12T18:16:20.853868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:16:20.831542Z","title":"We use Amazon Mechanical Turk [9] to recruit 50 par- ticipants for a listening test","venue":null,"work_id":"2a09630b-5c54-48a5-98db-a95166feb1ba","year":null},"citing_paper":{"arxiv_id":"2411.11692","last_updated":"2024-11-18T16:13:49Z","snapshot_observed_at":"2026-08-14T14:49:08.385450Z","submitted_at":"2024-11-18T16:13:49Z","title":"Do Captioning Metrics Reflect Music Semantic Alignment?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T18:16:20.520025Z"},"links":{"citing_paper":"/paper/2411.11692"},"observation_digest":"sha256:7498ab9c6f3baf568150f1aaa8e8445c872f981ab74abafe6ddaec444fd3ee99","observation_id":"94cfdac0-a382-4a10-8e7b-d46f16bf103d","resolution":{"observed_at":"2026-08-12T18:16:20.837709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11692","last_updated":"2024-11-18T16:13:49Z","snapshot_observed_at":"2026-08-14T14:49:08.385450Z","submitted_at":"2024-11-18T16:13:49Z","title":"Do Captioning Metrics Reflect Music Semantic Alignment?","version":1},"cited_work":{"arxiv_id":"2411.11692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.11692","snapshot_observed_at":"2026-08-12T18:16:20.673249Z","title":"Do Captioning Metrics Reflect Music Semantic Alignment?","venue":"cs.SD","work_id":"532304f8-fd22-4eea-ba61-af7709d56025","year":2024},"citing_paper":{"arxiv_id":"2411.11692","last_updated":"2024-11-18T16:13:49Z","snapshot_observed_at":"2026-08-14T14:49:08.385450Z","submitted_at":"2024-11-18T16:13:49Z","title":"Do Captioning Metrics Reflect Music Semantic Alignment?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T18:16:20.525225Z"},"links":{"cited_paper":"/paper/2411.11692","citing_paper":"/paper/2411.11692"},"observation_digest":"sha256:3436cd661e0c56e4be742338858657e7ff2248f5403a6aa423b9dc05909be33f","observation_id":"bfb42475-c9ac-4817-8529-e6c86d3dfb20","resolution":{"observed_at":"2026-08-12T18:16:20.680154Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:16:20.815189Z","title":"Given these findings, we conclude that a more nuanced evaluation framework is necessary to ad- dress these challenges","venue":null,"work_id":"8c83c3a8-0399-41c0-9ec4-579fc97ea56f","year":null},"citing_paper":{"arxiv_id":"2411.11692","last_updated":"2024-11-18T16:13:49Z","snapshot_observed_at":"2026-08-14T14:49:08.385450Z","submitted_at":"2024-11-18T16:13:49Z","title":"Do Captioning Metrics Reflect Music Semantic Alignment?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T18:16:20.531064Z"},"links":{"citing_paper":"/paper/2411.11692"},"observation_digest":"sha256:2add14d476bf661bd4906b83dda0c4bc4c0264659d4045f68bc08bc2525e36e7","observation_id":"622998b5-df48-44ee-b5fe-7b750c3a4e3c","resolution":{"observed_at":"2026-08-12T18:16:20.820031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:16:20.799789Z","title":"Muscaps: Generating captions for music audio,","venue":null,"work_id":"b3ad87d7-358c-43fd-acda-303a149d690d","year":2021},"citing_paper":{"arxiv_id":"2411.11692","last_updated":"2024-11-18T16:13:49Z","snapshot_observed_at":"2026-08-14T14:49:08.385450Z","submitted_at":"2024-11-18T16:13:49Z","title":"Do Captioning Metrics Reflect Music Semantic Alignment?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T18:16:20.536128Z"},"links":{"citing_paper":"/paper/2411.11692"},"observation_digest":"sha256:5fb8eda82163ad6b673f2d7664dfc106dd9449f2cdcc0bef9211f888804a0e74","observation_id":"a860b733-f57a-42bf-b6c4-418370b3a220","resolution":{"observed_at":"2026-08-12T18:16:20.804601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16372","last_updated":"2023-07-31T02:32:02Z","snapshot_observed_at":"2026-08-14T09:47:40.607422Z","submitted_at":"2023-07-31T02:32:02Z","title":"LP-MusicCaps: LLM-Based Pseudo Music Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16372","snapshot_observed_at":"2026-08-12T18:16:20.541373Z","title":"Lp-musiccaps: Llm-based pseudo music captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11692","last_updated":"2024-11-18T16:13:49Z","snapshot_observed_at":"2026-08-14T14:49:08.385450Z","submitted_at":"2024-11-18T16:13:49Z","title":"Do Captioning Metrics Reflect Music Semantic Alignment?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T18:16:20.541373Z"},"links":{"cited_paper":"/paper/2307.16372","citing_paper":"/paper/2411.11692"},"observation_digest":"sha256:049204376414b95b5779fc891326a462474d7d502a1f29924937f373ac2aefb9","observation_id":"89a90ebf-0e39-4f7c-9c86-553f337d8a4d","resolution":{"observed_at":"2026-08-12T18:16:20.541373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:16:20.784025Z","title":"Llark: A multimodal instruction-following language model for music,","venue":null,"work_id":"c6a4b627-f1de-4f91-a7c1-26197ccadc2f","year":2023},"citing_paper":{"arxiv_id":"2411.11692","last_updated":"2024-11-18T16:13:49Z","snapshot_observed_at":"2026-08-14T14:49:08.385450Z","submitted_at":"2024-11-18T16:13:49Z","title":"Do Captioning Metrics Reflect Music Semantic Alignment?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T18:16:20.546609Z"},"links":{"citing_paper":"/paper/2411.11692"},"observation_digest":"sha256:f75e7df198379040804e24ae936f0757ac8b38c35c801b3a26df372713e5d52c","observation_id":"adcecec9-e887-4faa-99c6-32c3c3f44864","resolution":{"observed_at":"2026-08-12T18:16:20.789137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00107","last_updated":"2024-12-27T12:28:34Z","snapshot_observed_at":"2026-08-13T11:27:58.554229Z","submitted_at":"2023-05-31T18:27:43Z","title":"MERT: Acoustic Music Understanding Model with Large-Scale Self-supervised Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00107","snapshot_observed_at":"2026-08-12T18:16:20.551474Z","title":"Mert: Acoustic music understanding model with large-scale self-supervised training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11692","last_updated":"2024-11-18T16:13:49Z","snapshot_observed_at":"2026-08-14T14:49:08.385450Z","submitted_at":"2024-11-18T16:13:49Z","title":"Do Captioning Metrics Reflect Music Semantic Alignment?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T18:16:20.551474Z"},"links":{"cited_paper":"/paper/2306.00107","citing_paper":"/paper/2411.11692"},"observation_digest":"sha256:e90ead631ca82d771d7e42798602329074a17dc36b8b254ed999343b8ee9016b","observation_id":"cbb8af77-3443-4945-bdf7-29efd5eff172","resolution":{"observed_at":"2026-08-12T18:16:20.551474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:16:20.557547Z","title":"Enriching music descriptions with a finetuned-llm and metadata for text-to-music retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11692","last_updated":"2024-11-18T16:13:49Z","snapshot_observed_at":"2026-08-14T14:49:08.385450Z","submitted_at":"2024-11-18T16:13:49Z","title":"Do Captioning Metrics Reflect Music Semantic Alignment?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T18:16:20.557547Z"},"links":{"citing_paper":"/paper/2411.11692"},"observation_digest":"sha256:6b8b8f7a9d9dc3aa28187715f2067d48d05b7030a620564cf20b56a67c38cb08","observation_id":"c4ffbc06-1e54-4dc8-a89f-42936e465bdc","resolution":{"observed_at":"2026-08-12T18:16:20.557547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:16:20.756158Z","title":"Bleu: a method for automatic evaluation of machine transla- tion,","venue":null,"work_id":"6b247b8d-bea2-40da-8130-9d6f6bf20f1c","year":2002},"citing_paper":{"arxiv_id":"2411.11692","last_updated":"2024-11-18T16:13:49Z","snapshot_observed_at":"2026-08-14T14:49:08.385450Z","submitted_at":"2024-11-18T16:13:49Z","title":"Do Captioning Metrics Reflect Music Semantic Alignment?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T18:16:20.562780Z"},"links":{"citing_paper":"/paper/2411.11692"},"observation_digest":"sha256:f78b43c0658d9e84dd8d814c2b6244495bdf2a87f60ce1cfe4d1915a3e3d4911","observation_id":"158c7897-cf97-498d-9874-7a286bf68494","resolution":{"observed_at":"2026-08-12T18:16:20.762013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:16:20.739402Z","title":"Meteor: An automatic met- ric for mt evaluation with improved correlation with human judgments,","venue":null,"work_id":"61a00cb0-3587-420a-a4ef-4160bd76c878","year":2005},"citing_paper":{"arxiv_id":"2411.11692","last_updated":"2024-11-18T16:13:49Z","snapshot_observed_at":"2026-08-14T14:49:08.385450Z","submitted_at":"2024-11-18T16:13:49Z","title":"Do Captioning Metrics Reflect Music Semantic Alignment?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T18:16:20.567322Z"},"links":{"citing_paper":"/paper/2411.11692"},"observation_digest":"sha256:b65685bdefcec3297d3af85560f529c4965917eae9feb0c0091638ae60381059","observation_id":"cdce3d79-a11e-4e12-875f-c8e81f1703cf","resolution":{"observed_at":"2026-08-12T18:16:20.745121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:16:20.723513Z","title":"Rouge: A package for automatic evalua- tion of summaries,","venue":null,"work_id":"306818db-1dfa-4c8d-9a38-11b13b69059b","year":2004},"citing_paper":{"arxiv_id":"2411.11692","last_updated":"2024-11-18T16:13:49Z","snapshot_observed_at":"2026-08-14T14:49:08.385450Z","submitted_at":"2024-11-18T16:13:49Z","title":"Do Captioning Metrics Reflect Music Semantic Alignment?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T18:16:20.572193Z"},"links":{"citing_paper":"/paper/2411.11692"},"observation_digest":"sha256:1f154c8af0ccbf58895b90f4e50f38fee777fe812a579f7649c7de4fe6f583d2","observation_id":"0c6e373b-6d59-4309-8c76-3dbfa5fd393d","resolution":{"observed_at":"2026-08-12T18:16:20.728701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:16:20.707239Z","title":"Amazon mechanical turk,","venue":null,"work_id":"42392aad-b883-4680-a6e0-770eabdbdd48","year":2024},"citing_paper":{"arxiv_id":"2411.11692","last_updated":"2024-11-18T16:13:49Z","snapshot_observed_at":"2026-08-14T14:49:08.385450Z","submitted_at":"2024-11-18T16:13:49Z","title":"Do Captioning Metrics Reflect Music Semantic Alignment?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T18:16:20.576905Z"},"links":{"citing_paper":"/paper/2411.11692"},"observation_digest":"sha256:7ea4d7f5c72c440627236667eb9f679a004b3608d0258d30a2fe4562e0cd8236","observation_id":"26e60fa9-97aa-43d5-93bc-00c886ff4feb","resolution":{"observed_at":"2026-08-12T18:16:20.712346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-14T02:16:19.922733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-12T18:16:20.582172Z","title":"Musiclm: Generating music from text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11692","last_updated":"2024-11-18T16:13:49Z","snapshot_observed_at":"2026-08-14T14:49:08.385450Z","submitted_at":"2024-11-18T16:13:49Z","title":"Do Captioning Metrics Reflect Music Semantic Alignment?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T18:16:20.582172Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2411.11692"},"observation_digest":"sha256:1cb2258be1892a60cdcc9a0ba800daa4b990a5e73add41d9157f4c7b54946c38","observation_id":"07495a97-d33c-48ca-a959-22c9338cf55b","resolution":{"observed_at":"2026-08-12T18:16:20.582172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:16:20.691163Z","title":"Can audio captions be evaluated with image caption metrics?","venue":null,"work_id":"27c32122-3e8c-4940-8e65-ca2e1928cb1f","year":2022},"citing_paper":{"arxiv_id":"2411.11692","last_updated":"2024-11-18T16:13:49Z","snapshot_observed_at":"2026-08-14T14:49:08.385450Z","submitted_at":"2024-11-18T16:13:49Z","title":"Do Captioning Metrics Reflect Music Semantic Alignment?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T18:16:20.587006Z"},"links":{"citing_paper":"/paper/2411.11692"},"observation_digest":"sha256:67e2d3d615cb262660ba3660d3cd85598b257564e02a338b7bdc4933cdade050","observation_id":"4c849e99-35d7-443a-aec4-414bfa79756d","resolution":{"observed_at":"2026-08-12T18:16:20.696691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.11692","last_updated":"2024-11-18T16:13:49Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-14T14:49:08.385450Z","submitted_at":"2024-11-18T16:13:49Z","title":"Do Captioning Metrics Reflect Music Semantic Alignment?"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 2 inbound Pith citation observations for arXiv:2411.11692."}