{"as_of":"2026-08-22T08:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7863828c5b2d4ce393ea3a5ad1304fea111d2a77fe52bd22709eb6dff0c13941","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:45:57.076238Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T15:40:57.719214Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T15:43:32.551173Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"cited_work":{"arxiv_id":"2506.15154","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15154","snapshot_observed_at":"2026-06-29T15:43:32.551173Z","title":"Sonicverse: Multi-task learning for music feature-informed caption- ing,","venue":null,"work_id":"151a123c-02b3-48b3-a0f0-ab4edd3f1b05","year":2025},"citing_paper":{"arxiv_id":"2605.27346","last_updated":"2026-05-26T17:49:18Z","snapshot_observed_at":"2026-08-14T08:33:36.840035Z","submitted_at":"2026-05-26T17:49:18Z","title":"MERIT: Learning Disentangled Music Representations for Audio Similarity","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T15:40:57.719214Z"},"links":{"cited_paper":"/paper/2506.15154","citing_paper":"/paper/2605.27346"},"observation_digest":"sha256:4e204639db21f153d50a6ac7d0f7b56611b242c4ba81cb7514c9cccf574de358","observation_id":"e9dcf0b2-d6fc-4662-b245-5dde3f7bda8a","resolution":{"observed_at":"2026-06-29T15:43:32.552824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.15154/citation-record","integrity":"/paper/2506.15154/integrity","json":"/paper/2506.15154/citation-record.json","paper":"/paper/2506.15154"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T19:45:56.837152Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:56.837152Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:a923dc7309c92a01ff05ed9f69690f54c93a103038dc38cb167b6e5da10d2365","observation_id":"10a13a6a-400f-4d3e-80f3-471fe3ae919f","resolution":{"observed_at":"2026-08-15T19:45:56.837152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-20T13:40:28.954978Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-15T19:45:56.846792Z","title":"I., Borsos, Z., Engel, J., Verzetti, M., Caillon, A., Huang, Q., Jansen, A., Roberts, A., Tagliasacchi, M., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:56.846792Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:b7b4478a155edad0f736f8eae9cc944745c1c9ea881ccadcb6ddeb34521b2366","observation_id":"4dbef810-a1f8-4d1b-a73c-bc21669a8075","resolution":{"observed_at":"2026-08-15T19:45:56.846792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:58.199770Z","title":"and Lavie, A","venue":null,"work_id":"c099340a-9d39-4e2d-a1d5-2f448c9a6be6","year":2005},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:56.853864Z"},"links":{"citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:d8a7b8ba59043be9a6d5e0d55f7b7243dc603095f38158235ebfdf3157d56734","observation_id":"e80cd79b-674b-4b7c-9c95-c90aaf256dec","resolution":{"observed_at":"2026-08-15T19:45:58.209579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:58.163727Z","title":null,"venue":null,"work_id":"1501707b-b34c-4fe7-b797-18e075269046","year":2019},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:56.861391Z"},"links":{"citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:4119401b31a24e88f5aeedbe1bacb103ff4709dc3d21fccc8de6edf23b7ee261","observation_id":"1e05fde3-fdfc-43fe-9b77-cb09dcd2b9b6","resolution":{"observed_at":"2026-08-15T19:45:58.171723Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-19T21:51:01.237503Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-15T19:45:56.869307Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:56.869307Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:d65c9bacc6ea9fbbd41b849d3829ddf9cdb18c71e271ee1c8ac18809e603f892","observation_id":"01302fff-0fc9-4900-8b4b-b2469ddad949","resolution":{"observed_at":"2026-08-15T19:45:56.869307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00469","last_updated":"2024-11-01T09:34:36Z","snapshot_observed_at":"2026-08-16T13:03:51.172727Z","submitted_at":"2024-11-01T09:34:36Z","title":"MIRFLEX: Music Information Retrieval Feature Library for Extraction","version":1},"cited_work":{"arxiv_id":"2411.00469","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.00469","snapshot_observed_at":"2026-08-15T19:45:57.468585Z","title":"MIRFLEX: Music Information Retrieval Feature Library for Extraction","venue":"cs.SD","work_id":"06742586-ddcf-4a37-b083-65cf29250b51","year":2024},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:56.878442Z"},"links":{"cited_paper":"/paper/2411.00469","citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:60ce54451fa17039ce062eb8bab42d20825d235510d75ae408623525a7467717","observation_id":"391c0f51-ea8a-4807-b3f6-137a0ce4cbb8","resolution":{"observed_at":"2026-08-15T19:45:57.477069Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-15T19:45:56.886395Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:56.886395Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:77c87ea33419eb6e63d8714070caff6b624a9dd24071158580fe524b169fe6d1","observation_id":"6eec5996-d9f7-4920-8f26-d2eddd11b553","resolution":{"observed_at":"2026-08-15T19:45:56.886395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:58.129578Z","title":null,"venue":null,"work_id":"9617ba09-4da7-4873-a39a-c54008b9f198","year":2011},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:56.893047Z"},"links":{"citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:e50b800e49f101386d20f5e7b3163a981db1ee271a4a4535ecdcee6298eeaa00","observation_id":"bc7d538c-60ed-4278-bc5e-4d11a1ecc207","resolution":{"observed_at":"2026-08-15T19:45:58.138518Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08730","last_updated":"2024-04-02T13:35:59Z","snapshot_observed_at":"2026-08-21T11:23:44.233392Z","submitted_at":"2023-09-15T19:31:40Z","title":"MusiLingo: Bridging Music and Text with Pre-trained Language Models for Music Captioning and Query Response","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08730","snapshot_observed_at":"2026-08-15T19:45:56.900402Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:56.900402Z"},"links":{"cited_paper":"/paper/2309.08730","citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:fd9d0aab5b778d5fe8964b1bb5ad542caf6a5a0b7427cd6ca8d38e478cd18a63","observation_id":"86ff009b-f8cf-412e-809f-9d41eddf3a90","resolution":{"observed_at":"2026-08-15T19:45:56.900402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:58.087078Z","title":null,"venue":null,"work_id":"a993bb09-d9f5-41e3-9ab2-90b77ed13028","year":2023},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:56.906879Z"},"links":{"citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:ca026aebba4542ec5a26a368d3a9da59d78edbaf41c93f61f4544b0e3de7c913","observation_id":"5437857e-0435-4f7e-b07f-2f0e04276508","resolution":{"observed_at":"2026-08-15T19:45:58.096079Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07160","last_updated":"2024-06-03T03:35:01Z","snapshot_observed_at":"2026-08-21T14:27:53.877609Z","submitted_at":"2023-10-11T03:12:47Z","title":"LLark: A Multimodal Instruction-Following Language Model for Music","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07160","snapshot_observed_at":"2026-08-15T19:45:56.914108Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:56.914108Z"},"links":{"cited_paper":"/paper/2310.07160","citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:5e649b4c81809040df362fb05a55fe43d85c295516befdd853cfff2eeaaf1230","observation_id":"52863ebc-80cc-484f-828e-2c7b3f558874","resolution":{"observed_at":"2026-08-15T19:45:56.914108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-15T19:45:56.927172Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:56.927172Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:f82232bc481b0532f5cb03b45f0adebee334cde796d2bae38e75dc3b10b56a26","observation_id":"8498e23a-e756-4872-939f-f5ec014c1fa0","resolution":{"observed_at":"2026-08-15T19:45:56.927172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:58.058280Z","title":"R., and Macha, S","venue":null,"work_id":"ae7418cd-4f64-4dbc-a518-ad37d080a3af","year":2024},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:56.935460Z"},"links":{"citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:5da4ccbcc61d9d5f3da9e029418cf3a2f06f96217a6e2ecb2d82e9d482ae4241","observation_id":"07a570bb-e9a7-469b-9fb2-f21a5778cf66","resolution":{"observed_at":"2026-08-15T19:45:58.066868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:58.000574Z","title":null,"venue":null,"work_id":"27d090f6-b0ce-4c14-95a6-713558ca26e8","year":2022},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:56.944735Z"},"links":{"citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:f9bd37b1963e081388cdc01d27926dc880f25b3249aea9f4b6564733ec18a730","observation_id":"252c1f25-ee90-4d24-8f8b-3bbeb7e18dbf","resolution":{"observed_at":"2026-08-15T19:45:58.022487Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:57.955585Z","title":"A., Pinkl, C., Perraudin, N., and Wattenhofer, R","venue":null,"work_id":"06e549b0-61bd-4af0-adcf-29fba9a189e9","year":2025},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:56.951431Z"},"links":{"citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:e412cdb83d18747023dbe4ba0322e2ee44cd63c7d475d48555878a6c78741d58","observation_id":"99e4e2e5-5d8b-4112-8502-f01b1e1c7a86","resolution":{"observed_at":"2026-08-15T19:45:57.966233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:57.923560Z","title":"I., Bay, M., and Downie, J","venue":null,"work_id":"ee920ae5-c0d9-4a29-830a-0475127d9744","year":2009},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:56.958722Z"},"links":{"citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:4718ade8caf55c76e0c7d770d4bd21fde6ab15c9e3ac432ba9889b6df37a8d58","observation_id":"70bf67ff-e22e-43c2-a744-9441cd1bc5a0","resolution":{"observed_at":"2026-08-15T19:45:57.934470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00107","last_updated":"2024-12-27T12:28:34Z","snapshot_observed_at":"2026-08-20T05:49:02.872593Z","submitted_at":"2023-05-31T18:27:43Z","title":"MERT: Acoustic Music Understanding Model with Large-Scale Self-supervised Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00107","snapshot_observed_at":"2026-08-15T19:45:56.965706Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:56.965706Z"},"links":{"cited_paper":"/paper/2306.00107","citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:4e33b3ffacecdbad219d4304f6a977f609b3e41c05b5d3315c92b7e0966cfcc6","observation_id":"7770d045-5339-4e06-8660-f1980f046245","resolution":{"observed_at":"2026-08-15T19:45:56.965706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:56.972481Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:56.972481Z"},"links":{"citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:9d8b9f53a0ec11d09331c11922b59da351c8a1ebd2ec7846edbcb0827059f52e","observation_id":"dfdb8473-7349-4e1d-9212-8c9b67838118","resolution":{"observed_at":"2026-08-15T19:45:56.972481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:57.866987Z","title":"S., Sun, C., and Shan, Y","venue":null,"work_id":"ec9f22d3-5f7e-461e-8104-a45b6b9378a7","year":2024},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:56.980761Z"},"links":{"citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:7282be863b18ce3161f029e4f8fe33534bbded09812a22480c92c0d5dabf457b","observation_id":"1146dac3-e389-466b-bd70-ea6c0ed6f4f5","resolution":{"observed_at":"2026-08-15T19:45:57.874428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:57.837068Z","title":null,"venue":null,"work_id":"ae9d6119-1cad-4691-8aec-a9efb50aeb0d","year":2021},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:56.987196Z"},"links":{"citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:fea31de4a02ae5dafab7d15f17e5bd7a36084e51fd5560adfe3f5e135ae0b58b","observation_id":"fc8ab943-664f-4280-856e-677699028217","resolution":{"observed_at":"2026-08-15T19:45:57.847391Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:57.803567Z","title":null,"venue":null,"work_id":"bf5450a3-51be-4271-bce3-111a758fd63d","year":2024},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:56.996510Z"},"links":{"citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:cd2a04a74c5a3351ba1bd05da92486fc6e8887dba6863aaa59d5488d2fe99f7d","observation_id":"10e9c852-e791-4e49-b042-aa0e6beac99c","resolution":{"observed_at":"2026-08-15T19:45:57.817054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:57.775302Z","title":null,"venue":null,"work_id":"ffc557fd-12a7-4c2e-b55f-cde0cbad316a","year":2023},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:57.011318Z"},"links":{"citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:d653076474a2e86dea28065e7d17f3ae66a0a5c32f4ef9fcec10c88ceabfed31","observation_id":"dd87d5b5-8380-412e-9b07-61141754383f","resolution":{"observed_at":"2026-08-15T19:45:57.784413Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:57.737632Z","title":"C., Davies, M","venue":null,"work_id":"00f75a2a-e6a0-4ada-b0a7-4fb0d296c3f4","year":2019},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:57.018993Z"},"links":{"citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:13ecaccdde8477639a9f89e258713910f75f3d1881a7d61abcc9b425496c5299","observation_id":"934fcba2-be25-4020-b5dc-b0c11459c6a4","resolution":{"observed_at":"2026-08-15T19:45:57.747137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:57.026932Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:57.026932Z"},"links":{"citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:36514a60cf9b2e07e0eadda6c7f6473806a36cb497966f0238b8ad8f678d4e55","observation_id":"d26b14df-aafa-4c90-b478-6f26a0d16c8c","resolution":{"observed_at":"2026-08-15T19:45:57.026932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:57.665779Z","title":"W., Xu, T., Brockman, G., McLeavey, C., and Sutskever, I","venue":null,"work_id":"15770ae8-fdf4-4971-80ba-622978f8279a","year":2023},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:57.033183Z"},"links":{"citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:ca8306a5ba84af2ef291e0bdbe198496ba1b54bb541b063a9ede719640799250","observation_id":"56fb8458-d3e8-4f10-9cc9-2b8a0ff86c6f","resolution":{"observed_at":"2026-08-15T19:45:57.672566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:57.639200Z","title":null,"venue":null,"work_id":"d6291bc7-a23a-403b-a5cd-be3451712761","year":2025},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:57.040029Z"},"links":{"citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:6a611a723c1c8bcbb85df19c211ccf8309f92a6210acc95e8dae0d448b9f7dd3","observation_id":"13dc23d5-3091-45e9-908e-22dfd0c91dfe","resolution":{"observed_at":"2026-08-15T19:45:57.647730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-21T12:15:18.108504Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-15T19:45:57.046473Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:57.046473Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:58c4325beff5629e4b60c062107ccd2a184f5dd30beef1566e997da1f3d190bc","observation_id":"e410f084-a597-47a7-b7b0-3d4ddf1e4669","resolution":{"observed_at":"2026-08-15T19:45:57.046473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20445","last_updated":"2024-07-29T22:53:32Z","snapshot_observed_at":"2026-08-18T10:32:16.076467Z","submitted_at":"2024-07-29T22:53:32Z","title":"Futga: Towards Fine-grained Music Understanding through Temporally-enhanced Generative Augmentation","version":1},"cited_work":{"arxiv_id":"2407.20445","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.20445","snapshot_observed_at":"2026-08-15T19:45:57.213384Z","title":"Futga: Towards Fine-grained Music Understanding through Temporally-enhanced Generative Augmentation","venue":"cs.SD","work_id":"cfcf8a94-4d39-46ad-bec2-37f2d3c1b29a","year":2024},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:57.053415Z"},"links":{"cited_paper":"/paper/2407.20445","citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:dd9969cb14fc669dcff6d03b0a5163036ba0b604e90c3e767065107a756df414","observation_id":"98814489-b7b2-4623-ba7f-6274e204dc38","resolution":{"observed_at":"2026-08-15T19:45:57.223689Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:45:57.613391Z","title":null,"venue":null,"work_id":"d7b32449-0c80-47ff-8384-eed8e0b72e78","year":2023},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:57.062067Z"},"links":{"citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:1d09a00a865f7af71f8ea8ad31e398a3b9ce5e2797904166610e85398752dee9","observation_id":"07792add-b5fa-4d37-84ad-274994fab8c0","resolution":{"observed_at":"2026-08-15T19:45:57.621830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07729","last_updated":"2024-07-26T06:30:47Z","snapshot_observed_at":"2026-08-19T21:31:31.421076Z","submitted_at":"2024-02-12T15:41:22Z","title":"AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07729","snapshot_observed_at":"2026-08-15T19:45:57.070944Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:57.070944Z"},"links":{"cited_paper":"/paper/2402.07729","citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:5a156943ae3349b2991771af2d65744eae52de27742beab791a805d01bb72a88","observation_id":"4257b6fe-2671-4320-833a-02fb32ad96d5","resolution":{"observed_at":"2026-08-15T19:45:57.070944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-15T19:45:57.076238Z","title":"Q., and Artzi, Y","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T19:45:57.076238Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2506.15154"},"observation_digest":"sha256:96fb714f37b73bf8f318dc165222ba4a92ceca03b12f475db0310ea0a8bdaae2","observation_id":"7172946b-9f16-451e-9890-ebc3cc9aa54e","resolution":{"observed_at":"2026-08-15T19:45:57.076238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.15154","last_updated":"2025-06-18T05:51:36Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-19T18:30:42.845566Z","submitted_at":"2025-06-18T05:51:36Z","title":"SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":2,"verified_fuzzy":7},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2506.15154."}