{"as_of":"2026-08-08T07:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2e4a77a7289c0459f0e27c4de08b4b4dcc2bd90d491bf25c214578bbc59ed605","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:02:24.400382Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:02:24.319848Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T19:02:24.469579Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"cited_work":{"arxiv_id":"2507.06674","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.06674","snapshot_observed_at":"2026-08-06T19:02:24.469579Z","title":"Exploring State-Space-Model based Language Model in Music Generation","venue":"cs.SD","work_id":"48ee0520-fb34-4ba6-818b-c5cf3cca0ee5","year":2025},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.319848Z"},"links":{"cited_paper":"/paper/2507.06674","citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:1145c92310602c2c914a5893d5d7cf5109bf0b3c6ae03890730fe9298592d75b","observation_id":"00fb6b57-fae5-4d8d-8ec0-16a53675b20c","resolution":{"observed_at":"2026-08-06T19:02:24.474768Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.06674/citation-record","integrity":"/paper/2507.06674/integrity","json":"/paper/2507.06674/citation-record.json","paper":"/paper/2507.06674"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.651885Z","title":"Exploring State-Space-Model based Language Model in Music Generation","venue":null,"work_id":"17c592dc-a3ec-4baf-a209-21cc43f233dd","year":2025},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.315970Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:88e7a02612453d70a7bc5da1de981acddf0c70aec1245961ba9d302b98ccd94a","observation_id":"52ca52a8-ca71-4afe-bf4a-16e4c5b02055","resolution":{"observed_at":"2026-08-06T19:02:24.654861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"cited_work":{"arxiv_id":"2507.06674","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.06674","snapshot_observed_at":"2026-08-06T19:02:24.469579Z","title":"Exploring State-Space-Model based Language Model in Music Generation","venue":"cs.SD","work_id":"48ee0520-fb34-4ba6-818b-c5cf3cca0ee5","year":2025},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.319848Z"},"links":{"cited_paper":"/paper/2507.06674","citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:1145c92310602c2c914a5893d5d7cf5109bf0b3c6ae03890730fe9298592d75b","observation_id":"00fb6b57-fae5-4d8d-8ec0-16a53675b20c","resolution":{"observed_at":"2026-08-06T19:02:24.474768Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.643376Z","title":"We re-sample all the audio into 44.1kHz and convert them into mono audio, splitting the tracks into non-overlapping 30s clips with vo- cals removed by HTDemucs [3]","venue":null,"work_id":"0a1023b1-9c21-4f40-822e-c432e384954c","year":null},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.323872Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:4bf1fcf7b3180d02ee8f5a53ef0fd1672f0ba64bf591c8fb6b1f7d0730455f8a","observation_id":"933e7d64-8e41-4ebb-b62c-3c85af3ace30","resolution":{"observed_at":"2026-08-06T19:02:24.646549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.634597Z","title":"Both FAD and KLD are lower the better, while CLAP is higher the better","venue":null,"work_id":"11b3a59f-423c-47a9-814d-617a7afcac9d","year":null},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.327623Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:295a196fd235d998f5e6adda1325def41103fc249cf0b396ceb86fe5a9473d56","observation_id":"92e4a2a2-8d09-43d2-842a-bfbf43b85354","resolution":{"observed_at":"2026-08-06T19:02:24.638280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.625885Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":"869faf93-8e9b-487b-96a9-7f4541e39235","year":2019},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.330769Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:1ce6e0e3e6d6db4af1f7f2048c67cef7d78216b0623f5d2f3c7c2864fc88f943","observation_id":"67e548ea-689c-482e-8389-041b800fafdb","resolution":{"observed_at":"2026-08-06T19:02:24.629458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.617857Z","title":"The MTG-Jamendo Dataset for Automatic Music Tagging,","venue":null,"work_id":"b8e67ace-d817-45fe-b8e8-952e026331a9","year":2019},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.334460Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:99dbaa256d6a98d57ace21acd4272c4e6bf1d1aba89899fa0f4f251d6fe37844","observation_id":"c631407a-b575-4016-9edd-38cd09ccdec3","resolution":{"observed_at":"2026-08-06T19:02:24.620895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.609537Z","title":"Hybrid Trans- formers for music source separation,","venue":null,"work_id":"841fb611-2d0b-4905-a2b2-74f58ee3c868","year":2023},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.337857Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:a7c914432081ee8a1fde67fc8b7d0559791a07f6ebfd50199ee717d3fedc65cc","observation_id":"00e27017-3956-4034-9a79-9e6083dc83e5","resolution":{"observed_at":"2026-08-06T19:02:24.612619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.599957Z","title":"LP-MusicCaps: LLM-based pseudo music captioning,","venue":null,"work_id":"43926ef9-57b4-4647-9159-b2547cfc48a4","year":2023},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.340676Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:d7aaeb8209016561fa5d26afe597ca2ff7a76b6365f0bb369c61d3c0d220794e","observation_id":"11f9d51f-5607-4a3d-842a-24024fa52584","resolution":{"observed_at":"2026-08-06T19:02:24.603686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T19:02:24.343931Z","title":"The LLaMA 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.343931Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:c9183d6ecdfb604c3bb4f82b75d38a73c03b79fbaa869939eb6bca7590228f07","observation_id":"598b522d-7970-4ceb-9cde-8c1f1bf82d13","resolution":{"observed_at":"2026-08-06T19:02:24.343931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.590933Z","title":"The Song De- scriber Dataset: a corpus of audio captions for music- and-language evaluation,","venue":null,"work_id":"9c183b6a-e1e0-49fb-a58b-09391bcfa599","year":2023},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.347731Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:5161bbf1076b1dce56e7bce42e6f4b9f0f7e29fe19f11ac9ed9a84c0a3908396","observation_id":"b85630d5-8619-4ffd-9772-07fe6ea42ae6","resolution":{"observed_at":"2026-08-06T19:02:24.594043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.582458Z","title":"Scaling instruction-finetuned language mod- els,","venue":null,"work_id":"682855af-3814-4884-a7c8-c53b58990336","year":2024},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.351332Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:7418f4f82eecb601df55ffb6e0aa83a5b84be1732b7a00be88dd631893b736b7","observation_id":"000d75ce-3637-4739-b292-b75a829d140c","resolution":{"observed_at":"2026-08-06T19:02:24.585432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-06T19:02:24.354155Z","title":"Mamba: Linear-time sequence modeling with selective state spaces,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.354155Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:6279f81bdabfeb8f6c822a0c13cb3a7c4da69cb76936237ed54f6bc5a269c90d","observation_id":"7277841f-9344-40b2-a704-6fb3e73b614d","resolution":{"observed_at":"2026-08-06T19:02:24.354155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.573578Z","title":"Transformers are SSMs: General- ized models and efficient algorithms through structured state space duality,","venue":null,"work_id":"384d8958-3d75-49de-a06d-bc1a2fcb9ee6","year":2024},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.357348Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:d36bad4df19e2699a37944fba21986d73aeccdc30374cf78ac1532a34e59409f","observation_id":"30aec164-c4aa-49f2-b7c3-cb9b7ef8d4fc","resolution":{"observed_at":"2026-08-06T19:02:24.576707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15360","last_updated":"2024-04-24T18:19:21Z","snapshot_observed_at":"2026-07-06T17:49:07.589781Z","submitted_at":"2024-03-22T17:22:56Z","title":"SiMBA: Simplified Mamba-Based Architecture for Vision and Multivariate Time series","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15360","snapshot_observed_at":"2026-08-06T19:02:24.360110Z","title":"SiMBA: Sim- plified mamba-based architecture for vision and multi- variate time series,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.360110Z"},"links":{"cited_paper":"/paper/2403.15360","citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:0c741b51c94e84d4168d3a6a43acd65e574b2e95bde340904122d6cd5a132d70","observation_id":"2e692a93-aa63-4c43-8af3-e2c6e037539c","resolution":{"observed_at":"2026-08-06T19:02:24.360110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.565198Z","title":"High-fidelity audio compression with im- proved RVQGAN,","venue":null,"work_id":"b95f28aa-df58-40a2-8e7c-f3f99f7199d8","year":2023},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.363148Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:cefaeec82f3c9ba8eb7db664215f1eea87e4dce80f5268d8f99bbd155ff5c2cc","observation_id":"8fb1814f-e275-41fa-a96a-c12fce8d4b72","resolution":{"observed_at":"2026-08-06T19:02:24.568184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.556788Z","title":"Coarse-to-fine text-to- music latent diffusion,","venue":null,"work_id":"86aebe5d-170a-4a83-8189-1a5534331d20","year":2025},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.365909Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:8b8d401d432143c961bc9f2acb04855a66472f31d4333f6ce249bc31606a1ee0","observation_id":"756330a9-bde3-40ae-bc9f-83851b512d1a","resolution":{"observed_at":"2026-08-06T19:02:24.559894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-06T19:02:24.368575Z","title":"MusicLM: Generating music from text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.368575Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:a9f104637f7537fc47b03f9924e809bd3dc5a402f2a93be697e6d8b653671365","observation_id":"f1861585-e6c7-4b67-8a64-3bd05e108397","resolution":{"observed_at":"2026-08-06T19:02:24.368575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.548252Z","title":"Simple and control- lable music generation,","venue":null,"work_id":"8cf73418-5085-41c5-9c19-542a6c07c11e","year":2023},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.371630Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:e91999ef7abe72b10f344155d34590428728faa246b56021d775aa77533a07ce","observation_id":"712c6245-8d1c-458f-a56a-62f7ad753d21","resolution":{"observed_at":"2026-08-06T19:02:24.551716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.540320Z","title":"Stable audio open,","venue":null,"work_id":"6e7dcd09-6c67-4eff-b02c-a4ad4f0908e7","year":2025},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.374380Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:51e9efbc09d7173723c5cc78c970e4085edb61833e38063abd73b858de957cf8","observation_id":"4c80ae5d-f2e2-4948-9501-035de94da30d","resolution":{"observed_at":"2026-08-06T19:02:24.543061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.530041Z","title":"AudioLDM 2: Learning Holistic Audio Generation With Self-Supervised Pretraining,","venue":null,"work_id":"27517c91-d3b9-4e71-87f8-e2a21e3ce674","year":2024},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.377638Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:203954f0c66d594795f77fec1cd1429812f5cd39cb950de04f36830a62c8d0f3","observation_id":"eb504c78-366e-48ec-9b61-4c94020b752b","resolution":{"observed_at":"2026-08-06T19:02:24.533682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.519848Z","title":"Mustango: Toward controllable text-to-music generation,","venue":null,"work_id":"d5e0b023-422d-415e-8cee-38421f163be7","year":2024},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.380443Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:70d97e38321b13b7c12847957fc9f727e2739629a5d09e960b71398c5770ed29","observation_id":"6052973c-9722-4fbe-9ef5-59f9fd2b497e","resolution":{"observed_at":"2026-08-06T19:02:24.523416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.510745Z","title":"JEN-1: Text-guided universal music gener- ation with omnidirectional diffusion models,","venue":null,"work_id":"13b4ab26-a25e-4331-a1fe-9e8428ecb420","year":2024},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.384619Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:3310e0c4faff06af8d00220a256691235763e32997ee13409388ba390c368031","observation_id":"18188d7c-b941-47ea-abf2-a948124e77d0","resolution":{"observed_at":"2026-08-06T19:02:24.514119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T19:02:24.387244Z","title":"Uniaudio: An audio foundation model toward universal audio gener- ation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.387244Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:8d5180d81d8ee318c2af04371db93ee528297a454fc27067229717915812a4fc","observation_id":"981006d2-d1a6-4647-8332-b80cd2f36eda","resolution":{"observed_at":"2026-08-06T19:02:24.387244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.499251Z","title":"Music ControlNet: Multiple time-varying controls for music generation,","venue":null,"work_id":"43de0655-f8e6-48fc-88dd-24d55bf5d308","year":2024},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.390173Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:db916c9a00e4935b208d0cf099fe88c00be5a70fcb48a4e7850c30f42256c7ee","observation_id":"826ee30f-3694-43f6-8d8d-1672cfda6509","resolution":{"observed_at":"2026-08-06T19:02:24.503756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-07-30T17:52:19.430476Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-06T19:02:24.393797Z","title":"Fréchet Audio Distance: A metric for evaluat- ing music enhancement algorithms,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.393797Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:c75582ad3505cffc51d151d1cd8ad5abb8f1fac8b771ccc2500b239dd6782b8b","observation_id":"24806345-b78f-48b7-bf08-ab5630f53a63","resolution":{"observed_at":"2026-08-06T19:02:24.393797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.490411Z","title":"CLAP: Learning audio concepts from natural lan- guage supervision,","venue":null,"work_id":"4df3bab0-be96-4f8c-882b-5eb701f40241","year":2023},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.396775Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:64cf622f1b834682e9818da4ac97be85c6a908aa9ad28e0d1fe8e92d34ea0f2b","observation_id":"3892877c-48bd-44d7-9e39-bd73ceda8384","resolution":{"observed_at":"2026-08-06T19:02:24.493484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:02:24.481246Z","title":"MuseControlLite: Multifunctional music generation with lightweight conditioners,","venue":null,"work_id":"36f4e79f-2e84-4a4c-95e2-40051af86912","year":2025},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.400382Z"},"links":{"citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:85157c733c2646968cc96093ccccba4f8e5085880a78514b90982986bd964c01","observation_id":"90bba355-2469-4f7f-b1ed-0d607a9d9f5e","resolution":{"observed_at":"2026-08-06T19:02:24.484848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 1 inbound Pith citation observation for arXiv:2507.06674."}