{"as_of":"2026-08-07T08:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cfbdc448793e15196faca8b6aa1d0b7673867771b5d281d755efe08b26ad46ff","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:57:08.122917Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T02:12:58.120295Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T02:17:46.305033Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2506.23009","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23009","snapshot_observed_at":"2026-07-11T02:17:46.305033Z","title":"arXiv preprint arXiv:2506.23009 (2025)","venue":"cs.CV","work_id":"5de567d0-d759-4229-8585-c008c17da27a","year":2025},"citing_paper":{"arxiv_id":"2604.20719","last_updated":"2026-04-22T16:06:48Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T16:06:48Z","title":"ONOTE: Benchmarking Omnimodal Notation Processing for Expert-level Music Intelligence","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-09T23:03:01.356594Z"},"links":{"cited_paper":"/paper/2506.23009","citing_paper":"/paper/2604.20719"},"observation_digest":"sha256:1869e94e4b3c78051801785a4958bba77428a30ac0f4ab1a48ec2fdf56df5b8b","observation_id":"d96761d1-6795-4eab-9920-7f5e5c1453f1","resolution":{"observed_at":"2026-05-09T23:04:17.568533Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2506.23009","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23009","snapshot_observed_at":"2026-07-11T02:17:46.305033Z","title":"arXiv preprint arXiv:2506.23009 (2025)","venue":"cs.CV","work_id":"5de567d0-d759-4229-8585-c008c17da27a","year":2025},"citing_paper":{"arxiv_id":"2605.22255","last_updated":"2026-05-28T16:18:50Z","snapshot_observed_at":"2026-07-06T23:32:35.159280Z","submitted_at":"2026-05-21T09:59:59Z","title":"Direct content-based retrieval from music scores images","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T07:21:33.390581Z"},"links":{"cited_paper":"/paper/2506.23009","citing_paper":"/paper/2605.22255"},"observation_digest":"sha256:1b63c405cf5157a0e3da6e8b9e5f3ac0e72e464a9bde69234b4dec89ec9f4aa1","observation_id":"d3580fe4-5cda-4565-a885-f9ca87d51454","resolution":{"observed_at":"2026-05-22T07:24:43.335938Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2506.23009","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23009","snapshot_observed_at":"2026-07-11T02:17:46.305033Z","title":"arXiv preprint arXiv:2506.23009 (2025)","venue":"cs.CV","work_id":"5de567d0-d759-4229-8585-c008c17da27a","year":2025},"citing_paper":{"arxiv_id":"2605.22255","last_updated":"2026-05-28T16:18:50Z","snapshot_observed_at":"2026-07-06T23:32:35.159280Z","submitted_at":"2026-05-21T09:59:59Z","title":"Direct content-based retrieval from music scores images","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T17:23:39.285332Z"},"links":{"cited_paper":"/paper/2506.23009","citing_paper":"/paper/2605.22255"},"observation_digest":"sha256:c8a32ee02246d92daaf42f2c8a69c3a2be60b495b0c435c3628ed1e25aeb21ef","observation_id":"eb9799a3-f455-45e9-8103-3613ff422f8a","resolution":{"observed_at":"2026-06-30T17:24:56.953564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2506.23009","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23009","snapshot_observed_at":"2026-07-11T02:17:46.305033Z","title":"arXiv preprint arXiv:2506.23009 (2025)","venue":"cs.CV","work_id":"5de567d0-d759-4229-8585-c008c17da27a","year":2025},"citing_paper":{"arxiv_id":"2607.05769","last_updated":"2026-07-07T02:47:13Z","snapshot_observed_at":"2026-08-02T19:58:58.599992Z","submitted_at":"2026-07-07T02:47:13Z","title":"LEGATO 2: Toward Multimodal Sheet Music Recognition and Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T02:12:58.120295Z"},"links":{"cited_paper":"/paper/2506.23009","citing_paper":"/paper/2607.05769"},"observation_digest":"sha256:ff66e12943073ac87b7e2eb74bb19483e9d14b98be51fbbc8bab1fe78013b56d","observation_id":"9c192de3-7c3e-4328-ba8d-4758b25ca7c8","resolution":{"observed_at":"2026-07-11T02:17:46.326748Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2506.23009","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23009","snapshot_observed_at":"2026-07-11T02:17:46.305033Z","title":"arXiv preprint arXiv:2506.23009 (2025)","venue":"cs.CV","work_id":"5de567d0-d759-4229-8585-c008c17da27a","year":2025},"citing_paper":{"arxiv_id":"2607.06015","last_updated":"2026-07-07T08:57:34Z","snapshot_observed_at":"2026-08-06T05:54:16.927557Z","submitted_at":"2026-07-07T08:57:34Z","title":"Music I Care About: Automated Multimodal Benchmarking of LLM Music Perception Skills on (Almost) Any Music","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-08T19:28:58.523932Z"},"links":{"cited_paper":"/paper/2506.23009","citing_paper":"/paper/2607.06015"},"observation_digest":"sha256:3413e64d2c29355b23aab9d90654f63e89a6af2d4c9c2e71eb123d8ac09a45cd","observation_id":"297aee09-8d2f-435a-a6c9-577e60120dae","resolution":{"observed_at":"2026-07-08T19:35:32.938812Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23009/citation-record","integrity":"/paper/2506.23009/integrity","json":"/paper/2506.23009/citation-record.json","paper":"/paper/2506.23009"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:14.194805Z","title":"Acrobat AI Assistant, 2024","venue":null,"work_id":"71667200-43a9-466a-a46a-d00a653b62a0","year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:03.029002Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:4824d265b1142cb582d21597d36318a25b388853c90a83a96bf46c8d14e7582f","observation_id":"f5cc43c0-2f24-47c8-9aa3-c5a96aeb3049","resolution":{"observed_at":"2026-08-06T21:57:14.300132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:03.094544Z","title":"Mmmu: A mas- sive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:03.094544Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:c0fbe377cab123a114f6ebe87c45f5346e6b4311abe7a3bffb90a5e8465e1c6b","observation_id":"940c5739-7079-4665-a70c-b0ff2e4571b7","resolution":{"observed_at":"2026-08-06T21:57:03.094544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:13.992829Z","title":"The basics of reading music","venue":null,"work_id":"fe8e1757-4387-4cac-988e-8210e1b8f74d","year":2015},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:03.170985Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:36ee37b413192a949f62cb39f9e6e8b49872f4652f12dac8a0afb3538e1e2923","observation_id":"d0e24319-069e-4c41-8abe-6d1fc94fce4e","resolution":{"observed_at":"2026-08-06T21:57:14.081606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:13.762498Z","title":"Reading sheet music facilitates sensorimotor mu- desynchronization in musicians","venue":null,"work_id":"cfec6b65-f75a-40d0-a9a0-ab371606cdf5","year":2011},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:03.243569Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:558a22fa11726a50a8b5a2106f0d77b53ecb8df6924b6284ecb9ff77218cf215","observation_id":"ccb2d247-30ec-4ed1-99b3-f219450ede58","resolution":{"observed_at":"2026-08-06T21:57:13.876029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07885","last_updated":"2020-06-22T16:33:59Z","snapshot_observed_at":"2026-07-06T09:28:53.031338Z","submitted_at":"2020-06-14T12:40:17Z","title":"Optical Music Recognition: State of the Art and Major Challenges","version":2},"cited_work":{"arxiv_id":"2006.07885","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.07885","snapshot_observed_at":"2026-08-06T21:57:08.867615Z","title":"Optical Music Recognition: State of the Art and Major Challenges","venue":"cs.CV","work_id":"39c53193-b76f-45fa-aaf0-512225641bc8","year":2020},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:03.307574Z"},"links":{"cited_paper":"/paper/2006.07885","citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:04fdebc36cefa5af12fc2694b3e69e97e09847e627f0dcc701810242c2a4878e","observation_id":"444834fa-8cde-4875-89f3-9e5004298c0b","resolution":{"observed_at":"2026-08-06T21:57:08.894312Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:13.505963Z","title":"Understanding optical music recognition.ACM Computing Surveys (CSUR), 53(4):1–35, 2020","venue":null,"work_id":"a8249f75-cae6-4f51-864d-1601367c1079","year":2020},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:03.381957Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:07e599582b21b61cc22953c6c05a448ffa271ce791a504382edfdee50ef9f0d4","observation_id":"b20ed1a5-0a3d-49c0-87c4-c2fcf0ba7def","resolution":{"observed_at":"2026-08-06T21:57:13.647645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:13.376174Z","title":"Optical music recognition: state-of-the-art and open issues","venue":null,"work_id":"90b80fde-d070-49cd-9d7a-6948baf413b4","year":2012},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:03.441555Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:f40c0ab5123f68e07863e6ba7b8cbe6fb09a4cc8ad76674867830f12e29c1a3c","observation_id":"0ad181d0-58c5-4a4d-a5c6-6942d6910ebe","resolution":{"observed_at":"2026-08-06T21:57:13.437024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:13.186284Z","title":"The challenge of opti- cal music recognition","venue":null,"work_id":"2dd49373-66d6-470e-bb8c-b06e5d4ec3bd","year":2001},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:03.530806Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:f176372597574dd3063591fb8b140a7be04d4c6276b3cc7cfc3d87bbf6bebf26","observation_id":"3cedc974-803e-4108-9133-15be13d1487a","resolution":{"observed_at":"2026-08-06T21:57:13.262422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:13.004193Z","title":"Optical music recognition using pro- jections","venue":null,"work_id":"3864ded2-0d96-4d01-8e88-14c292d7144a","year":1988},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:03.612404Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:66ea3313e5ce6c807d26690072d476afa300316150b10e79a275f0d3afd30463","observation_id":"a453cfc9-af66-446f-9777-0952ee80cedc","resolution":{"observed_at":"2026-08-06T21:57:13.096993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:03.704090Z","title":"Gui agents: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:03.704090Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:040e0a682f75c5eb2b5f411e6ffa9225dccb93c9347f51e56f1c67f29c27c486","observation_id":"60d3e49a-7c68-4e09-9e4d-418e773af6dc","resolution":{"observed_at":"2026-08-06T21:57:03.704090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:12.764356Z","title":"Natural language understand- ing and inference with mllm in visual question answer- ing: A survey","venue":null,"work_id":"16b0477b-4ac0-4a43-b8e1-5a59069b3099","year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:03.796792Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:e233b638e1582cd708f02f26bd2b40f8e95b61ced39bc671bb955c07bbad5c71","observation_id":"ea595109-5701-468c-b1e6-3ea06fd2ff0f","resolution":{"observed_at":"2026-08-06T21:57:12.868582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:12.568695Z","title":"Internvl: Scal- ing up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"d4c2d602-30fe-4e5f-ba74-094b35990184","year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:03.801270Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:f5ace9d7740edfafd6a1867d93b35ede982fc1ec4ac93fbe331a2e8644f7bd0b","observation_id":"5a9369b0-1cf4-4a8c-be2d-cce557455e5b","resolution":{"observed_at":"2026-08-06T21:57:12.665173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10727","last_updated":"2025-04-11T10:01:13Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T14:44:37Z","title":"MLLM-Tool: A Multimodal Large Language Model For Tool Agent Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10727","snapshot_observed_at":"2026-08-06T21:57:03.931871Z","title":"Mllm-tool: A multimodal large language model for tool agent learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:03.931871Z"},"links":{"cited_paper":"/paper/2401.10727","citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:44268f53e55c57b620fe2b096dbdc40f8183799398a50a20a8293b1f08498803","observation_id":"320ef79e-a083-4b28-85bf-72cc75c4383a","resolution":{"observed_at":"2026-08-06T21:57:03.931871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:12.381531Z","title":"Mllm-as-a-judge: Assessing multimodal llm-as-a-judge with vision- language benchmark","venue":null,"work_id":"4ef6bf84-c144-4dad-aed2-ae235d906c77","year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:04.036358Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:ccd369e152fc0a101c4826adffdb3c4f2e704f7ebe2c0c3abdc4e8a2ddd07dca","observation_id":"aa2550e8-38f8-4dd0-8235-07e20b3ea904","resolution":{"observed_at":"2026-08-06T21:57:12.448383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09941","last_updated":"2020-10-15T14:21:53Z","snapshot_observed_at":"2026-07-06T09:57:27.039262Z","submitted_at":"2020-09-21T14:57:18Z","title":"PP-OCR: A Practical Ultra Lightweight OCR System","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09941","snapshot_observed_at":"2026-08-06T21:57:04.136009Z","title":"Pp-ocr: A practi- cal ultra lightweight ocr system","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:04.136009Z"},"links":{"cited_paper":"/paper/2009.09941","citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:4d6c0cc8b248ecd8d7f2dcdd9e3eaed01b26b94dd7ca66e502d6eaf37f6ddc44","observation_id":"c8f6ce39-1320-4708-a18d-31ee29f69ce0","resolution":{"observed_at":"2026-08-06T21:57:04.136009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:12.211777Z","title":"Tex- tocr: Towards large-scale end-to-end reasoning for arbitrary-shaped scene text","venue":null,"work_id":"a1cfc72d-9388-4f79-bbbe-30790a354c66","year":2021},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:04.213329Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:9de246c647523430f5997bbca35e270196e77572826b9d76e28112b4bd679e00","observation_id":"8a612c9c-cc42-4bb0-a4a4-3444743860b3","resolution":{"observed_at":"2026-08-06T21:57:12.295573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:12.017264Z","title":"CVC-MUSCIMA: A ground-truth of hand- written music score images for writer identification and staff removal","venue":null,"work_id":"fdd30b3c-fa91-4831-ae09-e6b37ea2899b","year":2012},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:04.318571Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:0c71cc2fcd27d2a456ce3432d0c580d2adf0865ded5de004eccd0888b960aedc","observation_id":"74b8b8f5-9138-4277-8ef6-e870f4d84a8b","resolution":{"observed_at":"2026-08-06T21:57:12.108776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15002","last_updated":"2024-09-16T11:38:10Z","snapshot_observed_at":"2026-07-06T19:06:33.176704Z","submitted_at":"2024-08-27T12:34:41Z","title":"Knowledge Discovery in Optical Music Recognition: Enhancing Information Retrieval with Instance Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15002","snapshot_observed_at":"2026-08-06T21:57:04.402673Z","title":"Knowledge dis- covery in optical music recognition: Enhancing infor- mation retrieval with instance segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:04.402673Z"},"links":{"cited_paper":"/paper/2408.15002","citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:cd4910326577f57e4119c0f19491fd71d16ddf3e9aa258ada1705ec1e555f00b","observation_id":"bf1091cd-1469-437c-9c43-c6694acdb18c","resolution":{"observed_at":"2026-08-06T21:57:04.402673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:11.845387Z","title":"Deepscores-a dataset for segmentation, detection and classification of tiny objects","venue":null,"work_id":"adaf6223-9c20-4d5e-9420-5b0abc1f794d","year":2018},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:04.520127Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:77d14aad98f4e400a7d89a3d58b0187951bbb48842c7d52508e87516a085003c","observation_id":"25e45c23-f6c6-4e85-8d72-e701d2888fbe","resolution":{"observed_at":"2026-08-06T21:57:11.927933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:11.628351Z","title":"End-to- end neural optical music recognition of monophonic scores","venue":null,"work_id":"4166ef8e-3df8-44b0-ad8b-165ef3fd7ca9","year":2018},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:04.652406Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:b21b1b9c2c973f7aa0c10bc81cce7484dbfd253786bf35fe01ab26aba661c033","observation_id":"c8cf186a-0bc7-471d-a910-eb80ebd255d3","resolution":{"observed_at":"2026-08-06T21:57:11.748658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.07786","last_updated":"2021-07-16T09:24:58Z","snapshot_observed_at":"2026-07-06T11:29:44.222544Z","submitted_at":"2021-07-16T09:24:58Z","title":"DoReMi: First glance at a universal OMR dataset","version":1},"cited_work":{"arxiv_id":"2107.07786","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.07786","snapshot_observed_at":"2026-08-06T21:57:08.487997Z","title":"DoReMi: First glance at a universal OMR dataset","venue":"cs.IR","work_id":"087e0949-ff6a-4bea-9082-5bd45f70e61a","year":2021},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:04.841644Z"},"links":{"cited_paper":"/paper/2107.07786","citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:16b89aa575b9a4e52d84715c69b753252e81419827b91b2b39cd80e190b5aa28","observation_id":"dde69ff4-d1c0-4e62-bb9f-2b8729f92b64","resolution":{"observed_at":"2026-08-06T21:57:08.584722Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:11.389920Z","title":"A uni- fied representation framework for the evaluation of optical music recognition systems","venue":null,"work_id":"e2521254-bdc5-4f8f-9c60-db5bf473d1a5","year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:04.953302Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:57d9c4745dd7dd8b848aa9f1460c9ab73f7ec1e60da76ce51ce0cd6b9533718f","observation_id":"58138aea-ac0a-4327-bed4-ac749362497e","resolution":{"observed_at":"2026-08-06T21:57:11.509970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:11.149644Z","title":"Practical end-to-end optical music recognition for pianoform music","venue":null,"work_id":"1db4d3ef-b418-458d-b5dd-f63b5c82c1e7","year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:05.038931Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:1d81ff85518eea07494aa3f0f270ed0f9ed065f3f3536f91b7bf2d3bffdffec8","observation_id":"b9ccfb9a-77e1-4966-b55f-2c25af092de3","resolution":{"observed_at":"2026-08-06T21:57:11.238511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:10.929326Z","title":"Breezewhite/oemer: v0.1.7, October 2023","venue":null,"work_id":"750f5cf0-e6ad-4d7e-8f08-b42c9d646ad4","year":2023},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:05.155593Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:a5b7e69c2ad18fe00567fdda5655f17c02390a182b08f8f4c2eb6ec7b1efc83b","observation_id":"0099d064-ce21-4194-ad6f-d8db0da76193","resolution":{"observed_at":"2026-08-06T21:57:11.038775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:10.742712Z","title":"Optical music recognition in manuscripts from the ricordi archive","venue":null,"work_id":"c331a6f7-22a8-452d-a3f7-6ca3612e9ad3","year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:05.249120Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:ef92a8ecfc63d458e850a0661fd38fabaa217dc750a582b6b28b10b6bf7fea1b","observation_id":"acb50a2c-7375-4bd9-9de1-923c41045971","resolution":{"observed_at":"2026-08-06T21:57:10.853442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:10.508064Z","title":"Optical music recognition with convolutional sequence-to-sequence models","venue":null,"work_id":"b1985944-aba6-48f5-8ca3-2227ae523d40","year":2017},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:05.356627Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:6d838bd3a801d6a5658ccedfab286abc680c93a4b19c5c99baaad3c01aec0074","observation_id":"5d5ad310-4581-4137-910f-76be0515c404","resolution":{"observed_at":"2026-08-06T21:57:10.606216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:10.334126Z","title":"Tromr:transformer-based polyphonic optical music recognition","venue":null,"work_id":"af9c4d9a-c173-424e-a1fe-6bd1b53b5c58","year":2023},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:05.523218Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:3c2cde0ab78ad740886ebd0b2a22bcff93c2d3a0405cc9e6c5a184511dea836a","observation_id":"3f4661b1-32d6-469b-a1fd-69aa8172e667","resolution":{"observed_at":"2026-08-06T21:57:10.417118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:10.170757Z","title":"Sheet music transformer: End-to-end optical music recognition beyond monophonic transcription, 2024","venue":null,"work_id":"78b15452-cd26-4cb3-bfe2-1466a4389b43","year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:05.682538Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:9e317f3a023a3bae27f6e04fa1e29239a49d3f9242cb2eda8d1c746a76d8f37c","observation_id":"1f102df9-df64-4f5e-98b4-c40740b6ed78","resolution":{"observed_at":"2026-08-06T21:57:10.244977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12105","last_updated":"2025-06-27T08:39:52Z","snapshot_observed_at":"2026-08-06T18:01:54.515067Z","submitted_at":"2024-05-20T15:21:48Z","title":"End-to-End Full-Page Optical Music Recognition for Pianoform Sheet Music","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12105","snapshot_observed_at":"2026-08-06T21:57:05.787561Z","title":"Sheet music trans- former++: End-to-end full-page optical music recog- nition for pianoform sheet music","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:05.787561Z"},"links":{"cited_paper":"/paper/2405.12105","citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:8c362efa9dfc291be775039d49a59d8c5d4d70609b8c5412946cf6d493583073","observation_id":"e6bbf8a2-3f79-4115-9454-0853be89d164","resolution":{"observed_at":"2026-08-06T21:57:05.787561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16153","last_updated":"2024-02-25T17:19:41Z","snapshot_observed_at":"2026-07-06T17:35:10.248760Z","submitted_at":"2024-02-25T17:19:41Z","title":"ChatMusician: Understanding and Generating Music Intrinsically with LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16153","snapshot_observed_at":"2026-08-06T21:57:05.952693Z","title":"Chatmusician: Under- standing and generating music intrinsically with llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:05.952693Z"},"links":{"cited_paper":"/paper/2402.16153","citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:de7ce74d9cff7296612e3ed7e37cd4f6b57560f52190717773be4c1b601fbd0f","observation_id":"b25e32c3-7c57-4510-a441-9fc3db13dafe","resolution":{"observed_at":"2026-08-06T21:57:05.952693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11954","last_updated":"2023-10-25T13:34:13Z","snapshot_observed_at":"2026-07-06T16:34:58.693542Z","submitted_at":"2023-10-18T13:31:10Z","title":"MusicAgent: An AI Agent for Music Understanding and Generation with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11954","snapshot_observed_at":"2026-08-06T21:57:06.012244Z","title":"Mu- sicagent: An ai agent for music understanding and generation with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:06.012244Z"},"links":{"cited_paper":"/paper/2310.11954","citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:c16f335a2a2e391b099b6516ecc23df3598e184d1b8f8e7df820e1b7577421dc","observation_id":"14ff5879-dfb9-45d9-8db0-5ea7db605ac8","resolution":{"observed_at":"2026-08-06T21:57:06.012244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-08-06T21:57:06.098344Z","title":"Paligemma 2: A family of versatile vlms for transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:06.098344Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:e7babb6173ce083e238064c754404da7487b2aee549125f2919238f21e8b8c03","observation_id":"d66af441-d8e1-4675-89bf-06959580841b","resolution":{"observed_at":"2026-08-06T21:57:06.098344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T21:57:06.179397Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:06.179397Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:a75ada3de47a62c8b6a2d401c2da2f0968b903e81dff7103ff80bc7e19e4a6ae","observation_id":"df89a664-d190-445b-81c5-1049c1ca726c","resolution":{"observed_at":"2026-08-06T21:57:06.179397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T21:57:06.325770Z","title":"Deepseek- v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:06.325770Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:6b390303feb179748c706940a87caea7f5949271d291ad319dc5eda29ff4e78a","observation_id":"a7908338-7a3c-4c00-b9bc-dd65d225b05f","resolution":{"observed_at":"2026-08-06T21:57:06.325770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:10.024874Z","title":"Musical scales and the generalized circle of fifths","venue":null,"work_id":"2bf80f39-18bf-4451-9607-642f28435097","year":1986},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:06.425346Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:9eb7b5ad250d95f63764ecfd745a035939c4b83efd7f886877d79909b7778a3a","observation_id":"369ae79e-0a88-43c2-9875-83f009103400","resolution":{"observed_at":"2026-08-06T21:57:10.090242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:09.848991Z","title":"MusiXTEX","venue":null,"work_id":"dcbf65c4-f752-4114-a504-93faa08f13db","year":1993},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:06.520548Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:94d0d414cdf4416a8f12132b3f571c8cfa0b65154b0e769e38c5a884d0ad0607","observation_id":"0c53bfd0-4e4c-4c08-995b-4f015c15d54b","resolution":{"observed_at":"2026-08-06T21:57:09.932628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:09.686638Z","title":"Harmonic experience: Tonal harmony from its natural origins to its modern expression","venue":null,"work_id":"82931eb2-d43d-4590-ae96-baa103cf70fc","year":1997},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:06.597284Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:ac7ca6f4a768752c1796a2a839fb6c7ace123d8e5ac4e8f3c14c9cb2d829045c","observation_id":"606c7818-3166-49b8-b16d-772e748a5a56","resolution":{"observed_at":"2026-08-06T21:57:09.751371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T21:57:06.742697Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:06.742697Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:f7a1ea2dc58db3ad2f7c26898346f495affdebcc27a117976a817c2a14f6297f","observation_id":"4676f4b5-d193-46bb-9439-90bd09a41d67","resolution":{"observed_at":"2026-08-06T21:57:06.742697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:09.517446Z","title":"Trins: Towards multimodal language models that can read","venue":null,"work_id":"401b6195-d4ec-433d-8fb2-08b1ce8bc8c3","year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:06.908892Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:6ee0cca0f79d066875fddd31f904150c6d45829843d8fd3be256bb4904a94d75","observation_id":"caa80afb-5dd9-4a46-8e4a-9b2ebfd4c561","resolution":{"observed_at":"2026-08-06T21:57:09.577261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19185","last_updated":"2024-07-27T05:53:37Z","snapshot_observed_at":"2026-07-06T18:52:43.209999Z","submitted_at":"2024-07-27T05:53:37Z","title":"LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19185","snapshot_observed_at":"2026-08-06T21:57:07.053168Z","title":"Llava-read: Enhanc- ing reading ability of multimodal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:07.053168Z"},"links":{"cited_paper":"/paper/2407.19185","citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:59633e3e422e3f277166b1e2b5fed338d760f750bfb283fd5702c5994440ebdc","observation_id":"97993c1c-9a6d-4154-9aff-ae7d5edad3c3","resolution":{"observed_at":"2026-08-06T21:57:07.053168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T21:57:07.157500Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:07.157500Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:ca1e87fcd8ea60b900e64913dd0c1fc1e90c9f5dc87ae294b04e3e7cc29b4889","observation_id":"4e90a859-a7cb-491c-bffa-8b713cd65997","resolution":{"observed_at":"2026-08-06T21:57:07.157500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:09.335395Z","title":"Music information processing using the humdrum toolkit: Concepts, examples, and lessons","venue":null,"work_id":"d6e027d5-18cd-48aa-9879-45acd02a01f0","year":2002},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:07.301593Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:86fcbfd5efd5a83478705b1bf52c88068bb2ea0dc142048fafa1f573f801ae52","observation_id":"c63f5167-f5c7-4aaa-978c-3c7e8c33e36c","resolution":{"observed_at":"2026-08-06T21:57:09.407200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14594","last_updated":"2024-08-26T19:26:50Z","snapshot_observed_at":"2026-08-06T23:46:19.155602Z","submitted_at":"2024-08-26T19:26:50Z","title":"MMR: Evaluating Reading Ability of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14594","snapshot_observed_at":"2026-08-06T21:57:07.432546Z","title":"MMR: Evaluating reading ability of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:07.432546Z"},"links":{"cited_paper":"/paper/2408.14594","citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:c355896f563b11832537c5cdc9bb027fec72eddbb381b9d8b7304a9b03ae19d9","observation_id":"1bdd0ad0-d2cc-4fb0-9f03-9aee76356e82","resolution":{"observed_at":"2026-08-06T21:57:07.432546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T21:57:07.577643Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:07.577643Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:a0ab343be34f8742749ac59607a7b1116e7ef7a10deb7a8ee1d86c3d57ddfc7b","observation_id":"7e0f840c-504c-4ca6-b0f3-13ac051aa37e","resolution":{"observed_at":"2026-08-06T21:57:07.577643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:07.694170Z","title":"Retrieval-augmented generation for knowledge- intensive nlp tasks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:07.694170Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:2c66bd02a9d2d247fa7e043cb947bb73e1a6b4895500a42999fa34ab6f7e6a30","observation_id":"8b1be671-60c9-4af2-9463-b46312da531f","resolution":{"observed_at":"2026-08-06T21:57:07.694170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:09.171703Z","title":"Layoutgpt: Compositional visual planning and generation with large language models","venue":null,"work_id":"5c8a6d65-94d9-44d4-b7a3-7283ae5c2841","year":2023},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:07.851431Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:11c42c173925e414cab15a6c76ba0e8da7afe1ec4b4a26dbdce51a03c4eb18aa","observation_id":"ffefab5a-ed6e-485d-8181-41742bf42140","resolution":{"observed_at":"2026-08-06T21:57:09.227377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12844","last_updated":"2024-10-09T19:51:38Z","snapshot_observed_at":"2026-07-06T19:34:46.714277Z","submitted_at":"2024-10-09T19:51:38Z","title":"TextLap: Customizing Language Models for Text-to-Layout Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12844","snapshot_observed_at":"2026-08-06T21:57:07.934980Z","title":"Text- lap: Customizing language models for text-to-layout planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:07.934980Z"},"links":{"cited_paper":"/paper/2410.12844","citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:77dd6d2f037052da332c4cfda173b054821054928b04998305b6344ea8e3c14c","observation_id":"a1c2e789-ffe0-480d-9692-972da2b8b98d","resolution":{"observed_at":"2026-08-06T21:57:07.934980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12895","last_updated":"2024-03-19T16:48:40Z","snapshot_observed_at":"2026-08-07T02:52:27.054968Z","submitted_at":"2024-03-19T16:48:40Z","title":"mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12895","snapshot_observed_at":"2026-08-06T21:57:08.059391Z","title":"mplug-docowl 1.5: Unified structure learning for ocr-free document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:08.059391Z"},"links":{"cited_paper":"/paper/2403.12895","citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:384429cdda734ccc44bcdf0482a2a8ee6a525c04cf4effe4041912754a6b5831","observation_id":"29ef0fcd-2bc9-4672-916c-740cfec8368e","resolution":{"observed_at":"2026-08-06T21:57:08.059391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:57:09.007605Z","title":"Information not found","venue":null,"work_id":"543913b7-6330-4560-91c2-c9cadf317cd3","year":2024},"citing_paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:57:08.122917Z"},"links":{"citing_paper":"/paper/2506.23009"},"observation_digest":"sha256:67520702d03172daaa8f7128d38c5a7b82d5ac33b5734aeb3da5277343f97369","observation_id":"b87514ec-34f8-4519-91d0-5228c6da73f1","resolution":{"observed_at":"2026-08-06T21:57:09.066912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23009","last_updated":"2025-08-14T01:29:48Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:50:15.171969Z","submitted_at":"2025-06-28T20:46:47Z","title":"MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":2,"verified_fuzzy":28},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 5 inbound Pith citation observations for arXiv:2506.23009."}