{"as_of":"2026-08-16T19:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4f9f5792d5786aea7f297166793895678e5e43da163209bc95665af41c7e3969","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:54:48.472549Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:54:48.378769Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T14:54:48.518103Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"cited_work":{"arxiv_id":"2608.03419","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.03419","snapshot_observed_at":"2026-08-15T14:54:48.518103Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","venue":"cs.SD","work_id":"4a8b8744-a866-45a9-b9ef-7ae7aa7aeb42","year":2026},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.378769Z"},"links":{"cited_paper":"/paper/2608.03419","citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:35d91d769cea6982ea589f347f47181ca44d7953ab4e9d584f41331996848c70","observation_id":"4c046ed3-720f-459e-a73c-efdafa710759","resolution":{"observed_at":"2026-08-15T14:54:48.521401Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2608.03419/citation-record","integrity":"/paper/2608.03419/integrity","json":"/paper/2608.03419/citation-record.json","paper":"/paper/2608.03419"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.815053Z","title":"Multi-Task Multi- Frame Visual Piano Transcription","venue":null,"work_id":"c348df7f-7a01-4c45-9116-da2b274df101","year":2026},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.375237Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:376d09630974ff589304a48ae8f7cf13852cf315476cae8a2818c1c108dce00e","observation_id":"88a01220-7890-4e46-874d-19925f66bf8c","resolution":{"observed_at":"2026-08-15T14:54:48.818360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"cited_work":{"arxiv_id":"2608.03419","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.03419","snapshot_observed_at":"2026-08-15T14:54:48.518103Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","venue":"cs.SD","work_id":"4a8b8744-a866-45a9-b9ef-7ae7aa7aeb42","year":2026},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.378769Z"},"links":{"cited_paper":"/paper/2608.03419","citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:35d91d769cea6982ea589f347f47181ca44d7953ab4e9d584f41331996848c70","observation_id":"4c046ed3-720f-459e-a73c-efdafa710759","resolution":{"observed_at":"2026-08-15T14:54:48.521401Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.805663Z","title":"frame” exclusively for a video frame (40 ms; all models in this paper operate at 25 fps). This should not be confused with the “frame","venue":null,"work_id":"b7342ad5-8c90-4778-b339-c1ee4b0dc610","year":null},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.382083Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:bc385e0f4441cc7c401546512a2b7bd685cc741748b71938ed0006d33e7b42c5","observation_id":"da76088f-38e4-4f61-a79d-a4f62127e272","resolution":{"observed_at":"2026-08-15T14:54:48.808817Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.795636Z","title":null,"venue":null,"work_id":"20fa0733-5673-452b-a749-6b76a976542f","year":null},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.385398Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:04dac3a9b6a5d0893ec374b9cd2fe8ebe37fe644f5d10dd802234f47ba29658d","observation_id":"4e41bad2-491d-485a-a046-97acfd69f4dd","resolution":{"observed_at":"2026-08-15T14:54:48.798937Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.785549Z","title":"V2N is our default full-configuration model (onset, offset, key hold, velocity heads)","venue":null,"work_id":"4eb51684-5c5c-4acf-b040-44974ca4d102","year":null},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.388732Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:ef1965f687c80d2f7b8cdbc170ed61c6689fb387148c8d09ebc045dd90afcd24","observation_id":"c9f153b7-c513-430a-bce3-d97f07b4c48c","resolution":{"observed_at":"2026-08-15T14:54:48.789330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.775476Z","title":null,"venue":null,"work_id":"7aaac1f2-e282-487d-bb20-71c4d4264596","year":2024},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.391781Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:a5cac94a8b8b3a5b3d60853ab5dbdaf9d52ce58627fb440e482fc61058215d6b","observation_id":"06ed44b6-e177-486c-9ff9-90a51d173940","resolution":{"observed_at":"2026-08-15T14:54:48.779036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.764452Z","title":"Since this affects all models equally, we report results on the original test split","venue":null,"work_id":"ec22fb21-795e-46ff-a0d3-573b374022e9","year":null},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.395292Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:95cf5d9dd5610343c2287eb5b724e7fe68b54f40b4c89532d24f38a5679618f2","observation_id":"9a8ae749-6821-4645-9e37-9e053f1eb4df","resolution":{"observed_at":"2026-08-15T14:54:48.768606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.753612Z","title":null,"venue":null,"work_id":"1835fa09-93ba-49cf-9883-e6e0fab11521","year":null},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.398773Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:8e70fbfd46fcc1ee9c28f438ea0d0929f6e04dbbf00baacd51f86c31276c4750","observation_id":"4bafee98-0d77-4fa2-b1e1-35ddff44ce30","resolution":{"observed_at":"2026-08-15T14:54:48.757291Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.742888Z","title":null,"venue":null,"work_id":"1fe55301-9c01-4c32-b3d1-3e31ac6ce3df","year":2023},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.401836Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:c834d4b7b056ee5d3ad2acfbc8571725c476f949b8b4a8a89f1ab44f8a05ffae","observation_id":"8c1010d3-721d-42fe-8b4b-776dc4d1bd48","resolution":{"observed_at":"2026-08-15T14:54:48.746566Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.732732Z","title":"Onsets and frames: Dual-objective piano transcription,","venue":null,"work_id":"0fa69c0e-6c23-4d6f-a1cc-5097b8bc78be","year":2018},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.405021Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:7de960bbe27eafe01a7face13bcaf0447203f23aff051456c560c2e1588723fb","observation_id":"d00a1cd2-7247-44e4-a911-20f6a999581a","resolution":{"observed_at":"2026-08-15T14:54:48.736364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.722131Z","title":"Sequence-to-sequence piano transcription with transformers,","venue":null,"work_id":"3c0a0621-6d4d-4a44-b06f-f15e144b0312","year":2021},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.408008Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:b5d85e753970b1a282446ffc834f1731a473615191bd0b5a35c501c80c130c10","observation_id":"708e5250-5ffa-4367-8bfc-d33e63224b73","resolution":{"observed_at":"2026-08-15T14:54:48.725868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.711083Z","title":"High- resolution piano transcription with pedals by regressing onset and offset times,","venue":null,"work_id":"14532be3-f3d3-4ef5-bdef-4dcc628d303d","year":2021},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.411117Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:c72fe376be79b1997c15dce9ef0aa50ef4abc9eaa0cd89603e2b4ffe2b09f0b4","observation_id":"1c0efb06-0de7-4f59-bbca-b4702d585564","resolution":{"observed_at":"2026-08-15T14:54:48.714693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.701088Z","title":"Skipping the frame-level: Event-based piano transcription with neu- ral semi-CRFs,","venue":null,"work_id":"8ff351ef-3a15-492d-b090-a7301a56c691","year":2021},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.414378Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:30c81da731f64f78d530dc262a4a215d51bc4faa82b9bf4201586c8beae3e030","observation_id":"0c8b94c4-1af2-4aea-ba74-1a63ef3fc229","resolution":{"observed_at":"2026-08-15T14:54:48.704387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.691289Z","title":"Scoring time intervals using non- hierarchical transformer for automatic piano transcrip- tion,","venue":null,"work_id":"64576d89-c7b0-446b-be83-9d7a29bcbd36","year":2024},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.417465Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:f5eef79b868fb5f1ba1e2db6ed52f5e69406571160e86acab704747fabc56f1f","observation_id":"8af0541b-cd7f-4960-aa8f-e4f026835241","resolution":{"observed_at":"2026-08-15T14:54:48.694646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.681525Z","title":"Sight to sound: An end-to-end approach for visual piano transcription,","venue":null,"work_id":"55547e9b-73a2-4158-bdd4-0b1622039b7d","year":2020},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.420457Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:51b03f2503dabd4e0ee5888145d24ff09e950ae5e2e3c402d068c12373990ad6","observation_id":"6f78df95-9d2c-4391-999d-0d9bcc22e704","resolution":{"observed_at":"2026-08-15T14:54:48.684811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.671302Z","title":"Audeo: Audio gen- eration for a silent performance video,","venue":null,"work_id":"36e51362-e440-4bbf-a48c-48db8c5fd6fc","year":2020},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.423557Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:d6173dbf51d87dd5a5cdc9aaa22ae2b9918af8e0bb0de15c63f3c33e94ec918c","observation_id":"e16080d8-a7ec-4275-b023-bce0a15f7271","resolution":{"observed_at":"2026-08-15T14:54:48.674994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.659839Z","title":"Pay attention to the keys: Visual piano transcription using transformers,","venue":null,"work_id":"162e1dcd-4e8a-4002-96a3-4e139aad4cfa","year":2025},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.426442Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:63d284c5f179b2fc5d98394507a7d000bd8906c1c88846343126a10ee06127a6","observation_id":"ce334f7c-3f91-4b1e-a24d-1446623f6577","resolution":{"observed_at":"2026-08-15T14:54:48.663742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.648495Z","title":"A two-stage audio-visual fusion piano transcription model based on the attention mechanism,","venue":null,"work_id":"1bd31b53-a264-4003-b9f0-c403b96fa12a","year":2024},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.429381Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:e3b4e69864b004d308bb84a987ec96aa310098d34edafc592252e2532eebf476","observation_id":"3d87f2c9-dc47-47d4-af09-99ef23e738a5","resolution":{"observed_at":"2026-08-15T14:54:48.652566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.637499Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":"2f1030a2-c893-4540-9124-6313d52634c9","year":2020},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.433366Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:36305617ddaa0352f0652d3cef370807b70cfd6d99f3edd3c4e9587d6d797d7a","observation_id":"fafbc4a2-91fc-438c-83aa-0581c2f7b366","resolution":{"observed_at":"2026-08-15T14:54:48.641162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.626501Z","title":"Auto- matic music transcription: An overview,","venue":null,"work_id":"0faa202e-0e4a-4bc8-ad99-2879044b95eb","year":2019},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.436741Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:8bbd4a1754d5d38156b1d474f8f9871dab157d163ab7d6253027c33bfc15d37f","observation_id":"ff480373-b354-4030-af76-f6244ad0bf7c","resolution":{"observed_at":"2026-08-15T14:54:48.630369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.615912Z","title":"Enabling factorized piano music modeling and generation with the MAESTRO dataset,","venue":null,"work_id":"6b949c54-4f3f-4e90-ba75-bf6e6db5d49e","year":2019},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.440002Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:46f65390eb422b2a4608ffa82dc8de6f997aea49dfebddf24d204f8fb07d1388","observation_id":"0ec5a738-fc35-4c53-ac2a-3272f2decdee","resolution":{"observed_at":"2026-08-15T14:54:48.619612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.604989Z","title":"Detection of piano keys pressed in video,","venue":null,"work_id":"16c8e5cb-c82a-48d6-a52a-a08f1b0b47e8","year":2014},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.443057Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:28505423c64d21334308e2c8db4ef4562fa0f2e38cc9f861eff52ac4dc0cd002","observation_id":"fda1f83f-72cb-4d25-acfa-a6ca69a1a11f","resolution":{"observed_at":"2026-08-15T14:54:48.608690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.594996Z","title":"claVision: Visual automatic piano music transcription,","venue":null,"work_id":"82ee8ef2-5436-45ce-bcdf-536489e73117","year":2015},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.446122Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:0c606a994b5254870c4377bfccc5a548aa941525304266176772b0e70bf4e193","observation_id":"86cc2568-afb4-481d-b0a0-7d6757af1f14","resolution":{"observed_at":"2026-08-15T14:54:48.598472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.449152Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.449152Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:7e475045135046b96ace429f70fa029f64b2dc551b2c93471dc19d9b3c12cd20","observation_id":"17451f69-596d-41fa-b6eb-0d38bee42783","resolution":{"observed_at":"2026-08-15T14:54:48.449152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.578342Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"7c0bdf81-0e2d-4b16-b78a-3a38a95c726f","year":2021},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.452241Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:a23e23628c79d1edd87db1698fe7f9498587fb66992654b2029bda7b71ccfb2e","observation_id":"a32cce23-96a6-47b0-9db1-106ab0dff8f9","resolution":{"observed_at":"2026-08-15T14:54:48.581851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.568043Z","title":"The rach3 dataset: Towards data-driven analysis of piano performance re- hearsal,","venue":null,"work_id":"790978fb-deea-4a8f-a818-f0170aa0706d","year":2024},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.455343Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:ecf1a37c49f57391b1022c0c2b13699fec2852f530fd3786dd47043b17d5974d","observation_id":"86f6c717-b545-4f2d-bb88-277b52f10e9a","resolution":{"observed_at":"2026-08-15T14:54:48.571445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.12539","last_updated":"2019-10-28T10:36:30Z","snapshot_observed_at":"2026-07-06T08:32:43.131328Z","submitted_at":"2019-10-28T10:36:30Z","title":"Virtual Piano using Computer Vision","version":1},"cited_work":{"arxiv_id":"1910.12539","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.12539","snapshot_observed_at":"2026-08-15T14:54:48.501273Z","title":"Virtual Piano using Computer Vision","venue":"cs.CV","work_id":"18da7895-31fc-4bc9-bc5a-de91b2d0deec","year":2019},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.458669Z"},"links":{"cited_paper":"/paper/1910.12539","citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:c5bf91c09341162e2235a3e291ccddefcb18264cc94982990750ac476f7ef9c5","observation_id":"54737c13-150f-482e-b7ba-d03b4eb74b36","resolution":{"observed_at":"2026-08-15T14:54:48.507545Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.557955Z","title":"PianoV AM: A multimodal piano performance dataset,","venue":null,"work_id":"8802e08a-60a2-45c3-8a4e-958efb1f4540","year":2025},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.462277Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:e4c8c9697de3f0aa41636bda142dc1047111490ffb5af97cf4a073fa04ca3b9d","observation_id":"8ed31000-8a3d-4b5d-9bf8-4b799463d139","resolution":{"observed_at":"2026-08-15T14:54:48.561381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.466147Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.466147Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:081b4b92e487a793aadadca3b37d6f1fca584edb14067839b33599d5fa9bcb3a","observation_id":"63738067-0220-4186-ab6e-6d4e0f038e73","resolution":{"observed_at":"2026-08-15T14:54:48.466147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.539517Z","title":"mir_eval: A trans- parent implementation of common MIR metrics,","venue":null,"work_id":"4960ad6f-c644-4f55-8ccf-b5ea74c4a9dd","year":2014},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.469291Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:4e012f4a2bbac12f9976cbbdfcbbafe0dbe321d115f180fb9109ebbbc9c1242c","observation_id":"bc18c490-4816-4185-8d5e-5fbcb618a401","resolution":{"observed_at":"2026-08-15T14:54:48.543031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:48.528463Z","title":"Quantifying the corpus bias problem in automatic music transcription systems,","venue":null,"work_id":"d5b30aa0-0be2-44e7-b65b-256ddde8dce5","year":2024},"citing_paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:48.472549Z"},"links":{"citing_paper":"/paper/2608.03419"},"observation_digest":"sha256:156a410d78c225cf00ceb05040fa0208a6e6ca20d590e4dc75e969431a25c361","observation_id":"db9c8dad-ffd1-45b8-ad84-d5622528bcc8","resolution":{"observed_at":"2026-08-15T14:54:48.531845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.03419","last_updated":"2026-08-04T10:11:45Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T11:48:56.421706Z","submitted_at":"2026-08-04T10:11:45Z","title":"Multi-Task Multi-Frame Visual Piano Transcription"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2608.03419."}