{"as_of":"2026-08-22T23:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ef700710499ad9122b1e5651ef23eb25320d8d6238ba20c510fd471807994855","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:12:12.974374Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.13607/citation-record","integrity":"/paper/2411.13607/integrity","json":"/paper/2411.13607/citation-record.json","paper":"/paper/2411.13607"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:14.097712Z","title":"A Lip Sync Expert Is All You Need for Speech to Lip Genera- tion In the Wild — Proceedings of the 28th ACM International Conference on Multimedia","venue":null,"work_id":"6ccb4254-809a-450b-bb28-d3a3c919eb33","year":null},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.638615Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:b9dd516b2d4c6754c71b42d384b272206a433ee682de8a3c862f2561838321dd","observation_id":"478309d7-4416-40da-a6ff-667b7b2cbde3","resolution":{"observed_at":"2026-08-12T17:12:14.103180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:14.081478Z","title":"Synthesizing Obama: Learning lip sync from audio: ACM Transactions on Graphics: V ol 36, No 4","venue":null,"work_id":"cdd79a3f-447d-46f7-a433-7ac0ece42100","year":null},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.643661Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:0b35161e48defde3358ee5cb32e146eff62cce447278e13488919afc710ccabe","observation_id":"8639c750-9bae-4ed5-95f1-b64bd231d049","resolution":{"observed_at":"2026-08-12T17:12:14.085841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:14.069792Z","title":"Self- supervised Learning of Audio-Visual Objects from Video,","venue":null,"work_id":"c27495d8-c974-4688-ab31-6a367dc46122","year":2020},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.648089Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:deab2291d5a571fbf974fb443c5eb12dbb069cac7e2ccc73373a706ea6aa08e7","observation_id":"93a32f03-7a51-458d-888d-7bf98c7d9e72","resolution":{"observed_at":"2026-08-12T17:12:14.074072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:14.056195Z","title":"Groovenet: Real- time music-driven dance movement generation using artificial neural networks,","venue":null,"work_id":"131e81bf-755d-49a6-a833-d180ec9c316c","year":2017},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.652707Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:62edf633e99a5f7e78c7549797833a98912c3974ab0382efd50a8dc2ed8e3628","observation_id":"9ef0d32c-dd98-4c77-b8a4-e21d7c0c419c","resolution":{"observed_at":"2026-08-12T17:12:14.061925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:14.041986Z","title":"Look, Listen and Learn,","venue":null,"work_id":"e77c720f-d8f9-457a-814a-bb7edfbbea46","year":2017},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.657192Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:a6362f768054465f06a59f979a992bf3bca0c0031b4e240569ef61e98a571fda","observation_id":"c7084a83-2713-4897-8341-2949131e0900","resolution":{"observed_at":"2026-08-12T17:12:14.047224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:14.025619Z","title":"Real-Time Sound and Motion Feedback for Violin Bow Technique Learning: A Controlled, Randomized Trial,","venue":null,"work_id":"28911aa4-fb05-44e7-8da7-18cd65ef1f87","year":2021},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.663051Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:3bf64e9f653c4cfb6b36a8aa95efba4049a9d0a257a9792331fc4a3b84c7990e","observation_id":"eea8ff30-f686-482e-8c69-d610ec65ee9c","resolution":{"observed_at":"2026-08-12T17:12:14.031977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:14.010825Z","title":"Exploiting Spatial-Temporal Relationships for 3D Pose Estimation via Graph Convolutional Networks,","venue":null,"work_id":"36f71cbf-a206-40a1-b221-be4cc62da20c","year":2019},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.667877Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:75619d541e350f6aca6cc0fc59a0b8ebd9b57c19c8202167b8b9f4083802a6c0","observation_id":"b2d955fa-f366-45c6-bc65-87b0620a25c7","resolution":{"observed_at":"2026-08-12T17:12:14.016235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.997129Z","title":"SoundSpaces: Audio-Visual Navigation in 3D Environments,","venue":null,"work_id":"236a84a3-6eda-4607-ad78-71099e67a39c","year":2020},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.671841Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:ef7ff0a325f60fafdd8e6529b311b38fc0bb94ff195f4e82bc51432d4dcc2c6b","observation_id":"2f45cca5-b186-4049-8184-f37c703b97f6","resolution":{"observed_at":"2026-08-12T17:12:14.001792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.982798Z","title":"MM-ViT: Multi-Modal Video Trans- former for Compressed Video Action Recognition,","venue":null,"work_id":"bc9f86d0-f08b-45d9-a74e-b6ce83ff5541","year":2022},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.676990Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:2f20dadb424d52e109071320613f18760ead1eb8506f7576fc2076ceeae401b4","observation_id":"c05a13e0-f554-428f-ad46-940d5d9b90af","resolution":{"observed_at":"2026-08-12T17:12:13.987282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01811","last_updated":"2024-07-01T21:20:52Z","snapshot_observed_at":"2026-08-16T13:37:56.675367Z","submitted_at":"2024-07-01T21:20:52Z","title":"Active Human Pose Estimation via an Autonomous UAV Agent","version":1},"cited_work":{"arxiv_id":"2407.01811","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.01811","snapshot_observed_at":"2026-08-12T17:12:13.020235Z","title":"Active Human Pose Estimation via an Autonomous UAV Agent","venue":"cs.RO","work_id":"5fe71b70-7f2d-4659-b935-5b8d535fb98b","year":2024},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.681305Z"},"links":{"cited_paper":"/paper/2407.01811","citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:4e93b9a8c89d2bf13754598fbac85c6a3f7224c170a56f13c9e1b54500e3e9c9","observation_id":"d3f5dbcc-8c99-498c-a873-ffa03e46add5","resolution":{"observed_at":"2026-08-12T17:12:13.026297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.967668Z","title":"Anatomy-Aware 3D Human Pose Estimation With Bone- Based Pose Decomposition,","venue":null,"work_id":"553a2d2b-d7b4-4c05-b6ed-f8973d154b29","year":2022},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.685823Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:8fc66acaef956fd2b44ccdbabc042aacd3da31866eefcd913d0c450d10391e05","observation_id":"70bf878e-1554-471c-8457-2b76e48331ee","resolution":{"observed_at":"2026-08-12T17:12:13.973031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.951461Z","title":"DiffuPose: Monocular 3D Human Pose Estimation via Denoising Diffusion Probabilistic Model,","venue":null,"work_id":"ff0c30b1-64b9-40a9-9a48-19bb0eeb2394","year":2022},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.690313Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:a0ffc884a93f1d318ce01507f7f07db6bd373560d2319eebcdc22e2cbef7bc80","observation_id":"ca48b4a7-fd30-45c4-b689-c3ab69a8a47c","resolution":{"observed_at":"2026-08-12T17:12:13.958451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.936030Z","title":"Optimizing Network Structure for 3D Human Pose Estimation,","venue":null,"work_id":"35e7e901-7f75-463e-a9be-ea06b5b4b3da","year":2019},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.694131Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:cbce2f1f6b7d5096f662fad4c9e3c9a4773c3e835f70baa81bb05d41a84ca9d2","observation_id":"9e3c9f63-d089-44f7-8d88-1a9364cf73c1","resolution":{"observed_at":"2026-08-12T17:12:13.940752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.918972Z","title":"Bowing Gestures Classifica- tion in Violin Performance: A Machine Learning Approach,","venue":null,"work_id":"32946e8f-da4c-466d-828f-dda4b4dcee88","year":2019},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.698304Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:248dc34cc7b6e25588a75211063f46aa403543065456f32ac2a692c8eecdb5c9","observation_id":"ad9436e6-f43e-4a36-afef-6e20cf9d7a6b","resolution":{"observed_at":"2026-08-12T17:12:13.927051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.907008Z","title":"A Machine Learn- ing Approach to Violin Bow Technique Classification: A Comparison Between IMU and MOCAP systems,","venue":null,"work_id":"3881698c-a243-43d6-988b-b4106752c11f","year":2018},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.702137Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:558f6d79b68b309417f360fc86a07de939c7b054c561f1d7db63e0cc628c6119","observation_id":"05142208-0f2a-4381-94ca-d6dec9cb098b","resolution":{"observed_at":"2026-08-12T17:12:13.911043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.892417Z","title":"Audiovisual Analysis of Music Performances: Overview of an Emerging Field,","venue":null,"work_id":"8d9bc525-8653-43a1-994f-290e0b90311b","year":2019},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.705903Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:ee148110ca9eedefc3b8f8025e4acbce8fb0dd19e14af6ad46780e23b6d0e345","observation_id":"c1c766be-c3bb-4e5e-8f1f-8e997534624e","resolution":{"observed_at":"2026-08-12T17:12:13.898107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.876667Z","title":"Uplift and Up- sample: Efficient 3D Human Pose Estimation With Uplift- ing Transformers,","venue":null,"work_id":"c7903bb1-df98-4a45-af0f-b5559a914679","year":2023},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.710570Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:50635c6cd15b006a64ad0eea8912d3329226a1a7ecf41de7ce5efb3c4e7f3847","observation_id":"88eb7091-9df4-4cf9-b6c2-f0969fd5fa25","resolution":{"observed_at":"2026-08-12T17:12:13.883800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.859926Z","title":"Fusion of Multimodal Informa- tion in Music Content Analysis,","venue":null,"work_id":"1cf3618a-43a5-4591-bef2-18d6222752e9","year":2012},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.714604Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:13251adb47a7fa3ac304189035e18c0b8c9d5c31253cc08352ffb298c4722847","observation_id":"5eac2f51-7318-494c-b197-762d1d0595dc","resolution":{"observed_at":"2026-08-12T17:12:13.865296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.841156Z","title":"Foley Music: Learning to Generate Music from Videos,","venue":null,"work_id":"6ba65477-4683-4d5d-bbfa-64aed9db25e0","year":2020},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.719008Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:a2fb446d35c43d3041788cd09f9868dda0537854e71c5d4970cd544f35ade5f8","observation_id":"9ea205cc-d78e-48e9-b551-cde834e9958b","resolution":{"observed_at":"2026-08-12T17:12:13.846040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.827325Z","title":"Look, Listen, and Act: Towards Audio-Visual Embodied Nav- igation,","venue":null,"work_id":"7da96851-e01d-4cd5-a3e6-3244c47a2d64","year":2020},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.723240Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:1dc199b5a50acbd308151f6ef6684255135a613c52f259387ad6744a25472eb4","observation_id":"da86d42b-5027-4261-8b23-b786df3f680f","resolution":{"observed_at":"2026-08-12T17:12:13.832069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.808910Z","title":"Automated Violin Bowing Gesture Recog- nition Using FMCW-Radar and Machine Learning,","venue":null,"work_id":"cc2ca162-e41b-436b-b4df-1657eaff18f1","year":2023},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.728024Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:893fbd7e4036b62ad85b407d3a95ad50148d8e799e6948fead1e5d9313efc79f","observation_id":"fc7f206a-3f67-4fb9-9149-4514b8351226","resolution":{"observed_at":"2026-08-12T17:12:13.814147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.796350Z","title":"VisualEchoes: Spatial Image Representation Learn- ing Through Echolocation,","venue":null,"work_id":"76d2dfd6-323d-471f-8d95-abe5af1d5e6c","year":2020},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.732109Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:7fe3501d393d0da8cd755430b39ef39b185ab25908a0703e125a0fef59c60229","observation_id":"ac257654-1ece-43cc-889d-9d61f1c11c36","resolution":{"observed_at":"2026-08-12T17:12:13.800514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.783295Z","title":"Learning Individual Styles of Conversational Gesture,","venue":null,"work_id":"f5c4fc7d-3cf2-41fc-9870-b3752f1ddc8f","year":2019},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.737165Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:6535a4ce2476c8f3c09272aa9d3c6a6a05882c6fe05dd736588720f76220aeaf","observation_id":"68f5644e-36ba-4573-9634-19918f7e8bf3","resolution":{"observed_at":"2026-08-12T17:12:13.787411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.771656Z","title":"Body Movement in Music Information Retrieval,","venue":null,"work_id":"78ba2e22-1b06-4f0a-85c6-a98f2267f18f","year":2009},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.741066Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:7c1760c31acd4adaa80dfb1498654911109d9c5143a279af7ffdebee0ab80bec","observation_id":"5013caef-a864-4e2b-ac90-2356eaf1cf24","resolution":{"observed_at":"2026-08-12T17:12:13.776039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.757875Z","title":"DiffPose: Toward More Reliable 3D Pose Estimation,","venue":null,"work_id":"62e420a0-b699-496a-bd1b-a6e3aeb8837b","year":2023},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.745144Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:e78560a38419c1e2fbde11ec398ca0f1f82a64cf288185f262c73da33a465863","observation_id":"1d7977a2-9fa5-4c15-9022-71a4a1f51920","resolution":{"observed_at":"2026-08-12T17:12:13.763417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.743782Z","title":"Discov- ering a language for human activity,","venue":null,"work_id":"d15435a4-6247-42b7-a744-191f96d9f0ec","year":2005},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.748973Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:fc4026e27573cf083c8decacb0625f8b6f6cdd052117bea7964292aa995d2fc9","observation_id":"aeabf4c4-dc13-44d6-ac65-fa39aee8718a","resolution":{"observed_at":"2026-08-12T17:12:13.748392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.730529Z","title":"Deep Hierarchical Planning from Pixels,","venue":null,"work_id":"a8b8773d-fba6-4267-958b-a87b67c33e4f","year":2022},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.752838Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:88b1fc3c5cee9fd9df0486be3f2890c85bf96398ba68a4c283fedcaa5698dc80","observation_id":"9410cbc1-4244-4779-b91f-21734aa802ad","resolution":{"observed_at":"2026-08-12T17:12:13.734822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.715410Z","title":"Resolv- ing 3D Human Pose Ambiguities With 3D Scene Constraints,","venue":null,"work_id":"a3c05517-72d9-4f14-a74c-056468a0d739","year":2019},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.756953Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:c25a13dd5955d795f35f98d585582f49285dc59aacf494ddc348187a796175bf","observation_id":"60cdfbad-25c6-4b71-b0e4-c9b1c24f065e","resolution":{"observed_at":"2026-08-12T17:12:13.721831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.700269Z","title":"Exploiting temporal infor- mation for 3D human pose estimation,","venue":null,"work_id":"30c7d7aa-afe7-451b-9bcf-6a1e9b172147","year":2018},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.761045Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:41c80716d7ad2cc4d5b72178dc86c52ee3f33fd3c8110b53227c01bc993eaa8d","observation_id":"cb6424fc-d17d-4110-9620-d4e3a2a414d5","resolution":{"observed_at":"2026-08-12T17:12:13.705597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.686321Z","title":"Hu- man3.6m: Large scale datasets and predictive methods for 3d human sensing in natural environments,","venue":null,"work_id":"e2cd7a93-4bba-4f75-b8b7-27627b8ebcfd","year":2014},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.764685Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:ac2d221ed1da54e0a9b7af55b0d9137d3067b9385c1509712a5f4dcdedc37fce","observation_id":"93f2d039-c427-45ef-8885-4bdf58a90c04","resolution":{"observed_at":"2026-08-12T17:12:13.691035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.674552Z","title":"End- to-End Recovery of Human Shape and Pose,","venue":null,"work_id":"3a4e5fa8-d40e-45c4-b023-21c07076af20","year":2018},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.768528Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:3638cc94ab4fa277395eabc88dbe45e67444fff317d79ed65da7260c14686ae6","observation_id":"61b0bbae-436a-46ac-af64-c73d21b6f379","resolution":{"observed_at":"2026-08-12T17:12:13.678666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.663086Z","title":"Temporally Guided Music-to-Body- Movement Generation,","venue":null,"work_id":"bf4afe0f-b980-471e-9f40-37114a56cd6c","year":2020},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.772556Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:1f0af0e7d79bff9a77be195530731f6d4f0d6053a36c44cdd6659755bd86eede","observation_id":"37b87e6e-6558-4dea-a213-9eeacf59dfdd","resolution":{"observed_at":"2026-08-12T17:12:13.667234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.650296Z","title":"EPIC- Fusion: Audio-Visual Temporal Binding for Egocentric Ac- tion Recognition,","venue":null,"work_id":"fa95f191-3623-4ba2-afbb-011869adc265","year":2019},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.776599Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:5420abc04892c01e27c1f7c398ca27d482eee5192d2579510c0b92ebc0080f02","observation_id":"217818df-2a39-48f3-9dac-90fdbac3d15e","resolution":{"observed_at":"2026-08-12T17:12:13.655708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.636498Z","title":"Dancing to Music,","venue":null,"work_id":"dfdc7965-52ce-4832-b56a-a84be354f5ea","year":2019},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.780730Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:a58da110049f79393af347db0d70da27584f9ad953b21d2708e5a1b61b695916","observation_id":"b3b5703d-e50d-48d9-9641-3737b3c2a871","resolution":{"observed_at":"2026-08-12T17:12:13.641129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.623375Z","title":"Propagating LSTM: 3D Pose Estimation based on Joint Interdependency,","venue":null,"work_id":"77edf85d-163d-41f5-876e-f9c5b6548d13","year":2018},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.785127Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:0c1ff78113689a0b5df80746306475e19037b5b97fc444ae50c314268fda6808","observation_id":"ef145d5f-13c0-47df-aefc-8a19ec919129","resolution":{"observed_at":"2026-08-12T17:12:13.627698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.610490Z","title":"An Interdis- ciplinary Review of Music Performance Analysis,","venue":null,"work_id":"eec5bac1-175d-4472-b4af-896b744583f5","year":2020},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.789184Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:c52f6d4781e74bdc5fcb4f00f175c84234a34378dd847d0293801e37147dced7","observation_id":"69f62c94-9689-4a01-9109-e8d74951c8ff","resolution":{"observed_at":"2026-08-12T17:12:13.614924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.598317Z","title":"Cre- ating a multitrack classical music performance dataset for multimodal music analysis: Challenges, insights, and applica- tions,","venue":null,"work_id":"a46492bb-1345-4303-94d9-655fd7a39c88","year":2018},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.792726Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:25d97870e138e6c1c1059ddae90e4b7184a01b84343665a040fe1a15a482ef4d","observation_id":"59e5e926-06ab-49ee-864b-db371b22e152","resolution":{"observed_at":"2026-08-12T17:12:13.602596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.585393Z","title":"Audio-Visual End-to-End Multi- Channel Speech Separation, Dereverberation and Recogni- tion,","venue":null,"work_id":"0e9fe2c8-b3bf-4f9d-994a-70477af0a02a","year":2023},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.796526Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:69e88ac266966fd55f5a0262daef78dd3536a4073df058daeacb16ed0bf0977d","observation_id":"47ec178d-ad47-4f62-9198-84ee043690b6","resolution":{"observed_at":"2026-08-12T17:12:13.590012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.571229Z","title":"HybrIK: A Hybrid Analytical-Neural Inverse Kinematics Solution for 3D Human Pose and Shape Estimation,","venue":null,"work_id":"a1d06948-53cd-43a4-94e0-84a0f3cd679b","year":2021},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.800106Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:b53b8495cb1d1374e284f49e15e2512422dbec25a89db255f0520c0e12e404b8","observation_id":"5513c2df-3579-47da-86ec-d81e4b840c9a","resolution":{"observed_at":"2026-08-12T17:12:13.576904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.557720Z","title":"NIKI: Neural Inverse Kinematics With Invertible Neural Networks for 3D Human Pose and Shape Estimation,","venue":null,"work_id":"b658b6b9-a1f7-48e4-bb92-7ccc968f3a2b","year":2023},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.803675Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:a2ffc21618a9affc28e405dad702bce93789619cf23448b4fb177039a901c9e5","observation_id":"c3b8806f-a75c-48ae-835a-b17cd89d63b6","resolution":{"observed_at":"2026-08-12T17:12:13.562719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.543358Z","title":"AI Chore- ographer: Music Conditioned 3D Dance Generation With AIST++,","venue":null,"work_id":"69a34744-38fe-4679-9bb6-7839008d0dee","year":2021},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.807375Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:1c0ebf21e61a15b313cfcdfe164711170a2ed6b91146fbf69cb2d4f8ff502de5","observation_id":"c0cd609b-c982-4383-97bd-8b0161a7ee17","resolution":{"observed_at":"2026-08-12T17:12:13.548255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.525704Z","title":"Learning Visual Styles from Audio-Visual Associations,","venue":null,"work_id":"e609ece7-1554-4015-8777-e23afa29a075","year":2022},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.811040Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:20b9120dcd280a91a1c86a6b4d01c8bd3fced970f00114446bfa866b6cd148bb","observation_id":"5ff39ff6-cfb0-4908-8ef6-e1dc3c5512a7","resolution":{"observed_at":"2026-08-12T17:12:13.530415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.512561Z","title":"Ex- ploiting Temporal Contexts With Strided Transformer for 3D Human Pose Estimation,","venue":null,"work_id":"eb53adb4-3a61-4183-9f98-db16aac1080c","year":2022},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.814877Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:fa6e5f560cf5f0d5661535952ed7c6bd20a5eff44a1116ee2d0cfbe856c01186","observation_id":"41d496c7-44c9-49e3-aa8c-a0125afce558","resolution":{"observed_at":"2026-08-12T17:12:13.517047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.500016Z","title":"MHFormer: Multi-Hypothesis Transformer for 3D Hu- man Pose Estimation,","venue":null,"work_id":"fbde22f9-c5a6-4fab-a90b-5833dcb79bb7","year":2022},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.819461Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:a2799dafd8ff6686c21677a37c2ba2684d36f99077189885452f2bc9c81f2ebd","observation_id":"2ff16ed7-49ad-4f9f-87a6-08010e3f5676","resolution":{"observed_at":"2026-08-12T17:12:13.504156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.488201Z","title":"TokenPose: Learning Keypoint Tokens for Human Pose Estimation,","venue":null,"work_id":"5430b3d9-120d-43ba-9ca5-9eff480e223f","year":2021},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.823242Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:8fc6e00ded9a98d73cabcbaeff9c3086f5e1ce3b340b00e7add0a40c01a87889","observation_id":"9d931950-ea93-4b65-842e-68664ea7bc06","resolution":{"observed_at":"2026-08-12T17:12:13.492462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.475921Z","title":"Learning shift- invariant sparse representation of actions,","venue":null,"work_id":"b966101a-c638-4ecf-83e3-ea0d72aaf89c","year":2010},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.827145Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:4e273145d75f1138f511f917142b3f9a7643e1fb41c2856daec07dc5723f88fd","observation_id":"7b699445-b26a-44c3-8950-ba889dab8524","resolution":{"observed_at":"2026-08-12T17:12:13.480098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.464142Z","title":"MediaPipe: A Framework for Building Perception Pipelines,","venue":null,"work_id":"9ba5da0f-684f-4db3-b85e-f4f326781edd","year":2019},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.831163Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:afddfdf8066c2435d940540b0339ab534ce4aa17713dde0517f5c3403aa1c911","observation_id":"6e97d2e8-5086-41cb-8cc8-caa0332a9f9a","resolution":{"observed_at":"2026-08-12T17:12:13.468213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.452317Z","title":"M2C: Concise Music Repre- sentation for 3D Dance Generation,","venue":null,"work_id":"f267277d-14f0-4837-b34e-d6eb00c07a77","year":2023},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.835320Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:3e412ec942d004cab355f2582b414f96a90ff895f883b5ecda4d5e85a4402a6f","observation_id":"d9ea816e-b6db-486d-ba3b-01d88342bec1","resolution":{"observed_at":"2026-08-12T17:12:13.456656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.439826Z","title":"Hearing lips and seeing voices,","venue":null,"work_id":"6f0ef194-87cf-402e-8bf7-d5ef551c9791","year":1976},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.839299Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:2dd637d2f8d428c744490fccc9ec7f34216f56961665fa1a330ea158465cb725","observation_id":"a5ca631b-62de-4586-a454-9ac1b24b0938","resolution":{"observed_at":"2026-08-12T17:12:13.443911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.427099Z","title":"Marker-less piano fingering recognition using sequential depth images,","venue":null,"work_id":"c4d369d4-259a-40f9-bb52-107e079d85af","year":2013},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.843358Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:120f45da7502748fc95bd94e000623b0d7b7ed814636164bcc41e70312495515","observation_id":"e3ead72a-d11d-4e41-b052-fd8d1377c7fb","resolution":{"observed_at":"2026-08-12T17:12:13.431958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.414621Z","title":"A computational approach to studying interde- pendence in string quartet performance,","venue":null,"work_id":"0e888e9b-be98-47c5-a14b-c183ef092eee","year":2016},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.847419Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:d6448f26622c06d3510554837a1086387f9ce002e5c403bea4b7655ee77db3d3","observation_id":"ed5553b3-f2b6-41e0-934d-54ece4400309","resolution":{"observed_at":"2026-08-12T17:12:13.418820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.401159Z","title":"SyncTalk- Face: Talking Face Generation with Precise Lip-Syncing via Audio-Lip Memory,","venue":null,"work_id":"cf338fdd-8bf0-4c28-b522-7cda65d67e4a","year":null},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.852028Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:3fa77e6ea6932c7c5196cb6583607ab3f89ac625370f7385da7b2a1449c3be92","observation_id":"6215ebd3-9d87-478f-9326-bf28f7729e22","resolution":{"observed_at":"2026-08-12T17:12:13.405726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.388041Z","title":"Ordinal Depth Supervision for 3D Human Pose Estimation,","venue":null,"work_id":"fff830d9-f365-415a-adbb-4b09ef335210","year":2018},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.855921Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:fd31c298a7364a5c76cb5e733bd1599c09045a98f9c783c620f2903ebeeaf21b","observation_id":"d6bba34a-aa04-4a39-9e18-1eea964057f4","resolution":{"observed_at":"2026-08-12T17:12:13.393634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.376498Z","title":"3D Human Pose Estimation in Video With Temporal Convo- lutions and Semi-Supervised Training,","venue":null,"work_id":"bc3b8a6c-225e-424a-bdbf-34bc696ffb31","year":2019},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.859963Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:15363383c089ce20fe81884e9da227eb5b829ccb7a239c1ee52b5c7299434482","observation_id":"353b9fb6-5371-47ee-9cb8-040e83868987","resolution":{"observed_at":"2026-08-12T17:12:13.380482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.364073Z","title":"Effective use of multimedia for computer-assisted musical instrument tutor- ing,","venue":null,"work_id":"00665010-7e46-495d-b184-220a2c63d2af","year":2007},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.864293Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:d0b354f6a88e54efb4c9a64f1a180fd3c8bd8ad746fe63f0010d3f66f04f38ef","observation_id":"33a252e6-7bb0-444b-9501-5c1bfcb242e8","resolution":{"observed_at":"2026-08-12T17:12:13.368646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.350820Z","title":"Music-driven Dance Regeneration with Controllable Key Pose Constraints,","venue":null,"work_id":"ca5e4cac-8491-4cec-8c2b-dd1434ee2111","year":2022},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.868071Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:c1889be3af8d0fc1762213477530a94c9868ffb55c7e13b0245ec0de5672f530","observation_id":"5ba3096d-3967-4810-bc17-0eb5e4580096","resolution":{"observed_at":"2026-08-12T17:12:13.355677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.337790Z","title":"A Joint Cross-Attention Model for Audio-Visual Fusion in Dimensional Emotion Recognition,","venue":null,"work_id":"af25302b-fb5b-455a-b3c7-a92e176be362","year":2022},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.871658Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:6e5a93ba73d74a0e5bcb051f0d791799e3f75284b044642c1a5cb94f0611a746","observation_id":"a8b6f372-0698-4168-a18e-d5897b815ceb","resolution":{"observed_at":"2026-08-12T17:12:13.342968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.325162Z","title":"P-STMO: Pre-trained Spatial Temporal Many-to-One Model for 3D Human Pose Estimation,","venue":null,"work_id":"f6e61a4f-aea4-411c-a4d0-e19f4a72a2ee","year":2022},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.875204Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:e681f47aa72d4640ba28076a510a578bf51e68a895e44e04577d75d4ce6b0004","observation_id":"df603692-9488-42d4-8e6d-2bdac330a9e0","resolution":{"observed_at":"2026-08-12T17:12:13.329695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.310498Z","title":"PhysCap: Physically plausible monocular 3D motion capture in real time,","venue":null,"work_id":"28449864-a9e1-4c7d-a631-4b36e2a52ffb","year":2020},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.879105Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:72759b09f9ec17b42dbc335dfab252c628971d186158c31c2739459437aff17b","observation_id":"321c70ba-ccc7-4e65-b5c1-6aa192c13060","resolution":{"observed_at":"2026-08-12T17:12:13.315145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.298319Z","title":"Audio to Body Dynamics,","venue":null,"work_id":"26d1f308-cce4-442b-8bf5-e217443b6149","year":2018},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.883142Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:96074feec69ed2200da1a4a4f9ea8b1a55e7461fb459f97f04fb95bca4e44af7","observation_id":"06a3a303-236e-44ac-aea1-3c7df5987339","resolution":{"observed_at":"2026-08-12T17:12:13.302312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.285464Z","title":"AIMusicGuru: Music Assisted Human Pose Correction,","venue":null,"work_id":"bdff028f-cdcc-4cf6-99cc-d4130f4f4696","year":2022},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.887244Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:7c855e9b1bcebf92132f7f043ee8d4a0df3693c434c2053117f8e7b7bf2cd4bc","observation_id":"fefe1c47-ce16-4156-8801-52c654baa46c","resolution":{"observed_at":"2026-08-12T17:12:13.289946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.272902Z","title":"HumanEva: Synchro- nized video and motion capture dataset and baseline algorithm for evaluation of articulated human motion,","venue":null,"work_id":"ee9f9e64-4a51-4f93-b601-594ac8a46e1a","year":null},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.891031Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:b312ee9b3e94e66991a40182ffb598b2ae413b261d630ce33db3b1dcebfef6f8","observation_id":"f360d5d0-cc81-4aa4-ada3-a3055e3320c0","resolution":{"observed_at":"2026-08-12T17:12:13.277493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.260433Z","title":"Audeo: Audio generation for a silent performance video,","venue":null,"work_id":"f6cad64d-8a35-4386-bf43-f5aadfce98e4","year":2020},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.894747Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:143a492c47fb62cf3d53283bdf193c64eda7940591bac69ae0b0bbe9e5a97d50","observation_id":"0121f3e6-8242-4b90-a77b-e4731458eeb9","resolution":{"observed_at":"2026-08-12T17:12:13.265027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.247332Z","title":"Physics-Driven Diffusion Models for Impact Sound Synthesis From Videos,","venue":null,"work_id":"2dde15f2-f46a-4e22-a4b7-5fcb097f20ff","year":2023},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.899564Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:13ba3338bf478a7c734fba796bf3e716822a24c8cc105382f03a8cedf8a75b53","observation_id":"dd315c4e-63b3-4521-8dd8-294827a39bb0","resolution":{"observed_at":"2026-08-12T17:12:13.252144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.233409Z","title":"3D Human Pose Estimation With Spatio-Temporal Criss-Cross Attention,","venue":null,"work_id":"4c149b2f-cf85-4153-b3f7-80ac9bd6bf82","year":2023},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.903515Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:fcc5fbc2628debe12111aab5760054810f2f06b3be88f2571a5f907966146634","observation_id":"f39f9d8a-d365-43c5-a487-c9649cdd16d0","resolution":{"observed_at":"2026-08-12T17:12:13.238025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.220772Z","title":"Sight over sound in the judgment of music per- formance,","venue":null,"work_id":"1beb5f11-f974-4bc2-a7b1-942c2b2816ac","year":2013},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.907473Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:1f6213f827479b8b2d30c2726a56a65efdaa99f4aec2c30627991f330b8a8cff","observation_id":"42d7b99a-4901-49c4-b02f-3ef58b488563","resolution":{"observed_at":"2026-08-12T17:12:13.225416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.208603Z","title":"Attention is All you Need,","venue":null,"work_id":"f055fa8d-0e88-46e9-856b-b7dc3800b190","year":2017},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.911372Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:3df8100dccce46f67ea0c4329101460a1ec613c35f3ee8db1654c5337fe0a7d4","observation_id":"538efff9-33a4-46ea-886b-993e76bbccc3","resolution":{"observed_at":"2026-08-12T17:12:13.212904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.193902Z","title":"A multimodal corpus for technology-enhanced learning of vi- olin playing,","venue":null,"work_id":"029f1db3-aca9-4e34-ac6c-d0ef1a6b4e29","year":2017},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.915225Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:67117650fcac39afe8c3cd08a994b52aa56dd2f068f82b49479073846b167cd3","observation_id":"ca779885-bcf6-454f-9b16-36dea801009e","resolution":{"observed_at":"2026-08-12T17:12:13.199138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.182765Z","title":"Con- volutional Pose Machines,","venue":null,"work_id":"dad48837-0ede-4ad1-ad74-7d1673619bea","year":2016},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.919056Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:a26f5924e8dd72860b084a5c6fd39305e14df8e8721ba4db80c9d2192a572523","observation_id":"2eaf5dca-681e-4196-818b-2592a1eae3ad","resolution":{"observed_at":"2026-08-12T17:12:13.186580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.169674Z","title":"Deep Kinematics Analysis for Monocular 3D Human Pose Esti- mation,","venue":null,"work_id":"8eb72d2d-909d-4947-b82f-25679ec21296","year":2020},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.925257Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:05f8aa3b86cca5bc8928a8b96b47b937d3abead3117f8827476f465094583f1a","observation_id":"da34c776-3a8b-4861-ad32-1ebf23c71f29","resolution":{"observed_at":"2026-08-12T17:12:13.173483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.157244Z","title":"U-shaped spa- tial–temporal transformer network for 3D human pose estima- tion,","venue":null,"work_id":"7773feff-e200-418d-a12b-b395a717a6bd","year":2022},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.930619Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:b19fe808a42bccd0d230c3d82652a5030b1093c40d40001e4bb8070b028852e3","observation_id":"1a0474e3-fc99-48b0-89ff-a0db18326e86","resolution":{"observed_at":"2026-08-12T17:12:13.161974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.144170Z","title":"Automatic Music Transcription using Audio-Visual Fusion for Violin Practice in Home Environ- ment,","venue":null,"work_id":"af1b1963-cc32-47ae-8ee0-c464085522dc","year":2009},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.934347Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:0e314688577e0b5950da646a5adad57700afb8d82b8d7593debbfcb5e618ec50","observation_id":"1ca9d089-43c6-4673-835e-3aa3294d3c98","resolution":{"observed_at":"2026-08-12T17:12:13.148922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.130951Z","title":"MixSTE: Seq2seq Mixed Spatio-Temporal Encoder for 3D Human Pose Estimation in Video,","venue":null,"work_id":"cd9e3b23-9aec-4702-8164-78a57d3d1ea7","year":2022},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.939318Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:bfc4852d14e2521cc2d089158e614dcd003b1d08ce24e39d47717096aa32630f","observation_id":"0ceb9e42-2a73-42bf-94bc-c2a0afa085e1","resolution":{"observed_at":"2026-08-12T17:12:13.135299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.116193Z","title":"The Sound of Pixels,","venue":null,"work_id":"554fbf58-4e8b-47ef-9012-93740e10aac5","year":2018},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.943544Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:cf9355751c457d528255ddfba97f9352d63bd419c9df1e4be280b7ff4ffc55ae","observation_id":"fb615931-dd1c-4f16-abe4-8c501907d84a","resolution":{"observed_at":"2026-08-12T17:12:13.120869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.096366Z","title":"The Sound of Motions,","venue":null,"work_id":"5ca197f5-f0ab-4ef1-a0ac-bb76af70a9b8","year":2019},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.948716Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:29501fe5f9e9d1bf05b1e181fb61a9aa195e1bbf01bf13953a9f9ae0f8e9eda2","observation_id":"7c2fc7e6-4080-4ba2-bd8f-b53b73d6f0cd","resolution":{"observed_at":"2026-08-12T17:12:13.102714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.080290Z","title":"Pose- FormerV2: Exploring Frequency Domain for Efficient and Robust 3D Human Pose Estimation,","venue":null,"work_id":"373872d9-8e19-4eec-ba24-b9224801c2f2","year":2023},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.954575Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:ee83bff877fa4ce5a4d7c718feab3e87e807f67534c646e3becab38e730f6e68","observation_id":"1f9636e0-b571-4779-bb59-fadb08c7d02b","resolution":{"observed_at":"2026-08-12T17:12:13.085208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.065443Z","title":"3D Human Pose Estimation With Spatial and Tem- poral Transformers,","venue":null,"work_id":"e9fc52f3-38f6-4c1c-bccf-d70868c6ff2e","year":2021},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.960546Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:562433521888f8bfb7e720b6cba2992c2e6c3a48d02d99508c416015d3e1a46b","observation_id":"2d662b6a-9859-4292-870b-f35632c95285","resolution":{"observed_at":"2026-08-12T17:12:13.070061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.049851Z","title":"Pose-Controllable Talking Face Generation by Implicitly Modularized Audio-Visual Representation,","venue":null,"work_id":"1c35ab3c-cb22-4b6b-8555-60e0338f50b5","year":2021},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.964890Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:cff6a66d8cc43d5cafef31050d9e72aacb032869b4abea6063276e3972319614","observation_id":"62f81c5e-3277-4f25-bae6-c23f7622b4c7","resolution":{"observed_at":"2026-08-12T17:12:13.054505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:12:13.035389Z","title":"Quantized GAN for Complex Music Gen- eration from Dance Videos,","venue":null,"work_id":"a5edf04f-7120-4a7f-9e17-f934689a61ac","year":2022},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.969300Z"},"links":{"citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:312f0cc6b2993a019b1887d462b3437cc4180627448f28d4aa3f7e1c7d7b72da","observation_id":"33967f37-fef8-4dd9-8da6-f2b7ae14f9a8","resolution":{"observed_at":"2026-08-12T17:12:13.040782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.03761","last_updated":"2020-03-10T18:32:15Z","snapshot_observed_at":"2026-08-16T23:17:32.111944Z","submitted_at":"2020-02-02T17:18:31Z","title":"Music2Dance: DanceNet for Music-driven Dance Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.03761","snapshot_observed_at":"2026-08-12T17:12:12.974374Z","title":"Mu- sic2dance: Dancenet for music-driven dance generation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T17:12:12.974374Z"},"links":{"cited_paper":"/paper/2002.03761","citing_paper":"/paper/2411.13607"},"observation_digest":"sha256:f5b8aafbf9b7fa546e423a42f879e65d1da41befda4d962bdd9d44467720e9ca","observation_id":"e320ff10-f0a7-455e-aa76-eb532a8c6574","resolution":{"observed_at":"2026-08-12T17:12:12.974374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.13607","last_updated":"2024-11-25T05:14:20Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T20:58:57.984958Z","submitted_at":"2024-11-19T20:57:15Z","title":"VioPose: Violin Performance 4D Pose Estimation by Hierarchical Audiovisual Inference"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":1,"verified_fuzzy":78},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 0 inbound Pith citation observations for arXiv:2411.13607."}