{"as_of":"2026-08-07T10:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:14c4b0540441f69bb423491b9fe555de155a2df1c9d4374673b3e6fddae9a93c","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T22:55:44.549338Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.06956/citation-record","integrity":"/paper/2509.06956/integrity","json":"/paper/2509.06956/citation-record.json","paper":"/paper/2509.06956"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.599388Z","title":"Enhanced skeleton visualization for view invariant human action recognition,","venue":null,"work_id":"c12ffccf-f585-4f92-9d2a-d6bb662cbe76","year":2017},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.276189Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:4daae6188ada00563cae1f81ef20e79678d09bcb1e66b9cb099d1faac0a6fe73","observation_id":"b4f4d5f3-c125-4fda-a2e7-65ff9d47bd29","resolution":{"observed_at":"2026-08-04T22:55:45.604268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.584284Z","title":"BlockGCN: Redefine topology awareness for skeleton-based action recognition,","venue":null,"work_id":"ebcbc6ab-513c-4bb3-bcef-eb56efe6902c","year":2024},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.281251Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:825040285821a4eff3a47abeb388f3a99c3c4eba2ebc67375139acaf2f964220","observation_id":"720d6735-2dbd-4c84-947c-cebf3ee3a7b3","resolution":{"observed_at":"2026-08-04T22:55:45.589126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.568753Z","title":"Multi-task deep learning for real-time 3D human pose estimation and action recognition,","venue":null,"work_id":"b1f68291-c21c-4bc7-946a-45b4df800621","year":2020},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.286129Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:0e38a85ac3770ec0788bcf37eecaee1e19757929671267cdd93ac0cc868de07b","observation_id":"b76054a0-1e5d-4354-a7c1-0a8a34ac3b80","resolution":{"observed_at":"2026-08-04T22:55:45.573629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.553978Z","title":"3D human pose estimation in rgbd images for robotic task learning,","venue":null,"work_id":"e9ecf7a5-add6-4d6c-a249-1cd78b9b55b4","year":2018},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.290980Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:dcab6a673bfbc0a21ed038ce9aa24645d4bf99ba4a8570266baceee5c89ab46b","observation_id":"1501b5c8-696c-4514-98be-0138146998f1","resolution":{"observed_at":"2026-08-04T22:55:45.559063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.539312Z","title":"Hu- man 3D pose estimation with a tilting camera for social mobile robot interaction,","venue":null,"work_id":"e3d66691-52ae-417b-881a-ba3811144658","year":2019},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.295802Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:1a0cb841dcfbd72aa86bd49b4f33be88a8cf42f118a9b1b4ea66952319542304","observation_id":"8f07dd4c-430c-45db-9ae1-5f6f35af1e45","resolution":{"observed_at":"2026-08-04T22:55:45.544051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.524590Z","title":"Human-aware vision-and- language navigation: Bridging simulation to reality with dynamic human interactions,","venue":null,"work_id":"5b138eb0-4f2d-426f-bdaa-9ddee45252fe","year":2024},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.300262Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:08df1f52c9342ce8a5ba930d5bb8b01c288943f4aeb4ebe028d8d0951dcc271d","observation_id":"825df645-40d0-4f10-b282-fc6779caec29","resolution":{"observed_at":"2026-08-04T22:55:45.529550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.509583Z","title":"VNect: Real-time 3D human pose estimation with a single rgb camera,","venue":null,"work_id":"bf991534-bc2c-4b5b-b59d-c2274fd29567","year":2017},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.305185Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:46d585d502679e6e83e74e4f14476f02843bae509f3f681b8c88129f406bdd4d","observation_id":"25e097b8-cec7-468c-9a53-1bbb547db02f","resolution":{"observed_at":"2026-08-04T22:55:45.514635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.495504Z","title":"MotionEditor: Editing video motion via content-aware diffusion,","venue":null,"work_id":"2e9bac92-69ea-4cdb-84b1-80dc170663a3","year":2024},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.309190Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:0524933c205de8f0d48ca72c626e13df4c38856d99b1a1a0915ff9d2f766b05c","observation_id":"fbe5c82b-a7a7-443b-9246-2a5a25863618","resolution":{"observed_at":"2026-08-04T22:55:45.500237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.480647Z","title":"Co-evolution of pose and mesh for 3D human body estimation from video,","venue":null,"work_id":"1a07bad9-d2cd-4b92-a983-bd41a4e4822f","year":2023},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.313157Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:67d19700eb5e4fcd4feb3f14b57c1743fa4ef40b21e32ccd1477c6b36375afc9","observation_id":"63df35ca-7a6a-42e6-a570-0412419b5ef3","resolution":{"observed_at":"2026-08-04T22:55:45.485976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.465994Z","title":"HDFormer: High-order directed transformer for 3D human pose estimation,","venue":null,"work_id":"958747a3-1839-4612-8bc8-e01281886b6a","year":2023},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.317152Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:6581cbe5015e56ec46bf48e43a9e92430dd64d4b7842e0fc7861fcae1fa4ccd8","observation_id":"40c0af29-640a-4295-84fa-0278243f7c5b","resolution":{"observed_at":"2026-08-04T22:55:45.470917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.450906Z","title":"PoSynDA: Multi-hypothesis pose synthesis domain adaptation for robust 3D human pose estimation,","venue":null,"work_id":"23cb32a0-2820-4b50-969a-3736a58d4b2c","year":2023},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.321011Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:559f6ddd81c4150f3d68f9c35c5832ec357db2fd621c8702e05f936a8741c73f","observation_id":"37b2ad05-7ea0-4858-bdce-394562208d5a","resolution":{"observed_at":"2026-08-04T22:55:45.455696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.436577Z","title":"APP: Adaptive pose pooling for 3D human pose estimation from videos,","venue":null,"work_id":"f2b46852-3f56-4923-b756-044ef9bf1b52","year":2024},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.325284Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:32ed708609e58b7ae8c374f87358d7cb854f9b9bfc4dd0b15e565796aafea1bc","observation_id":"6e35c363-6443-46f5-8db4-7b2d87bd0fae","resolution":{"observed_at":"2026-08-04T22:55:45.441146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.421147Z","title":"3D human pose estimation with spatial and temporal transformers,","venue":null,"work_id":"fde6dd26-861a-4643-8f98-464ed61d4b9c","year":2021},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.329518Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:25637e0a30d319c9c60671fe4dd9899622071ca5f4316e144c98e8713b771b86","observation_id":"fcd25d00-440f-4a28-baf4-a4514bc50b67","resolution":{"observed_at":"2026-08-04T22:55:45.426324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.406022Z","title":"MHFormer: Multi-hypothesis transformer for 3D human pose estimation,","venue":null,"work_id":"acbae297-8249-4244-84bf-9a5205dc24e1","year":2022},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.333892Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:64be2783865a305fcdeff9e29dd3c63a786d8f72aa16aafb35a3df619f5c0092","observation_id":"6bce40d8-d998-4d99-b04e-c62a61b716db","resolution":{"observed_at":"2026-08-04T22:55:45.411109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.389796Z","title":"MixSTE: Seq2seq mixed spatio-temporal encoder for 3D human pose estimation in video,","venue":null,"work_id":"c81d1ab2-87f4-4cae-9a66-0634122a23c5","year":2022},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.337864Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:d0a0fd170f52ff78b024d256b359710952164ed6454ef30cd88140cd95209174","observation_id":"b114793d-4f91-4df6-84a5-0d1836a5097f","resolution":{"observed_at":"2026-08-04T22:55:45.395097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.374636Z","title":"MotionBERT: A unified perspective on learning human motion representations,","venue":null,"work_id":"180b353b-7a21-4bdd-a13e-7a3f8a01d4e2","year":2023},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.341870Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:0025b5edb226e2e21e57140b400641fb269a1b933e941306a4a6e908aa2088fa","observation_id":"f51c0877-6a53-499d-a144-2ddfece8fcf0","resolution":{"observed_at":"2026-08-04T22:55:45.379484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.359185Z","title":"TCPFormer: Learning temporal correlation with implicit pose proxy for 3D human pose estimation,","venue":null,"work_id":"f2736422-6fbb-4a29-8f57-dc1fc5b4e94f","year":2025},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.345965Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:6263da6700ffb8cbd025d8d7bfd04edb7ed5f852b0113e82c82a2cec905dfb22","observation_id":"90dbc6c8-3871-4133-bec1-3be5e3cbb31e","resolution":{"observed_at":"2026-08-04T22:55:45.364275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.342755Z","title":"P-STMO: Pre-trained spatial temporal many-to-one model for 3D human pose estimation,","venue":null,"work_id":"d99b9804-9ae2-44ce-a371-9100bf88cc9f","year":2022},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.350184Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:2fcea08a2cd4d85b70e96065263bc36e1c0d9573c0ea08cb312e222e8a47d819","observation_id":"4b28a346-55fc-46cd-978e-798221157b3f","resolution":{"observed_at":"2026-08-04T22:55:45.347922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.326268Z","title":"Exploiting temporal contexts with strided transformer for 3D human pose estimation,","venue":null,"work_id":"45bd813f-0567-473f-be16-6276ea3be58a","year":2022},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.354381Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:cb05b1c9ef8917829ab14b73e4d201affb73b4a9e7f7d3605da2fa54664dbccd","observation_id":"6ed72bc7-d23f-4b68-abb8-0746094895ac","resolution":{"observed_at":"2026-08-04T22:55:45.332328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.310643Z","title":"Uplift and upsample: Efficient 3D human pose estimation with uplifting transformers,","venue":null,"work_id":"dfb75d2b-12c6-4032-9ba1-7f71cd79074f","year":2023},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.358309Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:66387b43e63be9841966ec5362d949537b2498f0289a5d388c2d26dc31498eb0","observation_id":"72970066-8651-4f23-bb7a-435a8ef45175","resolution":{"observed_at":"2026-08-04T22:55:45.315890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.294966Z","title":"Hourglass tok- enizer for efficient transformer-based 3D human pose estimation,","venue":null,"work_id":"4ebf6959-45e9-4736-9c0a-f95bdbcbe543","year":2024},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.362497Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:b0eb623d8cc4c1e1d84c2221ea930a19dce9588afe60e4f9e58709d649649d23","observation_id":"b57b8b25-c837-473a-bea7-09290c4d5b2d","resolution":{"observed_at":"2026-08-04T22:55:45.299990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.279046Z","title":"3D human pose estimation in video with temporal convolutions and semi- supervised training,","venue":null,"work_id":"2a55e8a5-2fc1-4412-9d15-8f2dbd9f5250","year":2019},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.366518Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:9290166fa22aa9c5dc4bcf4e62fe0c0f781b6f8970465c43cca2869e35cff0c6","observation_id":"f6e5953b-fcb9-4afc-abf3-0136e9c28b26","resolution":{"observed_at":"2026-08-04T22:55:45.284393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.261563Z","title":"Attention mechanism exploits temporal contexts: Real-time 3D human pose reconstruction,","venue":null,"work_id":"bce5c6db-5420-426b-a2bf-ff3689c897e2","year":2020},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.370443Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:9b76e16862686ceb6d146154fa81698fe61b1bd6ec2243797c9192fa6a5537de","observation_id":"6de2d2f0-1a0c-4b75-8362-f9aa670abefe","resolution":{"observed_at":"2026-08-04T22:55:45.267817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.244196Z","title":"Hu- man3.6M: Large scale datasets and predictive methods for 3D human sensing in natural environments,","venue":null,"work_id":"e39901b7-9a55-4725-92ca-7a3b141f1fbb","year":2013},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.374526Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:1f93cb2c4777e3aba9f316c5b3226279cae0d4f01d50ecd380d3f4499ea5065e","observation_id":"d72560e8-4122-4bef-be79-5d62196e3970","resolution":{"observed_at":"2026-08-04T22:55:45.249315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.227724Z","title":"DynamicViT: Efficient vision transformers with dynamic token sparsification,","venue":null,"work_id":"9323bf01-89d2-4b68-aec2-056766c873da","year":2021},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.378458Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:696193fa4112d78b8a37674dcebc40285af372b231657bb7367a07cd82956bfb","observation_id":"a5929187-bde4-4658-b9ba-79e6736a9455","resolution":{"observed_at":"2026-08-04T22:55:45.232965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.210717Z","title":"VTC-LFC: Vision transformer compression with low-frequency components,","venue":null,"work_id":"985bfaac-72d7-496c-8ea8-c64d30d1689f","year":2022},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.382535Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:ae18ee5e8af35a545f50bb90355168c2f967b4737b819422a0713777226a61e8","observation_id":"e3c76fb1-d654-40e8-8fb2-1751f3a7a9ca","resolution":{"observed_at":"2026-08-04T22:55:45.215978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.194336Z","title":"MotionAGFormer: Enhancing 3D human pose estimation with a transformer-gcnformer network,","venue":null,"work_id":"a6d2c548-fcb1-4529-b52f-1ff82b5bed37","year":2024},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.386402Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:0d2ffef18a5926c4d4ff975cd54ebc98c0c3a62d92cc487e96c4a471e15731c8","observation_id":"97173f43-0817-4807-a09e-a6a58e64eb08","resolution":{"observed_at":"2026-08-04T22:55:45.199602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.178084Z","title":"Attention is all you need,","venue":null,"work_id":"14fcbb0d-5466-465e-a6f8-852e95781dfc","year":2017},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.390306Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:0848aaea67b0e6825d8b6f747d6d3e7dcd29f00ae34eaf7801681a01d5c21d84","observation_id":"b6b40d83-3956-4630-8419-7d57b536cf02","resolution":{"observed_at":"2026-08-04T22:55:45.183013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.394566Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.394566Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:98e52974b8b3245540308453161331f566c26340a03b83b8efb4e7f8affa5637","observation_id":"cf3b16a6-684d-4883-b2c8-29b69449fdc8","resolution":{"observed_at":"2026-08-04T22:55:44.394566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.398516Z","title":"Swin Transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.398516Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:e9e11450c62255674c0ab196b10a2cb6114e66137af123ee2f9e4fea99e87d34","observation_id":"5b8a6825-0064-4e7e-8788-c91ef4f6b236","resolution":{"observed_at":"2026-08-04T22:55:44.398516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.139232Z","title":"GSRFormer: Grounded situation recognition transformer with alternate semantic attention refinement,","venue":null,"work_id":"70ca6efb-092b-4b9e-a075-87839babfffe","year":2022},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.402652Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:6506d5dbbcf491e562669e1cf51061e3911b6ba41ad8b828a26e549c44465f5c","observation_id":"930f046b-5ca2-4c3c-9c0c-665dac74af64","resolution":{"observed_at":"2026-08-04T22:55:45.144295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.123268Z","title":"Implicit temporal modeling with learnable alignment for video recognition,","venue":null,"work_id":"3d8946c8-aeb5-49f4-998d-d04ba1ef02b8","year":2023},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.406606Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:1affb6ffb20a1c99d323f0168ebe0a2544c8acc1308db480809266c71fc0402e","observation_id":"e95de71a-0889-4338-b5aa-9c773d9e6a4e","resolution":{"observed_at":"2026-08-04T22:55:45.128383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.105649Z","title":"Adaptive multi-view and temporal fusing transformer for 3D human pose estimation,","venue":null,"work_id":"1869db7f-6907-4100-b51f-49d519799e69","year":2022},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.410612Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:7b86b2281e219869cb78ae955a2c8466a04051bba8712dc8bddcb9cc055262b4","observation_id":"1e795d72-8e81-41d3-aada-2b806054cf2e","resolution":{"observed_at":"2026-08-04T22:55:45.111463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.088135Z","title":"SVTformer: Spatial-view- temporal transformer for multi-view 3d human pose estimation,","venue":null,"work_id":"b8c0fded-e19b-4197-a4fc-7f1d9ed3e700","year":2025},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.414565Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:468fe7404b4c36600c382635ad8558567414afdb2bbded111d368d43353e4c97","observation_id":"373eb5fd-4fe5-4259-ad24-cc80b2184597","resolution":{"observed_at":"2026-08-04T22:55:45.093596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.069804Z","title":"A simple yet effective baseline for 3D human pose estimation,","venue":null,"work_id":"ae2ecbb8-070c-4235-a223-4352284bee00","year":2017},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.418722Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:767ff96e6b4c11954efb4e4efb22ab25e4d3d288c5bb1269a698ab8c258ffd0c","observation_id":"6f96e7d7-5cb6-4b93-97e5-da9dd003322d","resolution":{"observed_at":"2026-08-04T22:55:45.075721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.044204Z","title":"MobileHumanPose: Toward real- time 3D human pose estimation in mobile devices,","venue":null,"work_id":"2feb9299-ad25-497b-8b98-e763948e6aff","year":2021},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.422985Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:170f1a01a7ace1f8a8b36a5f067760ec63902e2356b7bc75af2d1ecf3d81683b","observation_id":"14809c94-0d1a-44aa-bda2-b282dced5ba8","resolution":{"observed_at":"2026-08-04T22:55:45.055229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.027389Z","title":"DeciWatch: A simple baseline for 10x efficient 2D and 3D pose estimation,","venue":null,"work_id":"9ee85aa6-5750-4828-b1ab-de5473b6315b","year":2022},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.427489Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:6ac85fd217a92d573ba8dc47f476b29509d33ac1263b516645f5511f9fc6f711","observation_id":"60ebee9c-af8f-460b-93ca-b6eeef981744","resolution":{"observed_at":"2026-08-04T22:55:45.032888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:45.009895Z","title":"PoseFormerV2: Exploring frequency domain for efficient and robust 3D human pose estimation,","venue":null,"work_id":"d683f2e6-67fb-4fc4-8b5b-ba63c069f040","year":2023},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.431447Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:00b3843f4a9ddcb8d9a8736f1fa1f4e69cb337ecf147a71945eaee9826ae2671","observation_id":"48fab954-634f-41c6-88e5-9ca629c6d8ba","resolution":{"observed_at":"2026-08-04T22:55:45.016054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.985920Z","title":"MixSynthFormer: A transformer encoder-like structure with mixed synthetic self-attention for efficient human pose estimation,","venue":null,"work_id":"e4b6f7d2-43a7-46b0-b57a-9aa302ae5c2e","year":2023},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.435483Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:d4c90bed181f0601904f4359eb6a9dcc099b70003a91c2350ace36e2acbaa9f9","observation_id":"07385e7a-d708-4b69-a36c-50010ee4bbc9","resolution":{"observed_at":"2026-08-04T22:55:44.991304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.969319Z","title":"Learn- ing to reconstruct 3D human pose and shape via model-fitting in the loop,","venue":null,"work_id":"da590d59-b9f5-45c1-8c86-b405802a64d6","year":2019},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.439483Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:73859c8f5ab1b8c5cc07933fe0cf8b7c594cda19f82eadfa67c6c8a905fb69c0","observation_id":"25bb93d7-3da1-4485-ba7d-1dd43d2da844","resolution":{"observed_at":"2026-08-04T22:55:44.975819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.954167Z","title":"Exemplar fine-tuning for 3D human model fitting towards in-the-wild 3D human pose estimation,","venue":null,"work_id":"e31b61e7-1efd-419e-82cd-a1f710b9a9a2","year":2021},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.443509Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:ad47cb9e8874c86588cba19534ac98fbac4566241cbe9d6ba8d57ad31b38c7af","observation_id":"96f5d0f2-9ef8-4e5c-8065-1bd28931b230","resolution":{"observed_at":"2026-08-04T22:55:44.958926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.939394Z","title":"PARE: Part attention regressor for 3D human body estimation,","venue":null,"work_id":"1cd7e69f-68ad-4acd-8651-14e75f0bab2a","year":2021},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.447524Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:350725e6efff383280b21212ee05d084e70c9f3acda8104d5d8d092b58d3ef4e","observation_id":"397d71ba-eec4-45af-9869-de21c78643b3","resolution":{"observed_at":"2026-08-04T22:55:44.943929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.925453Z","title":"TORE: Token reduction for efficient human mesh recovery with transformer,","venue":null,"work_id":"780f521b-4a68-47cf-a52c-20a81d766335","year":2023},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.451549Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:2461fe9faa28728812f8c71a950509296dfc97cec47713c051157ce7e74e489d","observation_id":"1d922cbe-ffd0-43d0-84d8-29993f125cff","resolution":{"observed_at":"2026-08-04T22:55:44.929654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.909160Z","title":"Beyond attentive tokens: Incorporating token importance and diversity for efficient vision transformers,","venue":null,"work_id":"594d651d-80c1-4543-81eb-5c351b53a66a","year":2023},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.455632Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:3298ebe57d7adf0b921d6855af94c28884abe1eca4e0e1f47caa88797f3abe14","observation_id":"16825822-1de4-4f87-95de-7e5d28a52f73","resolution":{"observed_at":"2026-08-04T22:55:44.914049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.893278Z","title":"SPViT: Enabling faster vision transformers via latency-aware soft token pruning,","venue":null,"work_id":"47327b14-0453-4d59-80d4-c87ad048791f","year":2022},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.460009Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:67544c1ad684eb32cb46adbe237978a5055c48b9fe65a266819139c6ef7c4492","observation_id":"1f044c05-ba2c-4eed-a7c2-e00aa6a06667","resolution":{"observed_at":"2026-08-04T22:55:44.897958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.878739Z","title":"Making vision transformers efficient from a token sparsification view,","venue":null,"work_id":"58cd942b-3bde-4882-a1f3-75cce2cd5707","year":2023},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.464202Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:17f1045c2c833e90338db10244a34f390ec0c505f7f0fa0f0f42fbed90ddf711","observation_id":"1c94fcc8-0c33-43b1-be83-e2decafff9b9","resolution":{"observed_at":"2026-08-04T22:55:44.883238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.863970Z","title":"PPT: Token-pruned pose transformer for monocular and multi-view human pose estimation,","venue":null,"work_id":"f67ab30e-b271-4955-8b80-d603976b4fdd","year":2022},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.468245Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:6983b3919504ad4cf767b46122f2ba51cd765153b7a4752aa298224623fcbf89","observation_id":"44989d90-63e7-4fe4-84ec-30e0756b8106","resolution":{"observed_at":"2026-08-04T22:55:44.868634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.849119Z","title":"TCFormer: Visual recognition via token clustering transformer,","venue":null,"work_id":"c645690b-2c88-403e-900c-ba9efea23cb2","year":2024},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.472243Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:cf897d355838d87f4b06d683eb48e0d2b21dbcfe24d73dc5d50b0b8372c42205","observation_id":"3221ffe7-b8ce-40ef-8b86-23724007d868","resolution":{"observed_at":"2026-08-04T22:55:44.853539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.834684Z","title":"GTPT: Group-based token pruning transformer for efficient human pose estimation,","venue":null,"work_id":"f32b673d-ae21-469c-aef0-ba176e30ab23","year":2024},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.476398Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:e2416879e2af19728fe34cba6ecb46fd4f08fecec38d61adf58666d0c8968c9d","observation_id":"31755350-e565-4318-9397-8375b1fff6be","resolution":{"observed_at":"2026-08-04T22:55:44.839149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.480375Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.480375Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:6f19e439276266fbba49dee807b69601d7e3798ce826c48ee647c07dd0e29999","observation_id":"8add3375-a0b0-4fa5-8ff6-e363868ba09c","resolution":{"observed_at":"2026-08-04T22:55:44.480375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.484330Z","title":"Very deep convolutional networks for large-scale image recognition,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.484330Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:00033af6cce60adb86326ee0cef013f3e41f6b8fcf4986571e1c8869cc3dcfa7","observation_id":"025de195-5465-4dc4-bbc1-a8eb55e1cd6d","resolution":{"observed_at":"2026-08-04T22:55:44.484330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.800249Z","title":"Study on density peaks clustering based on k-nearest neighbors and principal component analysis,","venue":null,"work_id":"2729b290-e006-4ab5-b497-02cec7798c7f","year":2016},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.488372Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:9caef3cdf21188793fb1ac29277b1477b08a0e2a10cc4a2c55ffab318ca59e5b","observation_id":"ed2c8055-c961-4e8a-b53f-bb351e8a0ebe","resolution":{"observed_at":"2026-08-04T22:55:44.804949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.785587Z","title":"A-ViT: Adaptive tokens for efficient vision trans- former,","venue":null,"work_id":"88300da1-2de5-4321-a2f0-e29e2750cdc2","year":2022},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.492654Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:efed6e299d5454684e25bd995d2dda37c915c7444a37fd2957cc7320408b0c03","observation_id":"9f431092-4a39-4cef-b5b3-79be4d17ca39","resolution":{"observed_at":"2026-08-04T22:55:44.790394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.771271Z","title":"Token pooling in vision transformers for image classification,","venue":null,"work_id":"a7e162ba-f761-43aa-bb24-ca677e6878cc","year":2023},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.496580Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:5d87572685fadfe9ea8b6912e7d99d99d9a181bbef60b14526b7005ae2b98e88","observation_id":"ddf73042-7a9d-4ec4-b425-5baf25628e11","resolution":{"observed_at":"2026-08-04T22:55:44.775728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.500530Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganizations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.500530Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:03e36fd3bdef23ef2c2a59853137c57722ecb8eed181e0953323626d91d7b961","observation_id":"c14766e8-3162-44ee-b7b7-8662a0d84f71","resolution":{"observed_at":"2026-08-04T22:55:44.500530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.745865Z","title":"DiffRate: Differentiable compression rate for efficient vision transformers,","venue":null,"work_id":"d1381429-668f-4745-b69c-91e1e19522bf","year":2023},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.504684Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:1624953bce64705407038ed69eb213abc1be56367d880bdb162715f8a6797a42","observation_id":"709eb1af-6c0c-465a-bcd1-e6402abdd3b1","resolution":{"observed_at":"2026-08-04T22:55:44.750310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.731586Z","title":"Multi-hypothesis represen- tation learning for transformer-based 3D human pose estimation,","venue":null,"work_id":"eb45faa0-0383-4e4c-8485-7b310db90819","year":2023},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.508638Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:e4cd323112be19476a521f05fc7e4459235ff61f40ee9f430121dc0000933c9b","observation_id":"cf2ea3d7-e078-4c4c-830b-dc40279e0c99","resolution":{"observed_at":"2026-08-04T22:55:44.736258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.717619Z","title":"Monocular 3D human pose estimation in the wild using improved CNN supervision,","venue":null,"work_id":"cefd278d-12bf-42d1-909d-2bc90fce431e","year":2017},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.512665Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:aa586035bf61eb8ca146bcfc726af8a304f75b52650baf348590e07cca8d095c","observation_id":"f6694fa0-cd82-48e2-ac50-0490df665126","resolution":{"observed_at":"2026-08-04T22:55:44.721982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.703483Z","title":"GraphMLP: A graph MLP-like architecture for 3D human pose estimation,","venue":null,"work_id":"07e532bf-886b-486d-96df-1f43494e1bec","year":2025},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.516824Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:4c5cbdc592d64623280d9751a11ed9181a9b8555ad319c141a238a78e5d22d67","observation_id":"590cb668-6de6-4437-9ea1-fd361814d127","resolution":{"observed_at":"2026-08-04T22:55:44.707947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.688741Z","title":"Locally connected network for monocular 3D human pose estimation,","venue":null,"work_id":"9bb91a88-7a5b-4a44-bc7d-3243ec9ee1ea","year":2020},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.521081Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:9d25310be9d148e3d17ea10f5b5c740bc621a3602a1e70bd3fd810d125cb66b7","observation_id":"733b872b-2cc8-40a9-b763-72d2b1797d16","resolution":{"observed_at":"2026-08-04T22:55:44.693301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.675142Z","title":"Monocular 3D pose estimation via pose grammar and data augmentation,","venue":null,"work_id":"3db94d02-b368-4f06-aa59-f4870806e3ab","year":2021},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.525429Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:19ba5c8e5be7b253cc6adfb8c704f7a06620d4e3840b088a75e9473812b5ff5f","observation_id":"f9d0d24c-6b35-4d94-8a9a-8c8f73c5ee5a","resolution":{"observed_at":"2026-08-04T22:55:44.679446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.659701Z","title":"Cascaded deep monocular 3D human pose estimation with evolutionary training data,","venue":null,"work_id":"45efb3c9-97e5-452c-ba64-dc2586ca9344","year":2020},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.529400Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:6359ef1e12c7f7b2088a4bc253f2bdcc192d8dab8c5dbdefacc55b3294788afb","observation_id":"01a8b894-ab54-46dd-a1a7-165d20417ddb","resolution":{"observed_at":"2026-08-04T22:55:44.664535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.644228Z","title":"Stacked hourglass networks for human pose estimation,","venue":null,"work_id":"4358e745-076d-42d9-9d8a-21b8bbd0d709","year":2016},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.533256Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:ee787cad9d3f0a187ab56db3247259f345d33e82baa02e5ba66005c8121ba00f","observation_id":"e9f879f7-c10f-43a0-a4db-ad909c30732a","resolution":{"observed_at":"2026-08-04T22:55:44.648705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.629892Z","title":"3D human pose estimation with spatio-temporal criss-cross attention,","venue":null,"work_id":"f1bd293e-98d7-477e-953a-6e9ccb3b1eda","year":2023},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.537351Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:40a7cc6d2320467f545f342790dea43918c660e65c40b27d2a653e9f29a938c0","observation_id":"99557aab-28cd-44ee-b8f7-2ff27b9f5003","resolution":{"observed_at":"2026-08-04T22:55:44.634297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.614637Z","title":"KTPFormer: Kinematics and trajectory prior knowledge-enhanced transformer for 3D human pose estimation,","venue":null,"work_id":"116cfd55-f0b2-47fb-bb71-9e554820a3f2","year":2024},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.541340Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:6122f90d777834d8b409f319f1f2dc99d77bf9073b3cf270b3f3cc72315be0fc","observation_id":"3ecc00e2-7edd-4dd1-afa8-f9e5e502eaf1","resolution":{"observed_at":"2026-08-04T22:55:44.619636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.599611Z","title":"Diffusion-based 3D human pose estimation with multi-hypothesis aggregation,","venue":null,"work_id":"c79bad69-f07c-48bc-aa86-f1c516185246","year":2023},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.545237Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:9533d9ef7da6c88b1541b4f6e42ca4308d00d05dc57c59698df1375b958be436","observation_id":"b2512e1e-6097-4b80-852c-95f7ac736f26","resolution":{"observed_at":"2026-08-04T22:55:44.604436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.582006Z","title":"DiffPose: Toward more reliable 3D pose estimation,","venue":null,"work_id":"fa857865-734d-470d-b230-140f81862313","year":2023},"citing_paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.549338Z"},"links":{"citing_paper":"/paper/2509.06956"},"observation_digest":"sha256:80ac655f1cfd59bf3ba9ee32d680dd1d8231c2ee8a4fbd27184c24b3d1a038c2","observation_id":"9f1a2e9f-c54e-40f0-aa13-113e6938cc00","resolution":{"observed_at":"2026-08-04T22:55:44.588756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.06956","last_updated":"2025-09-08T17:59:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T22:55:43.191100Z","submitted_at":"2025-09-08T17:59:59Z","title":"H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":62},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2509.06956."}