{"as_of":"2026-08-17T04:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b832c1d525513fe23720ffec29466e218a4cc471e8548e1c799b6632f74bd261","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T05:29:32.217743Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.02401/citation-record","integrity":"/paper/2602.02401/integrity","json":"/paper/2602.02401/citation-record.json","paper":"/paper/2602.02401"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:27.310622Z","title":"Posetrack: a benchmark for human pose estimation and tracking","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:27.310622Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:f81c739f9d907759d617f6d734e8dae2917a7dc8ccf00d2c26ebdd3330718b50","observation_id":"1f6b9a6f-bef7-430a-82d0-730b80ae7ed4","resolution":{"observed_at":"2026-08-03T05:29:27.310622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T05:29:27.414903Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:27.414903Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:206cbe6f64adce70b11e19d4318e8e7ae968ff7a76ecc7ad96734f0857743873","observation_id":"ece96d30-de9f-4d1d-9c49-c12928df1fff","resolution":{"observed_at":"2026-08-03T05:29:27.414903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:27.565941Z","title":"Keep it smpl: automatic estimation of 3d human pose and shape from a single image","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:27.565941Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:307de950c2e94a1d4f36bf6b24d74869ec9ff5bb8152141de714b122a6c01430","observation_id":"e6ba9e52-b40a-4ff2-960c-36f1259b1f80","resolution":{"observed_at":"2026-08-03T05:29:27.565941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20340","last_updated":"2024-05-30T17:59:50Z","snapshot_observed_at":"2026-08-16T13:47:37.897675Z","submitted_at":"2024-05-30T17:59:50Z","title":"MotionLLM: Understanding Human Behaviors from Human Motions and Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20340","snapshot_observed_at":"2026-08-03T05:29:27.699878Z","title":"Motionllm: Understanding human behaviors from human motions and videos.arXiv preprint arXiv:2405.20340, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:27.699878Z"},"links":{"cited_paper":"/paper/2405.20340","citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:e9727b8768763aee5790180d1ea3376156d813d75413df838349df6bb4bf7e8f","observation_id":"a3a45041-6704-43b5-98d6-654eeb4c829f","resolution":{"observed_at":"2026-08-03T05:29:27.699878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:27.846420Z","title":"Cascaded pyramid net- work for multi-person pose estimation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:27.846420Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:0bc85a070d5b907ca7a04c2ea770719fb70ccdbfd69b4d7261f52ab1197eb32b","observation_id":"78b118cd-d133-43fb-8f4c-b4b7648ea270","resolution":{"observed_at":"2026-08-03T05:29:27.846420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:27.981867Z","title":"Towards accurate 3d hu- man motion prediction from incomplete observations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:27.981867Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:5824a481366a8bf9f98845c77fd2b8ffdd04bcc07310e9ae1b0964e3183dde33","observation_id":"ca6914ba-3544-45a1-9403-6e1b18e7ac96","resolution":{"observed_at":"2026-08-03T05:29:27.981867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:28.133471Z","title":"Instructblip: Towards general-purpose vision- language models with instruction tuning.Advances in neural information processing systems, 36:49250–49267, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:28.133471Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:b67ca9e3297aceaac4b90aef89766b95934604312641d22585531cc2dbf654ef","observation_id":"fee50f37-e92e-442b-93f2-47224f8551d1","resolution":{"observed_at":"2026-08-03T05:29:28.133471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:28.205559Z","title":"Explore in-context learning for 3d point cloud understanding.NeurIPS, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:28.205559Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:42a6671bf0145778165627e16d5975a0b113a05e0ee196492f951ca01b2850ee","observation_id":"6f7110b5-5e6a-4d23-a7b2-2aa59f869551","resolution":{"observed_at":"2026-08-03T05:29:28.205559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:28.288751Z","title":"Posellava: Pose centric multimodal llm for fine-grained 3d pose manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:28.288751Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:9548fbee3ebe98eb32bc548dc373dd0e9c6c7db819368a2e71373608cec56030","observation_id":"d46faa35-e5a7-4571-9253-ab38f5a9d211","resolution":{"observed_at":"2026-08-03T05:29:28.288751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:28.408920Z","title":"Chatpose: Chatting about 3d human pose","venue":null,"work_id":null,"year":2093},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:28.408920Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:c70667fc5ddb91cd03c1f8a9bfedfd7533f9f722933746c7d8f370be17e45d79","observation_id":"14f5ea1c-c1f5-4ca1-bbb2-54dab34fb079","resolution":{"observed_at":"2026-08-03T05:29:28.408920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:28.521056Z","title":"Robust motion in-betweening.ACM TOG,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:28.521056Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:95b0e6aa3c48c729ec97fec763c3a653ffe599cd7cb195cb5dc3e007d66b8bb4","observation_id":"c104e165-f5ea-4025-8e6b-05a1ddd546a1","resolution":{"observed_at":"2026-08-03T05:29:28.521056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:28.629196Z","title":"Human motion prediction via spatio-temporal in- painting","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:28.629196Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:9dfc4f549aa0863f7062ea7e2bf093b6c76176c61ab4e2da6a71bc747e2578a4","observation_id":"394e920b-b424-4231-a713-48db12f44dc1","resolution":{"observed_at":"2026-08-03T05:29:28.629196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:28.685114Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:28.685114Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:764ca0f0f65145a601deb140fd892023c268ef1f91932bec40e76371413f4287","observation_id":"89b374e9-bbcb-47a9-8cba-8d600788c693","resolution":{"observed_at":"2026-08-03T05:29:28.685114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:28.745560Z","title":"Motiongpt: Human motion as a foreign lan- guage.Advances in Neural Information Processing Systems, 36:20067–20079, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:28.745560Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:7baccf8505db733a7192d20e203369d853fa17ec5ab268d0b054d9654cf6fe65","observation_id":"621d6b57-5efe-485b-9576-ad63e9fa0b66","resolution":{"observed_at":"2026-08-03T05:29:28.745560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:28.821414Z","title":"Convolutional autoen- coders for human motion infilling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:28.821414Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:c95988b1b7e38b4983b0ba45a0311e7f71ff820de67ca387d9e56e7dfe69c404","observation_id":"91507628-b474-419b-b09e-0f8fcbfbae1c","resolution":{"observed_at":"2026-08-03T05:29:28.821414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:28.934565Z","title":"Unipose: A unified multimodal framework for human pose comprehension, generation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:28.934565Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:d0a0bb458cdb2991ead6b2b7c74ea3836f2b1c5727ef076b8ec449a21ddb6b1a","observation_id":"b24c566d-0ef5-4e5a-b279-476b49759be1","resolution":{"observed_at":"2026-08-03T05:29:28.934565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:29.062206Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:29.062206Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:b319dee5034bc6a68b8fad1120864dc6734a48e3e65d029ba12a467c2e645304","observation_id":"dabebcfc-c098-475b-8410-a9de3a14c00f","resolution":{"observed_at":"2026-08-03T05:29:29.062206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:29.105083Z","title":"Recognizing human ac- tions as the evolution of pose estimation maps","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:29.105083Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:660257b1ca200db44571aaca5e8c967237a1a71f3a48132c4ddcaa6ed53eeb3b","observation_id":"a426fce7-66e5-4437-9141-b415cad56e9e","resolution":{"observed_at":"2026-08-03T05:29:29.105083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10897","last_updated":"2025-08-14T17:59:23Z","snapshot_observed_at":"2026-08-15T17:27:34.998439Z","submitted_at":"2025-08-14T17:59:23Z","title":"Human-in-Context: Unified Cross-Domain 3D Human Motion Modeling via In-Context Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10897","snapshot_observed_at":"2026-08-03T05:29:29.172448Z","title":"Human-in-context: Unified cross-domain 3d human motion modeling via in-context learning.arXiv preprint arXiv:2508.10897, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:29.172448Z"},"links":{"cited_paper":"/paper/2508.10897","citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:c2e37dd9f05a3cdb79ca7da9671329ded905b29d0f2ce2171355b6fe7ebc049c","observation_id":"5ffbc221-2af1-4fc3-9a49-a61b4280d17a","resolution":{"observed_at":"2026-08-03T05:29:29.172448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:29.239573Z","title":"Lit- tle","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:29.239573Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:504d8f7b0b168f69f23282577d5992a1d414175a8369b0890d329067e0b06e95","observation_id":"db5b80fd-0152-439e-9d02-dca3daf239c3","resolution":{"observed_at":"2026-08-03T05:29:29.239573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:29.357160Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:29.357160Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:e8dc0f10d61738c3af3301583b49eb502edd74a4ced8ec12e0df3a4aad262e6f","observation_id":"3c48a91e-79dc-421e-8f60-7427f1d66cfb","resolution":{"observed_at":"2026-08-03T05:29:29.357160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:29.477839Z","title":"Ski models: Skeleton induced vision- language embeddings for understanding activities of daily living","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:29.477839Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:6b8e22dae28e511913f0d9f7baa507838d19ad8f2e65b7dafd4a9dfeacc39fe8","observation_id":"afdaa9fc-5697-4a5b-8d59-59fcb4829dae","resolution":{"observed_at":"2026-08-03T05:29:29.477839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:29.578889Z","title":"Deep high-resolution representation learning for human pose es- timation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:29.578889Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:b40e701e7459838d8f6750573def2ad2917328c0eeff757df78bea28a602781f","observation_id":"ed9959e5-9f80-4733-9f89-d8a0716074ea","resolution":{"observed_at":"2026-08-03T05:29:29.578889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:29.742039Z","title":"In- tegral human pose regression","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:29.742039Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:fcc759c9edf09c8c78432e9128ff4e88a633812149a155a7121d1b245ec0c4fa","observation_id":"f532764b-df60-45bd-96d3-3d57a587e26e","resolution":{"observed_at":"2026-08-03T05:29:29.742039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:29.876407Z","title":"Deeppose: Human pose estimation via deep neural networks.2014 IEEE Con- ference on Computer Vision and Pattern Recognition, pages 1653–1660, 2013","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:29.876407Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:0257ccbdce9651f6b04ce290577e2e86b15bc1014c86831820d08a977e0e5d60","observation_id":"8b2b29eb-9619-4a9c-a1ea-c667ae6adcfd","resolution":{"observed_at":"2026-08-03T05:29:29.876407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:30.019846Z","title":"Neural discrete representation learning.Advances in neural information pro- cessing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:30.019846Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:7cfa4455dca0c0de0a9678f37f8fb1b1bdb1f54db9154cb6c4fa58311da41315","observation_id":"df06097c-9d87-4dd4-a404-c7a3eebb1ad0","resolution":{"observed_at":"2026-08-03T05:29:30.019846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:30.155479Z","title":"Recovering ac- curate 3d human pose in the wild using imus and a moving camera","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:30.155479Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:98fcd11709cb15dd96eefc42a989ea377df28a72787ff8ec2d32c4c3c23860d6","observation_id":"a8fa943b-e15e-4b7e-b52c-9b7dbc168b8c","resolution":{"observed_at":"2026-08-03T05:29:30.155479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:30.279452Z","title":"Locllm: Exploiting generalizable human keypoint localization via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:30.279452Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:5ad9e26cc00f77acfbeda0ba67460c54f21c4fb6c6e96e63bf02f5e0d1ddce3f","observation_id":"9591d841-a598-4e4f-8a51-1a22562581b1","resolution":{"observed_at":"2026-08-03T05:29:30.279452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:30.415704Z","title":"Gcnext: towards the unity of graph convolutions for human motion prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:30.415704Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:a7e572d81e619f39e0f9d2a0d9a12f253726cb7f2a2492b278954bababe39bb1","observation_id":"0e71a125-a750-4b63-b246-2103fa2890ef","resolution":{"observed_at":"2026-08-03T05:29:30.415704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:30.593198Z","title":"Skeleton-in-context: unified skeleton sequence modeling with in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:30.593198Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:e64d8f2fe2d26e340b742f3d850ec35251c51a89f8cae2d1637215dbba062e98","observation_id":"6c74d62e-153b-4503-be0c-999ca277b7eb","resolution":{"observed_at":"2026-08-03T05:29:30.593198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:30.743744Z","title":"Dynamic dense graph convolutional network for skeleton-based human motion prediction.IEEE T-IP,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:30.743744Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:275faad4b6e26fc38a0b5e245f19f8da70755b36cce24e04d257abaf8ea9404f","observation_id":"536b7f00-8d20-4e00-adfa-fa4c3817f563","resolution":{"observed_at":"2026-08-03T05:29:30.743744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-16T17:13:28.893408Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-03T05:29:30.854898Z","title":"mplug-owl: Modularization empowers large language models with multimodality.arXiv preprint arXiv:2304.14178, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:30.854898Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:e335f64d7de6207fb12fb3b12e5bb50091ad1f34db74b234b607f171b2ce3241","observation_id":"6521beb8-f74b-476a-a313-c4b183aaa3e8","resolution":{"observed_at":"2026-08-03T05:29:30.854898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21317","last_updated":"2025-06-26T14:32:56Z","snapshot_observed_at":"2026-08-13T16:41:08.226850Z","submitted_at":"2025-06-26T14:32:56Z","title":"LLaVA-Pose: Enhancing Human Pose and Action Understanding via Keypoint-Integrated Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21317","snapshot_observed_at":"2026-08-03T05:29:30.970986Z","title":"Llava-pose: Enhancing human pose and action un- derstanding via keypoint-integrated instruction tuning.arXiv preprint arXiv:2506.21317, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:30.970986Z"},"links":{"cited_paper":"/paper/2506.21317","citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:d43591109a979ded0ba86ba413dc3d19dfef76b77c9f4bd3172efabc3a32f579","observation_id":"f85c847c-4c48-400e-9517-18f61fc12f00","resolution":{"observed_at":"2026-08-03T05:29:30.970986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:31.081631Z","title":"Distribution-aware coordinate representation for human pose estimation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:31.081631Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:80f00067603cdf8e665c3aae2f32a23d083ac1a2625e8d744a205bba5c878b6f","observation_id":"164398b9-3f4c-4ea6-9bcd-4cb014261a64","resolution":{"observed_at":"2026-08-03T05:29:31.081631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02922","last_updated":"2025-02-26T03:17:49Z","snapshot_observed_at":"2026-08-16T13:28:18.358174Z","submitted_at":"2024-08-06T03:15:18Z","title":"Pose Magic: Efficient and Temporally Consistent Human Pose Estimation with a Hybrid Mamba-GCN Network","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02922","snapshot_observed_at":"2026-08-03T05:29:31.217592Z","title":"Pose magic: efficient and temporally consis- tent human pose estimation with a hybrid mamba-gcn net- work.arXiv preprint arXiv:2408.02922, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:31.217592Z"},"links":{"cited_paper":"/paper/2408.02922","citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:9b6a3061676ac557bdebe86527a0759841cd21d9a7e3f624b02c89e9418fb6bd","observation_id":"39ade4f0-06d7-4b8d-8eff-d1eb477b928e","resolution":{"observed_at":"2026-08-03T05:29:31.217592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:31.362629Z","title":"3d human pose estima- tion with spatial and temporal transformers.2021 IEEE/CVF International Conference on Computer Vision (ICCV), pages 11636–11645, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:31.362629Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:c2cb14f095f8accf2cfb519304535347c8130444a0c5b1aef57491957ea9464c","observation_id":"66464e1f-e7bd-42a5-a5c1-0ef8189e9a86","resolution":{"observed_at":"2026-08-03T05:29:31.362629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08891","last_updated":"2020-05-28T05:36:46Z","snapshot_observed_at":"2026-08-09T11:44:11.824890Z","submitted_at":"2020-05-18T17:04:34Z","title":"Generative Tweening: Long-term Inbetweening of 3D Human Motions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08891","snapshot_observed_at":"2026-08-03T05:29:31.523985Z","title":"Generative tweening: long-term inbetween- ing of 3d human motions.arXiv preprint arXiv:2005.08891,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:31.523985Z"},"links":{"cited_paper":"/paper/2005.08891","citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:29ad92f989390df8771aa093d767eb41f73c55e3d370aa1edc2a18a4a67f3546","observation_id":"1381a7cb-7c75-4a26-861d-7eeac39b202d","resolution":{"observed_at":"2026-08-03T05:29:31.523985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:31.682961Z","title":"Mo- tiongpt3: Human motion as a second modality.arXiv preprint arXiv:2506.24086, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:31.682961Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:860cc10e425530025b917f770bebf3da629990d7f2e96561f8188c075354d6bb","observation_id":"26de938a-3df0-4115-9bd6-02be1941d6ad","resolution":{"observed_at":"2026-08-03T05:29:31.682961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:31.838924Z","title":"Motionbert: a unified perspective on learning human motion representations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:31.838924Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:f522218301604436771b22db5a7ebdf30bb67e979d952acb653e30322e51cb68","observation_id":"ec370381-c88b-41b9-9eb4-b651ffcd90cc","resolution":{"observed_at":"2026-08-03T05:29:31.838924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-08-13T17:54:01.724774Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-03T05:29:32.009011Z","title":"looks back","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:32.009011Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:36a7728281ef3f65465dcedd8744a8489790dc5a199eed4a34e9bd5f484f8199","observation_id":"c8a82218-8e00-4bcf-a121-ff233d6999a8","resolution":{"observed_at":"2026-08-03T05:29:32.009011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:29:32.217743Z","title":"Semantic Spheres","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:32.217743Z"},"links":{"citing_paper":"/paper/2602.02401"},"observation_digest":"sha256:8c6073ab497beddc6f221b947643f73ef2b6bf5cef0a46aa19a5b525dc097610","observation_id":"a7b9ecdb-15f4-451d-8e40-77aee9ff1ad9","resolution":{"observed_at":"2026-08-03T05:29:32.217743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.02401","last_updated":"2026-07-07T06:51:43Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T10:34:19.282675Z","submitted_at":"2026-02-02T17:59:01Z","title":"Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2602.02401."}