{"as_of":"2026-08-08T10:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a4e20def34c1efa454aa34601e508b1ffeb0de794838d04424d93c2e40440aed","coverage":[{"denominator":91,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":91,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:48:17.043562Z","state":"measured"},{"denominator":91,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":91,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.20920/citation-record","integrity":"/paper/2505.20920/integrity","json":"/paper/2505.20920/citation-record.json","paper":"/paper/2505.20920"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:09.924564Z","title":"Teach: Temporal action composition for 3d hu- mans","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:09.924564Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:d53473971bc082f7d1dffd0635c059cc32303dfc9ef9a384ba76c2b2686ed625","observation_id":"6a04c1be-3b50-48f9-a3aa-6d6e70c25472","resolution":{"observed_at":"2026-08-07T13:48:09.924564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T13:48:10.034634Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond.arXiv preprint arXiv:2308.12966, 1(2):3, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:10.034634Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:eab50c6ebf679bfe75b52669f622a8d641255e622f43628dadde10d4620e894b","observation_id":"20f56a7f-9e9b-4041-9c62-13c5e3c02fe8","resolution":{"observed_at":"2026-08-07T13:48:10.034634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:10.114885Z","title":"Ac- tion quality assessment with temporal parsing transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:10.114885Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:15af7c155ec6a86c6b7bd88b2f7d68a92a897e6726118c02437fdbf2bb706b83","observation_id":"f1855ea7-529f-4ad9-8e66-2ca7a18ed8db","resolution":{"observed_at":"2026-08-07T13:48:10.114885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:10.177615Z","title":"Implicit neural representations for variable length human motion generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:10.177615Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:4b9f69f3c6bbc13d3634714e153b84be738ef80155c65e69fbd36cf8ec01081c","observation_id":"b59fd234-9607-451d-8ce8-c0a755cf1132","resolution":{"observed_at":"2026-08-07T13:48:10.177615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20340","last_updated":"2024-05-30T17:59:50Z","snapshot_observed_at":"2026-07-06T18:22:57.400982Z","submitted_at":"2024-05-30T17:59:50Z","title":"MotionLLM: Understanding Human Behaviors from Human Motions and Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20340","snapshot_observed_at":"2026-08-07T13:48:10.244869Z","title":"Motionllm: Understanding human behaviors from human motions and videos.arXiv preprint arXiv:2405.20340, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:10.244869Z"},"links":{"cited_paper":"/paper/2405.20340","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:dad5d45aea367ad28c6952a8854b907ca8c0b1bb7bc6eb761da3133318122d0f","observation_id":"778a610e-bda4-495d-a79b-d180f7739efe","resolution":{"observed_at":"2026-08-07T13:48:10.244869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11718","last_updated":"2020-06-21T05:51:37Z","snapshot_observed_at":"2026-08-07T03:03:04.417922Z","submitted_at":"2020-06-21T05:51:37Z","title":"Pose Trainer: Correcting Exercise Posture using Pose Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11718","snapshot_observed_at":"2026-08-07T13:48:10.314111Z","title":"Pose trainer: correct- ing exercise posture using pose estimation.arXiv preprint arXiv:2006.11718, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:10.314111Z"},"links":{"cited_paper":"/paper/2006.11718","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:3f9c81c54023da5c8a530640d970e098d4ce138662100aa09c0768b31a75d08d","observation_id":"ca57b96e-3861-4524-8fc5-a5addd528d5c","resolution":{"observed_at":"2026-08-07T13:48:10.314111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08345","last_updated":"2025-01-06T09:10:55Z","snapshot_observed_at":"2026-08-07T02:26:34.656486Z","submitted_at":"2023-04-17T15:08:15Z","title":"VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08345","snapshot_observed_at":"2026-08-07T13:48:10.413560Z","title":"Valor: Vision-audio- language omni-perception pretraining model and dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:10.413560Z"},"links":{"cited_paper":"/paper/2304.08345","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:f8b5ecd220e1165e51ba11e8e8b3c2962e2a39ddae43d630eeca778f91c0baed","observation_id":"8ce6c9d6-75e6-4b1e-a17a-a4a5be0c0cc4","resolution":{"observed_at":"2026-08-07T13:48:10.413560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:10.501301Z","title":"Vast: A vision-audio-subtitle-text omni-modality foundation model and dataset.Advances in Neural Information Processing Sys- tems, 36:72842–72866, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:10.501301Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:1ea0c198c90be58b9b9305e812fdacbe178186210ea08880fbbaedd1da7cf9df","observation_id":"34b2f955-4cd2-4802-847c-9557cc812b52","resolution":{"observed_at":"2026-08-07T13:48:10.501301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:10.565338Z","title":"Posefix: correcting 3d hu- man poses with natural language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:10.565338Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:ac3efd821db52bb388ba34eb1d66cbd948434a506a7c78bbc12d099705710bad","observation_id":"43231859-4654-4fd6-bf88-baf8537fb9ec","resolution":{"observed_at":"2026-08-07T13:48:10.565338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:10.633738Z","title":"Behavior recognition via sparse spatio-temporal features","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:10.633738Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:d92037785901f7323b44f61dc0d6a31a91ae929ff98fb98807edee5c35f78be4","observation_id":"2db973a8-70d5-4453-a49a-047820280c13","resolution":{"observed_at":"2026-08-07T13:48:10.633738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:10.760959Z","title":"Hierarchical recur- rent neural network for skeleton based action recognition","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:10.760959Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:51cca8b21ecedc833f4d49d6f849a10e88fea6c5dc245e3f83e87cc9683a3778","observation_id":"4e4dc90b-7635-42b4-b240-1c6fc46fbd75","resolution":{"observed_at":"2026-08-07T13:48:10.760959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:10.850580Z","title":"Clap learning audio concepts from nat- ural language supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:10.850580Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:572e25c4ed8601cf4c91207c3f77bcbc98b9bdcadce1a3e57ff1063537b78130","observation_id":"1489a40f-1f6a-4fa6-8b8b-bb7f10d95df4","resolution":{"observed_at":"2026-08-07T13:48:10.850580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:10.909322Z","title":"Motion question answering via modular motion programs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:10.909322Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:98f57e93bac4ea3a0cb31793cbfe77e3abf7ccddd52599e8540292a818bc1c51","observation_id":"c782aa6f-b0b6-472c-be5e-b22c87b436cd","resolution":{"observed_at":"2026-08-07T13:48:10.909322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:10.992617Z","title":"Towards accurate active camera localization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:10.992617Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:d423a2ba87cc6efe5ead250175a2353badf4c663684af212f55c2fb20b3be2e3","observation_id":"417681e7-4df5-4451-9114-711ab491d4b7","resolution":{"observed_at":"2026-08-07T13:48:10.992617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:11.057582Z","title":"Cigtime: Corrective instruction generation through inverse motion editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:11.057582Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:374232b3fe9af4d11c88537f98c423f33ae1e666f9785d9f2bcc54a4b681bd9f","observation_id":"a96723f5-5384-4022-9933-3d07570c428b","resolution":{"observed_at":"2026-08-07T13:48:11.057582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:26.897841Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"bd6d3a38-ee68-46fc-8f56-3a87646d746a","year":2019},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:11.142433Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:148bb66ea76c94eb38511aaa4ffa74af8080d6fb56eb1b74193fe102d34c289c","observation_id":"ff860867-19ff-4e5c-bc38-fb68429e0236","resolution":{"observed_at":"2026-08-07T13:48:26.903825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:26.880719Z","title":"Chatpose: Chatting about 3d human pose","venue":null,"work_id":"2ddde523-dfec-4f26-9101-c56bf50be19a","year":2024},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:11.225495Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:1eb9e6b07530161720086dabb0e62d2e4f8bf21af3e5e6845369ac3c506f194e","observation_id":"3eac355a-cfcc-4cf5-911f-9df17de7310a","resolution":{"observed_at":"2026-08-07T13:48:26.889083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:26.865950Z","title":"Aifit: Automatic 3d human-interpretable feedback models for fitness training","venue":null,"work_id":"c1ccfb6d-c75f-486f-a2d8-51c7685f272d","year":2021},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:11.320638Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:41eabee164be22422575268e98096094722ebd8c5f4c5f476b770e3e33e52176","observation_id":"ea2b70de-3e15-47dc-bbb1-6c4ae6750b3a","resolution":{"observed_at":"2026-08-07T13:48:26.871720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:26.573090Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"3e060723-54a3-4434-a5ea-49324e793831","year":2023},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:11.391368Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:f743434b590f295dffb251f5a21a1e6ceede70fe5225ccab82704621c15643d4","observation_id":"20667788-0537-40e8-a2b5-447e05ac8a1c","resolution":{"observed_at":"2026-08-07T13:48:26.742066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:26.293998Z","title":"Ac- tion2motion: Conditioned generation of 3d human motions","venue":null,"work_id":"1495fa3f-c90d-426b-b336-b5f00e19fad5","year":2021},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:11.475504Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:44ee0d10b1d9fe2b1588a350315d0827f1c73311be11a487d22ab6c25864af6e","observation_id":"51dfab67-7197-434c-aa1f-0087d77241be","resolution":{"observed_at":"2026-08-07T13:48:26.407672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:26.009546Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":"4bdfb34a-30de-4a5f-9b92-df9e403e79b1","year":2022},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:11.547308Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:4de28c4e21440a6c53ccbf52e3780cbfbabaa901063a3d496d98d9175b93c298","observation_id":"4997ba37-e887-4c0a-b5a8-33be0db7c361","resolution":{"observed_at":"2026-08-07T13:48:26.123330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:25.783017Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":"ae54b88a-e646-4fe1-8c18-13b6aa88358c","year":2022},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:11.636934Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:e2a652e03a0662e5fc553903e605fad7b70b0438aab1ba47184be3bb86946ab1","observation_id":"e775fcd9-ebfd-439c-8d60-a8bcd4cb95e9","resolution":{"observed_at":"2026-08-07T13:48:25.893693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:11.730244Z","title":"Tm2t: Stochastic and tokenized modeling for the reciprocal genera- tion of 3d human motions and texts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:11.730244Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:cdd8c93fd60ee53d272d5f411fb61ca205a3d79bf4cf7dea89027c4a85196dc2","observation_id":"e15425d3-6e93-4e05-81ba-f26ababa7d1c","resolution":{"observed_at":"2026-08-07T13:48:11.730244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:25.555010Z","title":"Contrastive learning from ex- tremely augmented skeleton sequences for self-supervised action recognition","venue":null,"work_id":"0e37d86e-2719-4074-8802-86ec11027bbe","year":2022},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:11.815961Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:80d0ad11f4090b778148c7505a35ad48a06cd45fbbab2d26f976320cded5c9ab","observation_id":"b78b7213-7196-48e1-8d36-82aa6765d731","resolution":{"observed_at":"2026-08-07T13:48:25.653995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:25.312807Z","title":"Autoad ii: The sequel-who, when, and what in movie audio description","venue":null,"work_id":"01759ed1-709a-4d71-984f-e313f84b5b7a","year":2023},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:11.935438Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:3a6c2b0000ce9fbb25e1c8c90d04b2e91dca0b7341995bbffa6b238af71b7f40","observation_id":"29a51d22-1927-4a53-9eef-ab08a9b70ff6","resolution":{"observed_at":"2026-08-07T13:48:25.434143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:25.063026Z","title":"Autoad iii: The prequel-back to the pixels","venue":null,"work_id":"69697d1e-c936-4513-94cc-97cf5e2b93b8","year":2024},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:12.033488Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:34707918234ae37c094c9fad67e7eb5a0e50261b82b0200a3e336a3a29c48c76","observation_id":"ba9114fe-6119-4eb3-9b85-ac1b458f5310","resolution":{"observed_at":"2026-08-07T13:48:25.144137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:24.895829Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"a15d99fa-0695-4753-aedb-929e03f5a0d2","year":2022},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:12.126802Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:ca434347ee55fd5b4cb2b4a3452ec83450b8c89aea17c17e82f3ecc3f0c82bc4","observation_id":"b07742b7-366d-4efd-96cc-966dcf1311c4","resolution":{"observed_at":"2026-08-07T13:48:24.973255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:24.781393Z","title":"Phase- functioned neural networks for character control.ACM Transactions on Graphics (TOG), 36(4):1–13, 2017","venue":null,"work_id":"247471ed-3cb1-4e34-94a4-3fb75b46dab6","year":2017},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:12.239768Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:b10b7aa96b1b28f4abdf94965815ab0603525adfa3ab581f3da168888520782d","observation_id":"b482f4d7-6ad4-4402-ae8c-d7f83a1888bb","resolution":{"observed_at":"2026-08-07T13:48:24.817282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T13:48:12.389567Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:12.389567Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:372003f095a77919fa9c05f9ced439aeaeab0525c2e9cbc48c10129aa0cf1391","observation_id":"03b1b41f-5f04-46c5-9cc2-4d0979884ee3","resolution":{"observed_at":"2026-08-07T13:48:12.389567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:12.495813Z","title":"Motiongpt: Human motion as a foreign lan- guage.Advances in Neural Information Processing Systems, 36:20067–20079, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:12.495813Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:404e5c3b2bb4a1723bded6df805310dee1b4a80755b83c49b3f8b7969c91554d","observation_id":"03f14e86-f0ea-4dca-9e3a-63bced0f1254","resolution":{"observed_at":"2026-08-07T13:48:12.495813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:12.639694Z","title":"Hand-object contact consistency reasoning for human grasps generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:12.639694Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:68280c8f35e14cddd42051cb34647812cb6610195aac776299d4a4914954f4a6","observation_id":"e528ae26-35a2-4910-b0f0-dbd5a8e40684","resolution":{"observed_at":"2026-08-07T13:48:12.639694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19609","last_updated":"2024-05-30T01:53:39Z","snapshot_observed_at":"2026-08-05T02:44:58.422991Z","submitted_at":"2024-05-30T01:53:39Z","title":"SMPLX-Lite: A Realistic and Drivable Avatar Benchmark with Rich Geometry and Texture Annotations","version":1},"cited_work":{"arxiv_id":"2405.19609","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.19609","snapshot_observed_at":"2026-08-07T13:48:17.459857Z","title":"SMPLX-Lite: A Realistic and Drivable Avatar Benchmark with Rich Geometry and Texture Annotations","venue":"cs.CV","work_id":"fa613396-d384-46ca-bc34-6fa8c2f93e8f","year":2024},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:12.726047Z"},"links":{"cited_paper":"/paper/2405.19609","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:8642343a015c4c2b45295cdcba7304e4f0aefde9d84f17fd9b294dbe5aaadbbb","observation_id":"64e433a8-cb03-4d13-a276-bf17fe350259","resolution":{"observed_at":"2026-08-07T13:48:17.565477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:12.856895Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video un- derstanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:12.856895Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:dcae7f8c08a5dd73a35b9c8186daa0e1de2b49cc6fd78ea548b382727160daab","observation_id":"9104fc61-8821-44f7-a4be-9cdafa246fb6","resolution":{"observed_at":"2026-08-07T13:48:12.856895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:24.649100Z","title":"A new representation of skele- ton sequences for 3d action recognition","venue":null,"work_id":"0ee9b4cf-7e1d-4175-b5d0-ca4979c5db85","year":2017},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:12.907945Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:6fac1fa5b8c15dae7ade8172c31789f32c74b17460ce9823104503d61b119515","observation_id":"208464c2-a052-4d9d-92b3-afff0104b3fe","resolution":{"observed_at":"2026-08-07T13:48:24.707784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:12.961097Z","title":"Flame: Free- form language-based motion synthesis & editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:12.961097Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:b15be1a4e6135baf5e2f44348fe073ef7192c019b4f62cc55ee129bf4c221853","observation_id":"87faa928-de0b-4a98-b43c-6fe7b6f03427","resolution":{"observed_at":"2026-08-07T13:48:12.961097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:24.535039Z","title":"Danceconv: Dance motion genera- tion with convolutional networks.IEEE Access, 10:44982– 45000, 2022","venue":null,"work_id":"6d5f64b6-f087-47ff-9543-0f1bbe9d055b","year":2022},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:13.005451Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:6f1fdd8e5fc054cadb126b813669df013178582786e308096215382cea92b9c3","observation_id":"ea5edf5d-c586-4251-ab3f-d4051cdb4253","resolution":{"observed_at":"2026-08-07T13:48:24.598734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T13:48:13.085093Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:13.085093Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:69c6795eebcbc879a9fdb3f0efdb0774de27402cbec926bed2f18a1a5eab9b67","observation_id":"1721af8e-1829-47c5-9651-76f8e441ebc4","resolution":{"observed_at":"2026-08-07T13:48:13.085093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T13:48:13.144440Z","title":"Videochat: Chat-centric video understanding.arXiv preprint arXiv:2305.06355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:13.144440Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:1e5b492048aeba30a7b857589f36fcdb063985f472deb09146f1cff125d445a6","observation_id":"57916962-adad-4b7f-9fd7-09b260c88146","resolution":{"observed_at":"2026-08-07T13:48:13.144440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:24.384597Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"a15faf60-3948-46d7-b8d8-4c963a02ca3b","year":2024},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:13.202566Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:8100222a8c4a20df9d3a6b955815f055ff4438f2279255653cd5803e52e5b2d7","observation_id":"cd0b5d30-6ae9-4a28-bdd1-cbb6461c1914","resolution":{"observed_at":"2026-08-07T13:48:24.472147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T13:48:13.245692Z","title":"Video-llava: Learning united visual rep- resentation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:13.245692Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:830694cad90b4bcb4e2824e897fc551c0506847538de398db5a13cbc133d76a2","observation_id":"16f9336b-0b54-4c04-8488-460a6540235f","resolution":{"observed_at":"2026-08-07T13:48:13.245692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:24.245357Z","title":"Motion-x: A large- scale 3d expressive whole-body human motion dataset.Ad- vances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"638f2aea-195c-4ac5-9428-0e31d0d591d3","year":2024},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:13.341764Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:a1ab5d473a362d957d2829bc0f87c693f861a4526bd486a8b8b42ac7760fa114","observation_id":"0b529021-9209-4e40-942b-db8c8cd4b16c","resolution":{"observed_at":"2026-08-07T13:48:24.321591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:24.100369Z","title":"Actionlet- dependent contrastive learning for unsupervised skeleton- based action recognition","venue":null,"work_id":"1052de51-e065-48dd-8694-1440293b375d","year":2023},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:13.427954Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:6ff9689a1a99b30795d62ec27f87dba4a5ec3f1c0ec8053c8073f394b839c549","observation_id":"e6a15de1-018e-4550-b7a3-1cafb400d427","resolution":{"observed_at":"2026-08-07T13:48:24.182622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:23.905738Z","title":"Towards unified sur- gical skill assessment","venue":null,"work_id":"c4a07966-39fe-456e-bd49-56fe84ddeed4","year":2021},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:13.478624Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:13fe9c8d31a8c0fcfad22ba3d8d449fcb508047e26dbe7f315407a5ee622a43a","observation_id":"e4c8e21f-edb1-4d66-b8df-79f53e57b561","resolution":{"observed_at":"2026-08-07T13:48:23.994813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:23.776862Z","title":"Spatio-temporal lstm with trust gates for 3d human action recognition","venue":null,"work_id":"602903eb-8b5a-4f74-9de5-1fbc21dc7498","year":2016},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:13.547011Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:34f7d95378c07f0043a36514dc8021c09bf2f37a12ce7846e56f243d807a5e6e","observation_id":"c5dd6ce4-9680-4d59-b44d-fd72a6387429","resolution":{"observed_at":"2026-08-07T13:48:23.822773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:23.566519Z","title":"Enhanced skele- ton visualization for view invariant human action recogni- tion.Pattern Recognition, 68:346–362, 2017","venue":null,"work_id":"bde72837-585b-476a-8ff9-1c605905cdbd","year":2017},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:13.607043Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:30ea5bcc4310d5939e3418a761ef6a12ac83c6b2096e1d94d398ef6cd459e6de","observation_id":"187ab89a-4c1d-4011-bfd7-2c4d3ab69860","resolution":{"observed_at":"2026-08-07T13:48:23.683090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10606","last_updated":"2024-03-14T14:14:04Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-03-14T14:14:04Z","title":"InfoCon: Concept Discovery with Generative and Discriminative Informativeness","version":1},"cited_work":{"arxiv_id":"2404.10606","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.10606","snapshot_observed_at":"2026-08-07T13:48:17.239708Z","title":"InfoCon: Concept Discovery with Generative and Discriminative Informativeness","venue":"cs.RO","work_id":"be637203-77dd-4cf4-9f87-5ca0031c64e9","year":2024},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:13.659969Z"},"links":{"cited_paper":"/paper/2404.10606","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:6627e3c10a4e4dee6e659f7e219248c805384523ede602559d9215f451a08a5e","observation_id":"d90d895f-741d-4b2e-8605-da08a2e85ae3","resolution":{"observed_at":"2026-08-07T13:48:17.297953Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:23.374823Z","title":"Posegpt: Quantization-based 3d human mo- tion generation and forecasting","venue":null,"work_id":"4cd8c16b-f50a-4639-942b-0366a16e5010","year":2022},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:13.714895Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:9c1e8fb8d48b4d9a56ba5360c25ef5ae2901c0408ad9578b08f255d60ad21f90","observation_id":"00d2d0fb-ce91-421d-9212-bbf7b32180b8","resolution":{"observed_at":"2026-08-07T13:48:23.435492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:23.210332Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval and captioning.Neu- rocomputing, 508:293–304, 2022","venue":null,"work_id":"db01f177-d700-4928-a684-3ae80ddbca0b","year":2022},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:13.805257Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:d3c61d6f2af58c86fac97f26f935fbefdc147fcf4fb766fe83376639e4dd3e19","observation_id":"8f552295-2322-4b0f-8068-6be3fc8388ce","resolution":{"observed_at":"2026-08-07T13:48:23.253372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-07T13:48:13.881665Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models.arXiv preprint arXiv:2306.05424, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:13.881665Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:8f6ab7fad067d33298573e9b0487f24c363c8cc7d4f78c0ecec720c85a0bb075","observation_id":"28359c28-23f9-4524-89dc-45a73fa2755f","resolution":{"observed_at":"2026-08-07T13:48:13.881665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13435","last_updated":"2023-12-13T17:24:10Z","snapshot_observed_at":"2026-07-06T16:51:06.781541Z","submitted_at":"2023-11-22T14:48:30Z","title":"PG-Video-LLaVA: Pixel Grounding Large Video-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13435","snapshot_observed_at":"2026-08-07T13:48:13.947245Z","title":"Pg-video-llava: Pixel grounding large video- language models.arXiv preprint arXiv:2311.13435, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:13.947245Z"},"links":{"cited_paper":"/paper/2311.13435","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:96e354b1c3ab914317cd06b0784a7a6185566816b5c06d5361b50ef241acc93e","observation_id":"d5e98ac8-6eb9-4368-ae87-f5f683df8823","resolution":{"observed_at":"2026-08-07T13:48:13.947245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:22.968701Z","title":"What and how well you performed? a multitask learning approach to action quality assessment","venue":null,"work_id":"4f5b472b-36f5-4c2a-9336-f3d5616e87d2","year":2019},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:13.998154Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:dd3ad9a71061fb7fe567c6a71074d2353d2a9b609cd53d0812260af89d550969","observation_id":"9b0fb8e3-4431-46bb-a5b7-380fcf050f4d","resolution":{"observed_at":"2026-08-07T13:48:23.136730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:22.734800Z","title":"Action- conditioned 3d human motion synthesis with transformer vae","venue":null,"work_id":"af5ccdf1-195a-411a-b995-f94abf6e0142","year":2021},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:14.050854Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:2f2ef9fd32e499aca30ccee0401f611cb4514aa6fbbec6268142aedf3bc73396","observation_id":"c3457ee8-ab87-472d-853d-dca2a07d5498","resolution":{"observed_at":"2026-08-07T13:48:22.873624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:14.094528Z","title":"Temos: Generating diverse human motions from textual descriptions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:14.094528Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:3c11d1e05f7afedafdd111a1a179a924e77e4774828880f8cccea1e72b60113a","observation_id":"da2de4c7-d835-4237-985d-8b695a69468b","resolution":{"observed_at":"2026-08-07T13:48:14.094528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:22.517410Z","title":"Babel: Bodies, action and behavior with english la- bels","venue":null,"work_id":"229e6aa4-d779-4e78-a2b1-b66fd08bed6b","year":2021},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:14.138546Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:b869ff580a33841fa8be57059a5d49f0817a4adc477ebe521063dd2f5093d80e","observation_id":"7a7255e9-6b35-4a8c-b1d6-d10d5156d21b","resolution":{"observed_at":"2026-08-07T13:48:22.607481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:22.343628Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"991902d8-327f-478e-8a42-8d387bb5de40","year":2021},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:14.215738Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:d9f8993bc9f09222d76bd13f9d4073f916e2c1368dce29f5e0c876ee0eaec931","observation_id":"65f19c98-0b95-4647-bcf4-e2983ec9d777","resolution":{"observed_at":"2026-08-07T13:48:22.425341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:22.034314Z","title":"On the benefits of 3d pose and tracking for human action recognition","venue":null,"work_id":"199843d3-e15a-40e4-b615-e968dcb5170f","year":null},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:14.279679Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:ad7d0a7b8947c72f6f61a28db6350bdb6e887d46dec6051c44e38a058cd02c82","observation_id":"831fc922-753d-41b5-aa46-34fb4338c55c","resolution":{"observed_at":"2026-08-07T13:48:22.196705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08396","last_updated":"2023-11-14T18:55:48Z","snapshot_observed_at":"2026-08-01T16:45:41.221853Z","submitted_at":"2023-11-14T18:55:48Z","title":"Zero-shot audio captioning with audio-language model guidance and audio context keywords","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08396","snapshot_observed_at":"2026-08-07T13:48:14.346070Z","title":"Zero-shot audio captioning with audio-language model guidance and audio context keywords.arXiv preprint arXiv:2311.08396, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:14.346070Z"},"links":{"cited_paper":"/paper/2311.08396","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:d28318f1a2b1515e39f39749341b38ac20592763acb8ad9c68a96afe3b0c27a4","observation_id":"7fe7f90a-a16d-4072-87f5-c4acfd15452d","resolution":{"observed_at":"2026-08-07T13:48:14.346070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:21.737980Z","title":"Two- stream adaptive graph convolutional networks for skeleton- based action recognition","venue":null,"work_id":"b99c0b6f-aaed-4fa0-a056-52f1960ab986","year":2019},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:14.405018Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:de3e484b9bb69ec89e384aab93728482945299b4c941ae24a833d9d9b7ec9ae8","observation_id":"8c342166-b30e-4688-bdf9-2c447fdf3826","resolution":{"observed_at":"2026-08-07T13:48:21.862099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:21.573500Z","title":"Neural state machine for character-scene interactions.ACM Transactions on Graphics, 38(6):178, 2019","venue":null,"work_id":"b84643ff-3556-4cfc-9e4a-020125685211","year":2019},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:14.464679Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:c17aee0461ebac0475077b68a364045783e658e30f060bd087252c9f01220d4e","observation_id":"2b58ca6e-3251-406b-bc50-9d004b6fdca0","resolution":{"observed_at":"2026-08-07T13:48:21.647262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:14.523931Z","title":"Local motion phases for learning multi-contact charac- ter movements.ACM Transactions on Graphics (TOG), 39 (4):54–1, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:14.523931Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:31e1aca738e09a0b544d9efdcf514ef131fe1aed696dbd81b89cdbf8c67078cb","observation_id":"3af641c8-f034-457d-b777-cafcd8bcf05a","resolution":{"observed_at":"2026-08-07T13:48:14.523931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:21.338007Z","title":"Deepphase: Periodic autoencoders for learning motion phase manifolds","venue":null,"work_id":"5a4e2cba-b934-47b6-9022-22f00d72e445","year":2022},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:14.601668Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:40fa3f69bf988264ab05c7cd78e2ee5063d6f55d4f800562d8d69cd72521b390","observation_id":"6663db44-167f-4f5f-923c-045a26aecb86","resolution":{"observed_at":"2026-08-07T13:48:21.436539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:21.166849Z","title":"Convolutional learning of spatio-temporal features","venue":null,"work_id":"414daa70-d7b8-4e9c-8413-b8dca32d1d12","year":2010},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:14.704401Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:2fbf09877428d50052f2589e85b4472c91d01ca1c4b71cfbe6be91fffb22af94","observation_id":"d06102dc-abc2-48cb-9248-6985586b7706","resolution":{"observed_at":"2026-08-07T13:48:21.236498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:20.956107Z","title":"Motionclip: Exposing human motion generation to clip space","venue":null,"work_id":"177bc427-a1a7-4363-a6ab-c2a397869100","year":2022},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:14.788254Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:48cf95906a3223e6531cfe22e90f1c8f0715369de61a0db86e9348308ac3dbd9","observation_id":"d1fe6ca9-1bbc-405f-873d-1e16e0da08c3","resolution":{"observed_at":"2026-08-07T13:48:21.032251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14916","last_updated":"2022-10-03T09:17:41Z","snapshot_observed_at":"2026-07-06T13:57:50.746457Z","submitted_at":"2022-09-29T16:27:53Z","title":"Human Motion Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14916","snapshot_observed_at":"2026-08-07T13:48:14.844576Z","title":"Human motion dif- fusion model.arXiv preprint arXiv:2209.14916, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:14.844576Z"},"links":{"cited_paper":"/paper/2209.14916","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:7f49035b862f2cd52251c8f809fda573f8e1d4277f37235631533d7f9915ffa1","observation_id":"5e1ffcd6-416e-4ea7-bf77-1091569b3774","resolution":{"observed_at":"2026-08-07T13:48:14.844576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:14.909199Z","title":"Learning spatiotemporal features with 3d convolutional networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:14.909199Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:d4b3579b23ce54494882b54dd61213e0331a1abbdf4b3f59a9f10ab105154fef","observation_id":"3c5815f4-3f2d-4da3-bc78-a8f56306f38c","resolution":{"observed_at":"2026-08-07T13:48:14.909199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:20.730802Z","title":"Human action recognition by representing 3d skeletons as points in a lie group","venue":null,"work_id":"a930e6a2-73d5-4c0f-bed1-2efa6735afbd","year":null},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:14.987206Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:78aba270216258eb94650c1995d6d545ece46d812e9f7a88ed870d0011bad6d3","observation_id":"56c8bae8-3a4c-453b-a1be-7e88c2a6ed36","resolution":{"observed_at":"2026-08-07T13:48:20.873807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:20.491908Z","title":"Action recognition with improved trajectories","venue":null,"work_id":"9a90276e-327e-442c-a8b5-1d2c6879a4f8","year":null},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:15.061942Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:3696aae95ffb692b580552e644d9d542e96d7c6ccf24e16f19bc82ac6aad45be","observation_id":"06f1a0dd-c61b-4c52-9b0c-a9bd360d9b94","resolution":{"observed_at":"2026-08-07T13:48:20.555895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:20.326610Z","title":"Learn- ing human dynamics in autonomous driving scenarios","venue":null,"work_id":"cfa15e5b-4046-4d1a-9632-e1660b923651","year":2023},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:15.133096Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:ddc20607c7db124f03251d7ba4e325ee8e6ac865a326c841004202288aa9725e","observation_id":"a3db810f-40c1-4d18-ab05-227898ea01bf","resolution":{"observed_at":"2026-08-07T13:48:20.420267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:20.109829Z","title":"Vatex: A large-scale, high- quality multilingual dataset for video-and-language research","venue":null,"work_id":"1e410879-4a93-42eb-ada3-a9bfb8a79044","year":2019},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:15.244074Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:def82c0dfeced149ab4e98a731c410fdf347deb49a74ca212a7a2e6129e7d2a7","observation_id":"59f471f3-70f9-4451-b87b-921b62699906","resolution":{"observed_at":"2026-08-07T13:48:20.259990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T13:48:15.328435Z","title":"Internvideo: General video foundation models via generative and discriminative learning.arXiv preprint arXiv:2212.03191, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:15.328435Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:b92090b5ce7dc582613e43edf691f38711b1f8c9a59e5188f0e80c8d0a592ee7","observation_id":"8401b309-0b16-4b9d-ac1b-30f5586f3016","resolution":{"observed_at":"2026-08-07T13:48:15.328435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15377","last_updated":"2024-08-14T14:31:50Z","snapshot_observed_at":"2026-08-01T19:17:08.239976Z","submitted_at":"2024-03-22T17:57:42Z","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15377","snapshot_observed_at":"2026-08-07T13:48:15.401308Z","title":"Internvideo2: Scaling video foundation mod- els for multimodal video understanding.arXiv preprint arXiv:2403.15377, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:15.401308Z"},"links":{"cited_paper":"/paper/2403.15377","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:4a287db5af7607e79a3e807e65c079bb85e6452a1975842582c74cf2f8ec71cb","observation_id":"c51851bd-3b04-4f8f-9f48-14366c20f7cd","resolution":{"observed_at":"2026-08-07T13:48:15.401308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07918","last_updated":"2024-11-05T02:17:22Z","snapshot_observed_at":"2026-08-06T06:48:37.007528Z","submitted_at":"2023-09-14T17:59:49Z","title":"Unified Human-Scene Interaction via Prompted Chain-of-Contacts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07918","snapshot_observed_at":"2026-08-07T13:48:15.499056Z","title":"Unified human-scene interaction via prompted chain-of-contacts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:15.499056Z"},"links":{"cited_paper":"/paper/2309.07918","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:accefe1d95bc4ad0597794f3cb0ecaf8b845764f4c49239b7ab484d59f26aeab","observation_id":"b6deda1a-9d71-425a-98b1-b0e2b25f293a","resolution":{"observed_at":"2026-08-07T13:48:15.499056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15850","last_updated":"2024-11-21T20:54:35Z","snapshot_observed_at":"2026-07-06T18:50:13.559866Z","submitted_at":"2024-07-22T17:59:56Z","title":"AutoAD-Zero: A Training-Free Framework for Zero-Shot Audio Description","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15850","snapshot_observed_at":"2026-08-07T13:48:15.573298Z","title":"Autoad-zero: A training-free framework for zero-shot audio description","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:15.573298Z"},"links":{"cited_paper":"/paper/2407.15850","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:6b24b8ff43e96d6f60523237711304dabcc8c60a83cde13e71ecbe2989537d9d","observation_id":"be953bc4-6c03-4eb8-8487-f0ea8c17fd8c","resolution":{"observed_at":"2026-08-07T13:48:15.573298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:19.925421Z","title":"Dexterous grasp transformer","venue":null,"work_id":"060821c9-9acd-420a-8008-3b0ab23c4a29","year":2024},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:15.647947Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:3da70025600e86043b6385da24d0c590b80020b636faabdf4b0567e1473467fa","observation_id":"d007fada-1dd1-47bc-89fb-6af1778e96e1","resolution":{"observed_at":"2026-08-07T13:48:20.011797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-07T13:48:15.720080Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning.arXiv preprint arXiv:2404.16994, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:15.720080Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:9e5b406bf8694eebe47a368f6f6e6435e0e747a3e65e45b9578e240081c0ae6f","observation_id":"f76756c4-f32c-49d6-9d50-f76b9c548aa5","resolution":{"observed_at":"2026-08-07T13:48:15.720080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:15.777468Z","title":"Spatial tempo- ral graph convolutional networks for skeleton-based action recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:15.777468Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:4920677e974c2c3415d88ab76df2d940e9c39b9c072818ce9e345f92272c9b76","observation_id":"10c3c04d-cff4-4210-8c7f-e449cfe56b35","resolution":{"observed_at":"2026-08-07T13:48:15.777468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:19.672949Z","title":"Learning to use chopsticks in diverse gripping styles","venue":null,"work_id":"16682ac6-86d8-44dc-b8b6-750b545318dc","year":2022},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:15.830957Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:17aecd4ac49f1608aac3f42c81b0f19ed685da0738530469f4e2918208cd0045","observation_id":"37fd70ca-82b3-4a2e-8099-524b47f3f24d","resolution":{"observed_at":"2026-08-07T13:48:19.789211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:19.398225Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":"85f3da49-685a-4a29-baf9-d02bbd986fc8","year":2019},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:15.910767Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:bfcc241ba37f1884d8e38d0207277b1b01496cae1f84ef7c38e56623460c9e31","observation_id":"d7b03f79-b05b-4883-8c10-c6785a696709","resolution":{"observed_at":"2026-08-07T13:48:19.523041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:19.171254Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"74186833-e37f-458a-b59b-bd4d3d0d0e96","year":2023},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:15.969101Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:e7f7fa85db6f48c1c733e36df6973ff0339657c993a87003903c9cfd108af744","observation_id":"d21bf28c-63a4-4cd6-ac0b-94068ef65ac2","resolution":{"observed_at":"2026-08-07T13:48:19.278946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T13:48:16.029474Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding.arXiv preprint arXiv:2306.02858, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:16.029474Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:f1ff03bafa114dfc40342a9a59aa6718c519ae2252d18c870a976ee55ececc81","observation_id":"5c7172aa-8f9f-46c2-bc77-e4df44dd84ca","resolution":{"observed_at":"2026-08-07T13:48:16.029474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.06052","last_updated":"2023-09-24T17:00:32Z","snapshot_observed_at":"2026-08-05T06:24:11.602674Z","submitted_at":"2023-01-15T09:34:42Z","title":"T2M-GPT: Generating Human Motion from Textual Descriptions with Discrete Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.06052","snapshot_observed_at":"2026-08-07T13:48:16.105127Z","title":"T2m-gpt: Generating human motion from textual descriptions with discrete representations.arXiv preprint arXiv:2301.06052, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:16.105127Z"},"links":{"cited_paper":"/paper/2301.06052","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:d15fae47294e1c7dc4e961d8bb69e43dc0694cbc66dfd0f7ba1d6ed82b6345d4","observation_id":"47b9ecd6-67b5-43ac-b2b8-7def70600694","resolution":{"observed_at":"2026-08-07T13:48:16.105127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:18.959016Z","title":"Motiondif- fuse: Text-driven human motion generation with diffusion model.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":"7002f629-ddad-46f9-af3a-fb31d4c112fb","year":2024},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:16.159016Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:897f07de69775b7024deedbdd1bf13a73a66ee109337ed312c1b425dc4adfaa3","observation_id":"9d0d6c33-8e81-444f-b42b-1d09f4fc4fd7","resolution":{"observed_at":"2026-08-07T13:48:19.045164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:18.774641Z","title":"Pointclip: Point cloud understanding by clip","venue":null,"work_id":"2bc72c12-2c21-4946-9297-2580ba52e0fa","year":2022},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:16.224869Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:0c00ddfbe3e76a257148bb08277503d3c4df99619608e1204e953c6544cab7b8","observation_id":"54025af5-d1e1-441b-94d3-973e27b5fe10","resolution":{"observed_at":"2026-08-07T13:48:18.857074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-07T13:48:16.292122Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention.arXiv preprint arXiv:2303.16199, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:16.292122Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:76e6dc95c0b93661d566ed8b88a0ed87e4c287e8cc586ad5ef92a935a01dff34","observation_id":"3d7d98d9-8c2b-4cdc-943d-70a929f975b8","resolution":{"observed_at":"2026-08-07T13:48:16.292122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:18.637005Z","title":"Streaming dense video captioning","venue":null,"work_id":"14a4ca55-9a74-41bb-92c8-75f64eb5bead","year":2024},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:16.441949Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:b082e28cb1a227e9a845f201cd9f88e5eedcd95f0837bfebae31cb2ba14d5c8e","observation_id":"7d80e39c-03c8-4383-9fbd-44a6bb6f78f5","resolution":{"observed_at":"2026-08-07T13:48:18.710966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:18.459954Z","title":"Avatargpt: All- in-one framework for motion understanding planning gener- ation and beyond","venue":null,"work_id":"56627e67-3026-46e8-a873-970e65a22fa2","year":2024},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:16.539175Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:d478ba86b9850565ab4ab07590a0429193e9e9917dcdd61ad0b48dc052a16345","observation_id":"a48bdeba-b3a4-4799-b1b4-30ab37674bb7","resolution":{"observed_at":"2026-08-07T13:48:18.526788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-07T05:10:33.059352Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-08-07T13:48:16.643392Z","title":"Languagebind: Extending video-language pretrain- ing to n-modality by language-based semantic alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:16.643392Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:003274f7cb49fe21c7a7b99b8a7d1814111d698c6c8fce16a0c677fc7aefcbed","observation_id":"e2d842ec-0c37-4a27-a756-081035a8de30","resolution":{"observed_at":"2026-08-07T13:48:16.643392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:18.269677Z","title":"Limited by GPU memory, we only take 8 key frames for each video following MotionLLM [5]","venue":null,"work_id":"04574cd6-199e-430f-a4a2-35de90532589","year":null},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:16.773797Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:98e5a79f55c23a6f91f10efb58b0b52e0a1783dfad28fff58324c63030740233","observation_id":"15700c2e-c4d9-429e-96b6-bb2ca64ecb9e","resolution":{"observed_at":"2026-08-07T13:48:18.383910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:18.061215Z","title":"Visualizations for Motion Understanding Additional visualization results for motion understanding are provided in Fig","venue":null,"work_id":"7819f5d0-c29b-44db-9e71-cd691226dd74","year":null},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:16.873059Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:c57dcf893356cfdd243f02d09020e9b6dd088774356764f5c0d47aadfff70767","observation_id":"d23a2469-1fb5-4239-8f6e-29726d222219","resolution":{"observed_at":"2026-08-07T13:48:18.128667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:17.811824Z","title":"Evaluation on BABEL-QA Benchmark For the BABEL-QA benchmark, we extend the evalua- tion protocol used in previous multi-modality LLMs evalu- ations [80]","venue":null,"work_id":"9de8a674-05d8-44c8-a2c0-f0dc9eec655f","year":null},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:16.966088Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:905566adb286a1a608ff5569b1da3f78ea071f0eaccf8a626541e444f0d44360","observation_id":"20a2d8f4-4502-4b51-8466-9ff35e6c1ca7","resolution":{"observed_at":"2026-08-07T13:48:17.934458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:48:17.703343Z","title":"Structure of Hyper-Networks We utilize hyper-networksH u andH m, for velocity recon- struction, following InfoCon [46]","venue":null,"work_id":"7c24fa15-fa65-48bd-b08c-48262a41bd75","year":null},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:17.043562Z"},"links":{"citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:c789c5181c1e0a5d789ba77c9a00f1f8712cea61d14765f6f4accbd48e632cea","observation_id":"e97ab098-55cd-4ba2-9b0f-dcf258105aed","resolution":{"observed_at":"2026-08-07T13:48:17.751549Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:41:10.441862Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding"},"reference_resolution":{"displayed":91,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":2,"verified_fuzzy":47},"total_outbound_references":91},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 91 of 91 outbound references and 0 inbound Pith citation observations for arXiv:2505.20920."}