{"as_of":"2026-08-07T19:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1ead91db1485007ea2be4874ecaafdcc877d135c2f4ad9ffb7659acdeb0fbb3e","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T20:17:37.389126Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T09:59:02.669525Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T10:01:23.551556Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2603.22282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.22282","snapshot_observed_at":"2026-06-30T02:16:16.535924Z","title":"UniMotion: A unified framework for motion-text-vision understanding and generation","venue":null,"work_id":"2808abbd-7441-4790-b3a9-f40fc80d4a48","year":2026},"citing_paper":{"arxiv_id":"2605.19578","last_updated":"2026-05-21T10:01:47Z","snapshot_observed_at":"2026-07-06T23:30:16.094579Z","submitted_at":"2026-05-19T09:21:57Z","title":"Lens Privacy Sealing: A New Benchmark and Method for Physical Privacy-Preserving Action Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T05:48:27.584643Z"},"links":{"cited_paper":"/paper/2603.22282","citing_paper":"/paper/2605.19578"},"observation_digest":"sha256:3f7a317d3f899699a5be8cc1de11bc2f7ec6507c894c01a046017204c0b7632d","observation_id":"8dfbacd9-d64f-4e89-8bc3-0a455f53b855","resolution":{"observed_at":"2026-06-30T02:16:16.535924Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2603.22282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.22282","snapshot_observed_at":"2026-06-30T02:16:16.535924Z","title":"UniMotion: A unified framework for motion-text-vision understanding and generation","venue":null,"work_id":"2808abbd-7441-4790-b3a9-f40fc80d4a48","year":2026},"citing_paper":{"arxiv_id":"2605.19578","last_updated":"2026-05-21T10:01:47Z","snapshot_observed_at":"2026-07-06T23:30:16.094579Z","submitted_at":"2026-05-19T09:21:57Z","title":"Lens Privacy Sealing: A New Benchmark and Method for Physical Privacy-Preserving Action Recognition","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T09:59:02.669525Z"},"links":{"cited_paper":"/paper/2603.22282","citing_paper":"/paper/2605.19578"},"observation_digest":"sha256:a25a6190ab44357257c9917a73c31bfd42d784cc824cfd2e762abe2df9fbc651","observation_id":"a2b27680-57d8-4c97-9401-87f2f65f1f26","resolution":{"observed_at":"2026-06-30T02:16:16.535924Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.22282/citation-record","integrity":"/paper/2603.22282/integrity","json":"/paper/2603.22282/citation-record.json","paper":"/paper/2603.22282"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: SIGGRAPH Asia 2024 Conference Papers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:4941c46dc0dad23dba3665a8030a3a3e4112895113d41905bedfcbd7895fe8f5","observation_id":"915c29f4-2d75-437a-9f3d-a369c5aee5f8","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:184e3eb8106bb0ebaec84fd3ad079b380f5281d77882250acd607c6c35cbfd89","observation_id":"0124634b-d250-4b73-9f9f-e467a4689ed6","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"Advances in neural information processing systems33, 1877–1901 (2020)","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:432f37259b3713fb1e22aaafe2fbbdfd4ce0dfd0afbbdec08dcdf99b2591e56f","observation_id":"bc57b51e-0739-424f-8406-f0c81f1e4ff8","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:452b4316e6c5b9961a730ea2a0a78aee4ce9fb1a480c4ea145f5371a7782c66b","observation_id":"070f560e-a438-45a0-8580-6dfbe9c73825","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20340","last_updated":"2024-05-30T17:59:50Z","snapshot_observed_at":"2026-07-06T18:22:57.400982Z","submitted_at":"2024-05-30T17:59:50Z","title":"MotionLLM: Understanding Human Behaviors from Human Motions and Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20340","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:2405.20340 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/2405.20340","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:495c8327802df90f9e11f1de015f5a2129ac6b3a705640ef50f82c936b72ee9b","observation_id":"ca3d3740-6eab-443e-9fd9-2dfdf2a49c07","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:2501.17811 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:dfdbc0669080a8a4cfd123af3a64295060bea8cabf0aec0a40e9797dae606a98","observation_id":"f3820cfb-d8c8-4a15-8c80-ce49a1844bd1","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:5933831d96140c2b0b537d687a21531d67406f4b0c42ef7a9e06666392027183","observation_id":"b00df07d-b247-4537-adbb-9a96cb52dad0","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: CVPR","venue":null,"work_id":null,"year":2093},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:a4e1e0a7cc6bb76fa407e93663136567d919eef5715010f9fbc929863267dd72","observation_id":"065994f0-26ff-4c22-b302-64d7afc53ddf","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: CVPR","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:a2f0d24bb849fd14cd5f3b453085c2faf84c6a0189996c60df647ee5cf91aa17","observation_id":"2f81c7bb-d9fa-4140-a81b-ac759056c364","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-07-06T05:46:07.424788Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:1706.02677 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:5ed77213fba81eabebd8bac9781c02e3bfde06a905bcae968ade40c989d661f2","observation_id":"c8cac93d-4b73-4cb7-88c3-8dd9e8e61852","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":1900},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:7e743308f99d70c5219c13ce5048944a8d6992aaa0fd40019dfbe362728f260c","observation_id":"93ab1e8c-8cb9-45a7-9269-c1a332c01390","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:986e500c73439d55f7a39b0058880462a5fe0648d09c58111918458a081cfc6b","observation_id":"b9d64f48-b25b-4cd7-95c5-bae069b0c18a","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:50d35f4f83d99fceabac4f544bc76813037df478c4a30e9418700804ce1ab82b","observation_id":"642dbc86-3ba8-473a-bba5-9a8a796a3486","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: ECCV (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:d5949422c3c74a18fdb2f0954f06bf116b7e4d3a1d7ebf2789a3f624391c39fd","observation_id":"0f85450c-7789-47de-ad3b-30f8d530b145","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:2511.01463 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:0346bdd82a0dbcc757a5e0a9b323a90ea74a87db06fb95f6b858f011b0f3d684","observation_id":"873edb0b-4d20-40bb-b118-0942dae978ea","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"6m: Large scale datasets and predictive methods for 3d human sensing in natural environments","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:0d8e5bb3ba95909c0eccc91bbc27c935433b9cffcc974e8c0b26e0aff0cf752f","observation_id":"e61a25c6-dc12-479f-a3b4-9f2dfc0cf14b","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"Advances in Neural Information Processing Systems36, 20067–20079 (2023) 16 Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:79e3d5ad59d4cbb8ae55a50bcf9eec64e8c234cdc7f34c312774642be20af12b","observation_id":"15530285-8d16-40b5-9a0f-fe30d5a507ff","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: CVPR","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:9607984ba560c5806f1b3af7d35cb6b281b384749fe426fde5af709410a860c5","observation_id":"cdc66fd3-16eb-4474-b0d7-e46e645a9b67","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:1312.6114 (2013)","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:b1321bc413c57e30e12455ae1f7a702f4a1e1059494dd2b3a6692ca1da9b1aff","observation_id":"b1f7d776-1da7-4e33-abb4-74c06b0c3026","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:ee66e111500478dfef0c06f3c92d336bb8b15471ed30965354c5a7a8fa4f2aaf","observation_id":"2236f21a-25b6-4746-93a2-e218199341d7","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:341f48e8ed2cce0de7f3cde00afdb35711f48a8d0300476da6119a7398febf47","observation_id":"75f3b044-ea93-4136-a94f-cf04e93b6c93","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07093","last_updated":"2025-03-08T06:09:23Z","snapshot_observed_at":"2026-07-06T19:30:34.984716Z","submitted_at":"2024-10-09T17:33:03Z","title":"LaMP: Language-Motion Pretraining for Motion Generation, Retrieval, and Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07093","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:2410.07093 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/2410.07093","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:f410b8100c66f2dafe298f2adb0ee2f949a11c711f3cfb74de6ec58977a3a962","observation_id":"721eba4e-311c-440f-acf6-8d9098bca509","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: The Eleventh International Conference on Learning Representations (2023),https://openreview.net/forum?id=PqvMRDCJT9t","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:4e851b594e48dd81b1117e215a21de2923dd1acffcc3f453a7bc57cc611455e4","observation_id":"3a5f1131-5251-4981-b2d3-e3224be30e6c","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: NeurIPS (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:44baec520eed70831c6043e49b7ddb43e3855d35f368f3c5a2200b1e3b61c5d5","observation_id":"ae0b6daf-3124-4e00-b576-d85c73c1bd94","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01372","last_updated":"2023-09-04T05:43:48Z","snapshot_observed_at":"2026-07-06T16:13:53.775220Z","submitted_at":"2023-09-04T05:43:48Z","title":"DiverseMotion: Towards Diverse Human Motion Generation via Discrete Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01372","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:2309.01372 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/2309.01372","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:cd4c622e4844f167f56c7f0547d900100cac26c1900dcf714d777060a26f45b4","observation_id":"06f6a21e-d3fa-4d45-bda3-95f8b77ecef8","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:05f048de7e5a4a48fb02256c287273c0238ab7fa75201b8765486dee9bdf699f","observation_id":"9705b47c-40dc-495d-9167-9077bc0604c2","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:2405.09818 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:14f26a716dd7c04b1ca9448beaa6ca5f0f4555190bd39ec7d9ae3ebf52d9fc40","observation_id":"aad96bf6-8b56-4bf8-90e4-cd091c3b4a55","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14916","last_updated":"2022-10-03T09:17:41Z","snapshot_observed_at":"2026-07-06T13:57:50.746457Z","submitted_at":"2022-09-29T16:27:53Z","title":"Human Motion Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14916","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:2209.14916 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/2209.14916","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:2909757e82d020f8620818d423c72a3d8121143757606f6b9e147605eb3fa504","observation_id":"5c98c56a-9cd8-4d50-b9e7-cd6276b7ef8d","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"Advances in neural information processing systems30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:68423fe90192e9cf14832249da252a19080961b406ff935c154507477cd19561","observation_id":"5e3a59dd-2c50-4361-b5d3-cfa90305a6c5","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the European conference on computer vision (ECCV)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:43bac7d2ecfcd822d7ca68930d4dde22013ee5d7e749bf531102b566d1f21253","observation_id":"9b80089e-93f7-459b-a49e-4d4183ec29d0","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:2503.20314 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:4fd87d5370c18cf523885457433e6d8d12ac65d7c55aaaa25cb683ad04a2ca6c","observation_id":"47d103d0-969f-4f46-89df-357d5997a92f","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: ICCV","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:1446a7ce016ef3ef0aa8b6dedbd35d1d8c171d99d76df5677085cc474fe8bffd","observation_id":"05856026-1fc7-42eb-a869-ce2b4fb0ea1f","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:9aff25b4cab273cb92fc4328b715f2d09b7b8566e3c04f6fb95dc8b97a09d46a","observation_id":"2e4fc8f9-bb0e-47e0-a51f-87d9f8ae542a","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:91d5c3124ad8f41a7a0143373692701e578fa1ecb527ff1e7ff2c5a308c9001e","observation_id":"2ce0eaed-8352-46c5-80b1-3d38f983364e","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:2410.13848 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:a341446e5330c36d6fc1f2a1cf51aed696c08e0ddc35041118fe2e139f415284","observation_id":"7ff31501-b9df-43b6-abaa-e49adcb39273","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Forty-first International Conference on Machine Learning (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:95c367d1111b9715b001295ec3d029c3f21a0d923d3d771e2231966fdcc0ab29","observation_id":"c94facd2-3b48-4d3a-985e-e7823a624574","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:fd4811a15d35a98d18876e55a297b65aebf6377a11b865c2ebd335723840125c","observation_id":"1989b446-0f0e-4eab-ae86-783c43f4fb40","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15564","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:2506.15564 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/2506.15564","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:e6f7e393d525859aa687465baf53c18c592fefa5e0a3880b9c214eda4ccd3365","observation_id":"54c9d718-9e24-4a32-9b0c-10b8a5bc5cea","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (June 2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:079ce15d9b2007857ea2eccb53e4c29d1383214cba24a63f6b2b1d98c1d94966","observation_id":"bbbfa3fa-2821-4680-9807-d4efca35c01b","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"TPAMI (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:8322c80a0147a377e816a71d086513c661a41cea6d8e338ed268602b41e7a9ce","observation_id":"8dd0f463-2e15-49c1-bb22-79ade85648ef","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:138064887e5fd1d74b8eba7bfe57e82d338d89c596ee15fb3f2721932a1b793b","observation_id":"1940e890-17cd-4f67-921d-eaa4b75325fb","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: ICCV (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:d00dd8513ce2f7635b861da97ac2e52a2c4e1989613222464dcf027017957bf4","observation_id":"23e9ce0c-d0b2-40bf-b0d6-e0aa84d1b98b","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:bcefd96b596844210cf4e952504877c22793cd16eb436d03425107f36f56fea1","observation_id":"81864847-37ea-4227-af7c-f748d5ae8405","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:a9e19365fd978b557a8252e911d4e3c733ea36d0feeff84abb052ad4f7a3ee2c","observation_id":"a0f2fb61-b208-490f-ac5e-d50b8b9c0ef1","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"IEEE transactions on pattern analysis and machine intelligence46(6), 4115–4128 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:ff9df35273060787b55fbf59267ef31359e59acc801053097c35d5932e87ed8b","observation_id":"515b0ede-a67e-4249-acf9-30e8916015a7","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"with his hands out","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:a17f470af7fd3ae5fe2a460a434cfbd0d26c9c3da9a06312fb7238c6ab8d0ddd","observation_id":"b456d4e3-ea94-492b-a221-7f09eefe9bb4","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:46580a772a8efcfabd03bb1808a91291756e0a0840410a50006f29efa1dc399b","observation_id":"203868c6-5b7f-408f-b963-9a0e4e67fb0b","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:fba80c36fbddb67d335c6c3a1c7f908fc056a391d189b879bfd2ad851dbc021e","observation_id":"1a0d2bb6-2e58-4e25-97d6-c62c16fad172","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:bd3949ba7013acc7bd19fbf0f83f97d3e91271c88cab1ba6f91bc2e31a06e8b7","observation_id":"44f58876-ee07-466d-a344-793806d11eb9","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:d36b22fcafc622ee8addb6c76ef72afac62ca43319a4f7084215029f32b51421","observation_id":"07be66af-f3e0-41d6-a823-724a407eea5f","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"7.Global orientation (continuous 6D form): 6-dim","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:202867dbda76883ecbee749aea75ad592e2b863836fcfb1eecf4cb2cc37bde5f","observation_id":"8f02bf4f-2425-4f89-b225-2543d7c6d112","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:3ae694fe5657417b2a80bff7f20b0977b517788cea6e611e1f0cab65489a8963","observation_id":"e6b0ba6d-5773-41e4-aa64-62324a8bd102","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"Describe the motion","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:5a8d35588cb5f868e93f79292c7a216fdfa6e5798853f7b921f8c589b686a70f","observation_id":"b9ca36a0-a1db-4315-9030-895059ad7ac5","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-13T20:17:36.181558Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 2 inbound Pith citation observations for arXiv:2603.22282."}