{"as_of":"2026-08-10T14:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b3c11f5eda16f4987a7598471911a7d6b342926b2c005779f059a517fb55e433","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T19:32:49.921419Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.22702/citation-record","integrity":"/paper/2607.22702/integrity","json":"/paper/2607.22702/citation-record.json","paper":"/paper/2607.22702"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:44.243017Z","title":"Motionfix: Text-driven 3d human motion editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:44.243017Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:ea792458f66009e178192e31c80451322b413bb020a7482694fac79f79a67182","observation_id":"ab93feb6-f8aa-4b83-b6c8-9681d9642887","resolution":{"observed_at":"2026-08-01T19:32:44.243017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:44.284007Z","title":"Make-an-animation: Large-scale text- conditional 3d human motion generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:44.284007Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:f771293359df04b0a8ecb5cef0697f9d3640d9ebbf9f9e8bedc920d5ecb32ddb","observation_id":"078df5a8-8e99-41c1-8bae-5f9ae6495161","resolution":{"observed_at":"2026-08-01T19:32:44.284007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:44.358582Z","title":"Curriculum learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:44.358582Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:8114bc0b83873b4ee475c6e84b8cde2eddad51313d8574af690ab592069b716c","observation_id":"2484e613-4b16-405a-af57-76fd482c42f3","resolution":{"observed_at":"2026-08-01T19:32:44.358582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13120","last_updated":"2025-03-17T12:47:33Z","snapshot_observed_at":"2026-08-08T23:14:18.318450Z","submitted_at":"2025-03-17T12:47:33Z","title":"3D Human Interaction Generation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13120","snapshot_observed_at":"2026-08-01T19:32:44.428125Z","title":"3d human interaction generation: A survey.arXiv preprint arXiv:2503.13120, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:44.428125Z"},"links":{"cited_paper":"/paper/2503.13120","citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:6149a9d2b7f53aaf3245e079937745a4bd2a1d23bd822471b5a942bea314444d","observation_id":"f0eefc67-bbb6-4f97-9ddd-7fe071947e02","resolution":{"observed_at":"2026-08-01T19:32:44.428125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:44.493251Z","title":"Remos: 3d motion- conditioned reaction synthesis for two-person interactions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:44.493251Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:5a2c9abe3352cf007447639a3b99890c9db0c52da999663940b5c2a334521825","observation_id":"33a08abe-b8a3-445b-bf80-057a950bdc8a","resolution":{"observed_at":"2026-08-01T19:32:44.493251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:44.546513Z","title":"Ac- tion2motion: Conditioned generation of 3d human motions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:44.546513Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:392304f29782512a622428144e6e2039eb43f7fd4e2a4094d4e99b30400ba73b","observation_id":"5c03bac5-fb21-46d1-836b-d8c547e19dd1","resolution":{"observed_at":"2026-08-01T19:32:44.546513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:44.621833Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:44.621833Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:42c746fb7de29b8f155b83c26eb50ab83507f075928c45777aaad4f5e3cbb5f7","observation_id":"8364366a-fc8b-406b-ad6a-8c3833a411ba","resolution":{"observed_at":"2026-08-01T19:32:44.621833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:44.677445Z","title":"Momask: Generative masked model- ing of 3d human motions","venue":null,"work_id":null,"year":1900},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:44.677445Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:7714533759a6c0f1e31cb973494e70405edf37e9ed289fd2ff512b7ee9a6de22","observation_id":"dab8a6f4-6b6d-4509-84c4-059d0596df3c","resolution":{"observed_at":"2026-08-01T19:32:44.677445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:44.746113Z","title":"Mdd: A dataset for text-and- music conditioned duet dance generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:44.746113Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:dde907ef02e46815cfb3f502fe41deeab814538268d6fe0939abe501ea3a2065","observation_id":"82556f14-c191-4420-b62b-9e2be32d42d6","resolution":{"observed_at":"2026-08-01T19:32:44.746113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:44.811929Z","title":"Unified multi-modal interactive & reactive 3d motion generation via rectified flow.arXiv preprint arXiv:2509.24099, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:44.811929Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:d4be83fbb16f0a514c7e91e0e56d646fb52ea4fc335894a22ab9d7e5bc3f0a77","observation_id":"bc0d0794-60c4-4039-a56b-180a1b34722a","resolution":{"observed_at":"2026-08-01T19:32:44.811929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-01T19:32:44.827450Z","title":"Gaussian error linear units (gelus).arXiv preprint arXiv:1606.08415, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:44.827450Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:4a6e016fddd68d5bf2e63c1bf2b500b50149c4761305c74b28e9e0f3b75236bd","observation_id":"b08b29f6-fa95-4e57-8aff-101daa60818f","resolution":{"observed_at":"2026-08-01T19:32:44.827450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:44.874605Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:44.874605Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:9bed41cb85a8fce4dc42e89b00fcf726f223c348cb73b76f57ec85f7bbace926","observation_id":"867f482d-b2ea-46b3-9d16-8af3ca56cf7a","resolution":{"observed_at":"2026-08-01T19:32:44.874605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10010","last_updated":"2025-03-02T07:42:20Z","snapshot_observed_at":"2026-07-06T19:32:42.378146Z","submitted_at":"2024-10-13T21:11:04Z","title":"InterMask: 3D Human Interaction Generation via Collaborative Masked Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10010","snapshot_observed_at":"2026-08-01T19:32:44.947121Z","title":"Intermask: 3d human interaction genera- tion via collaborative masked modeling.arXiv preprint arXiv:2410.10010, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:44.947121Z"},"links":{"cited_paper":"/paper/2410.10010","citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:05ad6172d6f26511e6635358208e60d7d471314f722b0fd34b7ca066ad52a693","observation_id":"de56383c-6da3-47b5-bead-b5efdc022730","resolution":{"observed_at":"2026-08-01T19:32:44.947121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:45.022309Z","title":"Motiongpt: Human motion as a foreign lan- guage.Advances in Neural Information Processing Systems, 36:20067–20079, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:45.022309Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:4e6fe529dd6a3f5390c1b6e062b3fa019a512dbfcd5cb3cdf54c9ecbf93f2ae4","observation_id":"6ffd0cfa-91d9-4454-94f3-56590784fd3c","resolution":{"observed_at":"2026-08-01T19:32:45.022309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:45.105767Z","title":"Two-in-one: Unified multi-person interactive motion gener- ation by latent diffusion transformer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:45.105767Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:e2eb6d3f8fe3dd2dd609d0e4359e4174c5aff569dee9ca085fb7bfb428d2c26e","observation_id":"31ab6f48-51b3-4138-8532-23ce7cf338f8","resolution":{"observed_at":"2026-08-01T19:32:45.105767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:45.169816Z","title":"Duolando: Follower gpt with off-policy reinforcement learn- ing for dance accompaniment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:45.169816Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:db66a88623d8f359803d70c7602dc1ee17dbed0495fffaf60a102c4079302be2","observation_id":"1d8448df-fbcb-4855-96c1-b052f2e874bc","resolution":{"observed_at":"2026-08-01T19:32:45.169816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:45.237143Z","title":"Simmotionedit: Text-based human motion editing with motion similarity pre- diction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:45.237143Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:37d06bd88514464bee900168842201ca71a3782f30a218e970627735f22241fa","observation_id":"cd155303-2741-46c2-895f-64608ee62eee","resolution":{"observed_at":"2026-08-01T19:32:45.237143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:45.300414Z","title":"Lamp: Language-motion pretraining for motion generation, retrieval, and captioning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:45.300414Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:429e8bd69cbc23ad8e9f5d7be7e01219c518c99e4cb1d26e40b1a96827f6b424","observation_id":"bc86e464-3835-4e01-9962-a721ceaa6881","resolution":{"observed_at":"2026-08-01T19:32:45.300414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:45.410698Z","title":"Intergen: Diffusion-based multi-human motion genera- tion under complex interactions.International Journal of Computer Vision, 132(9):3463–3483, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:45.410698Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:a202f1ee83c2a9a0f8347247e64716526a64981318f883ad921d2405d8b5d0d6","observation_id":"0b0c8b43-1e53-40f6-9e3e-01fc1a6bfb1d","resolution":{"observed_at":"2026-08-01T19:32:45.410698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:45.573291Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:45.573291Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:0faff0cb7196d8c68b8c3bf3793b43cbc8b4c282285c41239b55b615e289f657","observation_id":"50b802c3-a573-4333-be13-c95eb1a4c428","resolution":{"observed_at":"2026-08-01T19:32:45.573291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-01T19:32:45.622044Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:45.622044Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:b69eea81eb0a5aefa23d2b4a2f52386487e2b163b69576105e28f69d7884f5e2","observation_id":"eca7b3bd-a3dd-4722-b953-09cada8b6d2a","resolution":{"observed_at":"2026-08-01T19:32:45.622044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:45.738133Z","title":"Hierarchical question-image co-attention for visual question answering.Advances in neural information processing sys- tems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:45.738133Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:caa4dc8edd1d3cb1fb7ee7641304a961651d45fcfa5b72af721b7c6445e1c924","observation_id":"a1de4098-56ca-40e1-bef4-b4f7b3970f3d","resolution":{"observed_at":"2026-08-01T19:32:45.738133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:45.861930Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:45.861930Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:38156400c53b90d9cfe900125afecf08fd04d8585d8ac604bc6297b0dd8006bd","observation_id":"a32ecc68-530c-4e44-b695-57a7c65df69e","resolution":{"observed_at":"2026-08-01T19:32:45.861930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:46.018582Z","title":"Rethinking diffusion for text-driven human motion generation: Redundant representations, evaluation, and masked autoregression","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:46.018582Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:dbb9646a3a7b46ba13e604ead66b7a829a4c684e7d2717cf66f598e826f32aa9","observation_id":"2ee5cda4-019e-41cf-b571-2dd1d4fd5d8d","resolution":{"observed_at":"2026-08-01T19:32:46.018582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:46.171781Z","title":"Multimodal deep learn- ing","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:46.171781Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:b5c5fe35881e79cffe6e3987ef5cd3597d650c7020fe8dce54bcf195f2cb8699","observation_id":"b1aed277-8b77-4051-885d-32f3518b5e33","resolution":{"observed_at":"2026-08-01T19:32:46.171781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:46.342582Z","title":"Uniegomo- tion: A unified model for egocentric motion reconstruction, forecasting, and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:46.342582Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:e3bb245159242dd0f9fef452eca379e04a83e676afc578f4bafff86214f7e646","observation_id":"e402b823-cef7-4713-a192-215b84cfc7aa","resolution":{"observed_at":"2026-08-01T19:32:46.342582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:46.509218Z","title":"Deepmimic: Example-guided deep reinforce- ment learning of physics-based character skills.ACM Trans- actions On Graphics (TOG), 37(4):1–14, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:46.509218Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:cafba37ea63972adca5747e30750cc4361fdbe74e2309fc4473d819bffb261c7","observation_id":"68701f89-f47b-42a5-bf57-c45bca8f5164","resolution":{"observed_at":"2026-08-01T19:32:46.509218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:46.683425Z","title":"Temos: Generating diverse human motions from textual descriptions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:46.683425Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:899233dde7bf1bdda6a7717ad1b6f9fef984f4ffead7eb52d041cdec176168a9","observation_id":"e099104e-82c7-4c36-955a-ad689f01b078","resolution":{"observed_at":"2026-08-01T19:32:46.683425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:46.895436Z","title":"Tmr: Text-to-motion retrieval using contrastive 3d human motion synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:46.895436Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:e4ffc99144e9631e627ba31309e7d3f70f2f14be4c29b52bbcdf0161f6f31a70","observation_id":"91025f34-1dc2-4e0f-8fd1-d870bdea645c","resolution":{"observed_at":"2026-08-01T19:32:46.895436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:47.007894Z","title":"The kit motion-language dataset.Big data, 4(4):236–252,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:47.007894Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:19b23a1876477c46c6f3497564323015ff3a0be542cb78a11cf0d0a9c906d8e4","observation_id":"e9772c7e-dd1a-4538-b678-c46194ea7cd0","resolution":{"observed_at":"2026-08-01T19:32:47.007894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:47.147929Z","title":"Babel: Bodies, action and behavior with english la- bels","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:47.147929Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:b1cd113199919a121cae3a8990839e97e771e9bd4e2f8304b24f1fd4cc1dbc80","observation_id":"82575a75-52ce-46b2-86d7-feaaeb13ff4b","resolution":{"observed_at":"2026-08-01T19:32:47.147929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:47.274003Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:47.274003Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:bbb4f6dad0fb6f9c883009bc18769b9a51f255f78f726f5eecaf59c293433c9b","observation_id":"5afc9b63-1e0d-4320-87e8-c9a31b4b83bb","resolution":{"observed_at":"2026-08-01T19:32:47.274003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:47.365828Z","title":"Kimodo: Scal- ing controllable human motion generation.arXiv preprint arXiv:2603.15546, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:47.365828Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:f7a1edafdff01123844f4a7aa8218875de1706a9dc44be1dce0763865c59b863","observation_id":"0332f345-c112-4f70-97ab-97ec20784631","resolution":{"observed_at":"2026-08-01T19:32:47.365828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03343","last_updated":"2026-07-31T11:04:28Z","snapshot_observed_at":"2026-08-06T04:31:10.556748Z","submitted_at":"2025-08-05T11:44:26Z","title":"WaMo: Wavelet-Enhanced Multi-Frequency Trajectory Analysis for Fine-Grained Text-Motion Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03343","snapshot_observed_at":"2026-08-01T19:32:47.532223Z","title":"Wamo: Wavelet-enhanced multi- frequency trajectory analysis for fine-grained text-motion re- trieval.arXiv preprint arXiv:2508.03343, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:47.532223Z"},"links":{"cited_paper":"/paper/2508.03343","citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:5dca297a0d37e75486cc531140e452e9d8bc763ae05462fcc57599ca800ab7c9","observation_id":"70fe3309-2143-404c-96cc-ff9483c23c54","resolution":{"observed_at":"2026-08-01T19:32:47.532223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:47.698188Z","title":"A survey on human interaction mo- tion generation.International Journal of Computer Vision, 134(3):113, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:47.698188Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:981ba1e305eb09708c97957f1d64d9aebba3dab9bba495daa61f76793604386b","observation_id":"8bbf13a1-fd49-478a-aab4-904d03555921","resolution":{"observed_at":"2026-08-01T19:32:47.698188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:47.812117Z","title":"Motionclip: Exposing human motion generation to clip space","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:47.812117Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:b869296f00b597053a3b7896b8682e00b08cd88b9a22ae889bb7e0cca9003c5e","observation_id":"2d9becf6-d943-4100-b087-176c126f404f","resolution":{"observed_at":"2026-08-01T19:32:47.812117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14916","last_updated":"2022-10-03T09:17:41Z","snapshot_observed_at":"2026-07-06T13:57:50.746457Z","submitted_at":"2022-09-29T16:27:53Z","title":"Human Motion Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14916","snapshot_observed_at":"2026-08-01T19:32:47.954813Z","title":"Human motion dif- fusion model.arXiv preprint arXiv:2209.14916, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:47.954813Z"},"links":{"cited_paper":"/paper/2209.14916","citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:411aa86e9a2cf7b806ec879638a45d3cc6b7e4dec1fcaefd15299cbef056a38c","observation_id":"73352c18-4b15-4af3-99f5-3679330ad91e","resolution":{"observed_at":"2026-08-01T19:32:47.954813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:48.033634Z","title":"Multimodal transformer for unaligned multimodal language sequences","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:48.033634Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:0e79419a4d16bbe63f313d70fddba4498135daa87fe40c24f6aff9d1d99a084c","observation_id":"73e0fd86-7100-4cf1-824e-34262740581a","resolution":{"observed_at":"2026-08-01T19:32:48.033634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:48.111950Z","title":"Neural discrete representation learning.Advances in neural information pro- cessing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:48.111950Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:5ded54420cfe1c69a92a253bfcb0e4aa05752fd838701301fc9f8f37ce135745","observation_id":"af24c0f6-e729-4713-b8e7-b88ec1456dcd","resolution":{"observed_at":"2026-08-01T19:32:48.111950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:48.140974Z","title":"Cross-modal retrieval: a system- atic review of methods and future directions.Proceedings of the IEEE, 112(11):1716–1754, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:48.140974Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:adf541a0a64e1ec8e87d374d85bd886ebda0d2222975af9c528555e141536840","observation_id":"187433b3-3580-49f3-af60-2d3d8fcd94ca","resolution":{"observed_at":"2026-08-01T19:32:48.140974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:48.215905Z","title":"Timotion: Temporal and in- teractive framework for efficient human-human motion gen- eration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:48.215905Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:61bb594fe788ac215f44a0d4097ce26f23b5826ad98008748fd08a3ea3a4f415","observation_id":"6bedc6ea-8bf7-4f15-a6b0-b565e33c1bcc","resolution":{"observed_at":"2026-08-01T19:32:48.215905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:48.319231Z","title":"Sampling matters in deep embed- ding learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:48.319231Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:626e55b8c243ed3d2b54c61e7e5c709ae9e33e9cf351256b598a508f7c5df22e","observation_id":"60ca89bb-79b0-44b7-9ccd-d41adb98b2a8","resolution":{"observed_at":"2026-08-01T19:32:48.319231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:48.485962Z","title":"Omnicontrol: Control any joint at any time for human motion generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:48.485962Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:d2e0f086e5ba23b64c2dad2a0650d13af52e576884244f8c0de3d203794ff419","observation_id":"5832d344-e851-4df7-a9cb-d8e41c82efc3","resolution":{"observed_at":"2026-08-01T19:32:48.485962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:48.633026Z","title":"Inter-x: Towards versatile human- human interaction analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:48.633026Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:f261842106f0f915495801801263ed0398e34d9f57383098dc54643808b70038","observation_id":"e89d64cd-1bb5-476b-8757-991996259656","resolution":{"observed_at":"2026-08-01T19:32:48.633026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:48.749934Z","title":"Multi-person interaction generation from two-person motion priors","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:48.749934Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:90f7a81cd6df4d77966a7aef7581c73c15f078c11856c3d8b2f07ab83c8b79b3","observation_id":"248784c9-b22f-4b6e-b9c5-b7a5a6349cfe","resolution":{"observed_at":"2026-08-01T19:32:48.749934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:48.829855Z","title":"Generating human interaction motions in scenes with text control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:48.829855Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:0490cbbb9cb5e807c0c49b53beb2a6f913e0fe713ec555a8676497655cd3d1d1","observation_id":"a67375df-5b78-4e0c-bddb-9122f01e63f0","resolution":{"observed_at":"2026-08-01T19:32:48.829855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:48.981749Z","title":"Generating human motion from textual descrip- tions with discrete representations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:48.981749Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:c53d84eeb2fcb593a01c7c9dd64c699981ab149a4bc253c0a8d325c7ec4c6716","observation_id":"4920af97-a46d-48bc-a87c-55ed805613c9","resolution":{"observed_at":"2026-08-01T19:32:48.981749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:49.122062Z","title":"Sgar: Structural generative augmentation for 3d human mo- tion retrieval.Advances in Neural Information Processing Systems, 38:106931–106959, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:49.122062Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:d007c7d4ee07e197b2e4f9bebd4da69832a946ef623cba24eb257060808a377e","observation_id":"577c1c18-8f52-4831-90a1-2e0628abbcfb","resolution":{"observed_at":"2026-08-01T19:32:49.122062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:49.265977Z","title":"Re- modiffuse: Retrieval-augmented motion diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:49.265977Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:fce554eb533c0dd820367ad55d1212d8909cd198ecc1e61f13661764f59c05b7","observation_id":"1c7fa9fd-9998-42d5-8d58-ad2570207304","resolution":{"observed_at":"2026-08-01T19:32:49.265977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:49.415092Z","title":"Ego- body: Human body shape and motion of interacting peo- ple from head-mounted devices","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:49.415092Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:07904176a75950a4840fd6bb3b5094583db5568cc08a4ccf48315ac8ce39ddf4","observation_id":"74ce3d05-2a58-4ec2-8396-76c6693c3f7a","resolution":{"observed_at":"2026-08-01T19:32:49.415092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.17335","last_updated":"2026-07-12T17:42:58Z","snapshot_observed_at":"2026-07-16T23:18:42.282877Z","submitted_at":"2026-04-19T09:02:55Z","title":"Learning Whole-Body Humanoid Locomotion via Motion Generation and Motion Tracking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.17335","snapshot_observed_at":"2026-08-01T19:32:49.609433Z","title":"Learning whole-body hu- manoid locomotion via motion generation and motion track- ing.arXiv preprint arXiv:2604.17335, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:49.609433Z"},"links":{"cited_paper":"/paper/2604.17335","citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:32577b0f704c292dcecdfea358527aeee6400eb2a835b8492415d77a3d4697c3","observation_id":"16cced24-52e5-4d87-82a6-b00a38fdf38a","resolution":{"observed_at":"2026-08-01T19:32:49.609433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:49.804481Z","title":"Shapetalk: A language dataset and framework for 3d shape edits and deforma- tions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:49.804481Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:7e0713b7a3460550399c6ac20fbc33ee277d3a7d1ea6d7c740676d4fa581ddb6","observation_id":"7ef371dd-dd35-4f15-92bf-94736ba6a933","resolution":{"observed_at":"2026-08-01T19:32:49.804481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:32:49.877913Z","title":"Posefix: Correcting 3d hu- man poses with natural language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:49.877913Z"},"links":{"citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:9e624a82a9e819d0c335f08a01bcd499fb65c7c8e490a432febb0a531536e45b","observation_id":"0a6bb1c7-f0ca-42d1-b1bd-1f817725338f","resolution":{"observed_at":"2026-08-01T19:32:49.877913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.13082","last_updated":"2026-06-29T09:14:05Z","snapshot_observed_at":"2026-08-03T00:58:59.575515Z","submitted_at":"2026-03-13T15:30:51Z","title":"InterEdit: Navigating Text-Guided 3D Dyadic Human Motion Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.13082","snapshot_observed_at":"2026-08-01T19:32:49.921419Z","title":"Interedit: Navigating text-guided multi- human 3d motion editing.arXiv preprint arXiv:2603.13082, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T19:32:49.921419Z"},"links":{"cited_paper":"/paper/2603.13082","citing_paper":"/paper/2607.22702"},"observation_digest":"sha256:77c2255597b2d22860ac45793066125351bdf49459425ec5339b2059ec675fbe","observation_id":"24684253-28c2-4a8d-a5c1-400f639836d0","resolution":{"observed_at":"2026-08-01T19:32:49.921419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.22702","last_updated":"2026-07-18T20:08:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T07:38:53.296418Z","submitted_at":"2026-07-18T20:08:31Z","title":"MIME: Multimodal Interactive Motion Encoder"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2607.22702."}