{"as_of":"2026-08-17T07:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df2e5814f125f2e8d95c938f289350a56d7f9e156f76b1e89e4e3a6e0c987903","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:55:19.714539Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01944/citation-record","integrity":"/paper/2608.01944/integrity","json":"/paper/2608.01944/citation-record.json","paper":"/paper/2608.01944"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.406201Z","title":"Communication, Simulation, and Intelligent Agents: Implications of Personal Intelligent Machines for Medical Education","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.406201Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:71d5addf7f6e6c3a49c2fe01ee084e807927ea8566eb5fe8f5f979f5d9731982","observation_id":"c316f3e0-5ed7-4045-8119-d2213561d3a5","resolution":{"observed_at":"2026-08-04T17:55:19.406201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.411301Z","title":"Classification Problem Solving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.411301Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:6bf8bee6ff3fea88a0698e0eab5a5becff792a66c6b7d1c516dfd80b39ac3825","observation_id":"4e68b746-dbd0-4e19-87f1-9150a7884f18","resolution":{"observed_at":"2026-08-04T17:55:19.411301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.415791Z","title":", title =","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.415791Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:37777b9f4ae0ac8d3682f9061e66ec70d0ec50605fe0bf182666331a36e34f52","observation_id":"6ae3583a-db13-47b4-8a67-feada3b02c83","resolution":{"observed_at":"2026-08-04T17:55:19.415791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.420364Z","title":"New Ways to Make Microcircuits Smaller---Duplicate Entry","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.420364Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:f8e047c8f936134475750cf20f1a45d8eedd905e018e069d0a48173879843fbf","observation_id":"5f535607-69b9-452c-9d73-53ca44a2513b","resolution":{"observed_at":"2026-08-04T17:55:19.420364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.424584Z","title":"Clancey and Glenn Rennels , abstract =","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.424584Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:a25724f9048669a8aaef1e69fb8947a9feeb2de2c510ff62cfd4d9f0c8c81c0e","observation_id":"4a4b830b-8cb9-42e2-a134-500b938b8c25","resolution":{"observed_at":"2026-08-04T17:55:19.424584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.429299Z","title":"and Rennels, Glenn R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.429299Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:3f05c9fcc2011347047841c75d4c304c4d2e47ec06341997ed9d1219dacd4d2f","observation_id":"1af77669-36ae-40f4-8267-a412507b6d50","resolution":{"observed_at":"2026-08-04T17:55:19.429299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.433780Z","title":"Poligon: A System for Parallel Problem Solving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.433780Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:d5cf7f5a5d9d5a24b1023b652868d2f1be7b66e969a306ba85882f81a359dbd4","observation_id":"9eab829e-53a6-4566-a4df-0e553a0c8b90","resolution":{"observed_at":"2026-08-04T17:55:19.433780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.438304Z","title":"Transfer of Rule-Based Expertise through a Tutorial Dialogue","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.438304Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:73a43f9b234f0a6223df26caca778ca181087171c8d136372e95a5470616909b","observation_id":"1e825180-2cf5-4acd-b585-f505b5e1244c","resolution":{"observed_at":"2026-08-04T17:55:19.438304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.443500Z","title":"The Engineering of Qualitative Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.443500Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:2d45568a6ae731b4fe90795930741c172bc836c1e16bed6b0f3b760079d7874c","observation_id":"55621505-9df0-441e-9d83-38511cbc32a0","resolution":{"observed_at":"2026-08-04T17:55:19.443500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.447880Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.447880Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:abbaf7f0a4b4b755ef0f8d80becc8596a9002d69c611a63b0ac8724926eaa8b9","observation_id":"867725f0-158f-4a64-98e3-f9650572e46c","resolution":{"observed_at":"2026-08-04T17:55:19.447880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.452519Z","title":"Pluto: The 'Other' Red Planet","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.452519Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:bffe519296614c38a3e1ca8b21c68b949b30e9b74ff0413640085e6b0a8dbbaf","observation_id":"b1acab0e-0136-413e-b557-7793f6ae7d0b","resolution":{"observed_at":"2026-08-04T17:55:19.452519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.456615Z","title":"ICLR workshop on deep generative models for highly structured data , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.456615Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:890c2c6ae90a1e2cc0d68fb6bb3d44ac2b78794eb768315ceea56c4a57429785","observation_id":"ac596da4-23b9-41f4-84b2-38320fb70ea0","resolution":{"observed_at":"2026-08-04T17:55:19.456615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-16T12:52:49.101262Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-04T17:55:19.460765Z","title":"arXiv preprint arXiv:2311.15127 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.460765Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:64c35d75c5cba725e0a124c0edd9d8c30e24aa568a0e6639c7e0d645ff6817f8","observation_id":"55c654e4-6f78-41f7-8b54-973e7ffc73cf","resolution":{"observed_at":"2026-08-04T17:55:19.460765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.465499Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.465499Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:a00db3a57cd973574c0820d5f4aaa4c5c957728c7905dd5974583e5fabf46204","observation_id":"d25c82cd-c5ee-4b47-aaf1-6583ec843de6","resolution":{"observed_at":"2026-08-04T17:55:19.465499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-17T00:17:14.438252Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11325","snapshot_observed_at":"2026-08-04T17:55:19.469516Z","title":"arXiv preprint arXiv:2501.11325 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.469516Z"},"links":{"cited_paper":"/paper/2501.11325","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:514e8c1631cb702815271a20daeabe01f7cc695a0c971df80655375a61f83257","observation_id":"5e1943a3-2872-4aa0-897d-08668255fe95","resolution":{"observed_at":"2026-08-04T17:55:19.469516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.474003Z","title":"Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) , month =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.474003Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:bb0546a90b8ce295ebfc0e0957d298b098f540ee8265f1f4b06269bf85579ad9","observation_id":"6cd4fafb-afc7-46dc-8dff-bdb6b2a95349","resolution":{"observed_at":"2026-08-04T17:55:19.474003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14977","last_updated":"2025-04-21T09:09:21Z","snapshot_observed_at":"2026-08-16T13:52:36.717284Z","submitted_at":"2025-04-21T09:09:21Z","title":"RealisDance-DiT: Simple yet Strong Baseline towards Controllable Character Animation in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14977","snapshot_observed_at":"2026-08-04T17:55:19.478448Z","title":"arXiv preprint arXiv:2504.14977 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.478448Z"},"links":{"cited_paper":"/paper/2504.14977","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:aed2736abcd763fcc2139159b92df3bd6b5a869442bbcbf8252e9708da16f550","observation_id":"248b0822-583b-46b8-9ee5-a4564cf405b8","resolution":{"observed_at":"2026-08-04T17:55:19.478448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06202","last_updated":"2024-09-10T04:14:11Z","snapshot_observed_at":"2026-08-16T13:19:54.079878Z","submitted_at":"2024-09-10T04:14:11Z","title":"RealisDance: Equip controllable character animation with realistic hands","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06202","snapshot_observed_at":"2026-08-04T17:55:19.482839Z","title":"arXiv preprint arXiv:2409.06202 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.482839Z"},"links":{"cited_paper":"/paper/2409.06202","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:84203e37e836369b543926a11d628fee7b888a11f17411acc3546a32329cf25a","observation_id":"ec7023fe-9ede-45a9-bb20-aeb1a01c41ed","resolution":{"observed_at":"2026-08-04T17:55:19.482839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.487593Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.487593Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:95cffe02d69895ac072ec70d2cd8ea99c2a896ac24b94bf281119cb32e020992","observation_id":"0bede6f5-e7b4-4e59-850e-0ad41425a9e2","resolution":{"observed_at":"2026-08-04T17:55:19.487593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.492567Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.492567Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:e881f95149793e1465f1f1cb436a9ae4cd06ae26a838218753329d7b5d8219b1","observation_id":"5a5c15a0-a319-483b-9e9c-1420bd3a8b1d","resolution":{"observed_at":"2026-08-04T17:55:19.492567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.497338Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.497338Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:c9361830ac926029c43301e4a305f6ab0c1d6c6c53002e52974209b97ecf521e","observation_id":"bae3eb34-dda3-4df3-9779-c75fdd313f3f","resolution":{"observed_at":"2026-08-04T17:55:19.497338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.501751Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.501751Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:8c0fd37b27696c5da9bce615632d0223368eb1b25f90b3ee3b27c20d1772cadc","observation_id":"e7e2668a-6e12-412a-9d47-279fb2c81e7f","resolution":{"observed_at":"2026-08-04T17:55:19.501751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.505874Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.505874Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:9890551c4ae376ef0e25c3efc14f3df1650fe3532789303c25384f34c5de24c3","observation_id":"a3e40bb2-0e6f-493d-a417-6aea457936a7","resolution":{"observed_at":"2026-08-04T17:55:19.505874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.10804","last_updated":"2026-08-05T01:57:13Z","snapshot_observed_at":"2026-08-13T04:21:58.755533Z","submitted_at":"2026-06-09T12:49:34Z","title":"SCAIL-2: Unifying Controlled Character Animation with End-to-End In-Context Conditioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.10804","snapshot_observed_at":"2026-08-04T17:55:19.510168Z","title":"arXiv preprint arXiv:2606.10804 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.510168Z"},"links":{"cited_paper":"/paper/2606.10804","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:2bc75e13361a0395573e9f82ec7f90c5988c7b876fb21e91fdf8db56437f9a54","observation_id":"d020ff75-5cbb-42a0-90e0-da5833f4d97b","resolution":{"observed_at":"2026-08-04T17:55:19.510168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.515118Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.515118Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:0f3a84f29f3ea5d43385ec4533808b1f3ac134a39e878367d8a0c805a9e9ea26","observation_id":"3b073e8d-ed8b-4fb6-af2e-453b8e0efe20","resolution":{"observed_at":"2026-08-04T17:55:19.515118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-08-16T17:39:09.604516Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-08-04T17:55:19.519320Z","title":"arXiv preprint arXiv:2404.02101 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.519320Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:5950c10db39469210038e7367b6550cb3a60411f275bdd653dabd9059c49628c","observation_id":"fbc96dd1-5f5f-4b3f-8a6b-3feb33fe39a7","resolution":{"observed_at":"2026-08-04T17:55:19.519320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.524312Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.524312Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:0e56426b353214ae403ed0fa9ee14afd7bf1cee6360ef76cf9766f895d201852","observation_id":"cabec608-af36-4249-9566-c114667ca8f3","resolution":{"observed_at":"2026-08-04T17:55:19.524312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.528498Z","title":"Proceedings of the SIGGRAPH Asia 2025 Conference Papers , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.528498Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:babd727992ad7ebc4fb5b2fc823ff93f0538fba824cd042244e05344e2331d6c","observation_id":"e67a6c18-89a0-409f-b896-7f405e85b51f","resolution":{"observed_at":"2026-08-04T17:55:19.528498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-04T17:55:19.533112Z","title":"arXiv preprint arXiv:2503.20314 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.533112Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:72689f0576259042705d864752ccb6d5a75d482153b68cc6cd0f1a94ec9c9813","observation_id":"503fecdd-553f-4a35-82a1-539dabd76a3c","resolution":{"observed_at":"2026-08-04T17:55:19.533112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-17T06:56:20.644738Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-04T17:55:19.538342Z","title":"arXiv preprint arXiv:2104.09864 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.538342Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:561231b3ffaff4ffd989f95cbb41b8e36efac862bc3ae22c2741b25d36a02012","observation_id":"35085b95-4ba4-423f-9b86-1f0408470972","resolution":{"observed_at":"2026-08-04T17:55:19.538342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.542484Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.542484Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:aba40c2c18cbf35f08661b17cf470692d02060887cf09f979486b9d1de99e6d1","observation_id":"8c053511-dca5-4e6e-99bd-909bb90076a9","resolution":{"observed_at":"2026-08-04T17:55:19.542484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05098","last_updated":"2025-01-09T09:37:27Z","snapshot_observed_at":"2026-08-13T18:50:06.849147Z","submitted_at":"2025-01-09T09:37:27Z","title":"Motion-X++: A Large-Scale Multimodal 3D Whole-body Human Motion Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05098","snapshot_observed_at":"2026-08-04T17:55:19.546632Z","title":"arXiv preprint arXiv:2501.05098 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.546632Z"},"links":{"cited_paper":"/paper/2501.05098","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:42e035768b9de6c64e1481ee92e1c46461902a0932c7b438a56cb82172eeaf6a","observation_id":"318e21b9-733a-4a28-a69a-1f6ff5f537f8","resolution":{"observed_at":"2026-08-04T17:55:19.546632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.551303Z","title":"The eleventh international conference on learning representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.551303Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:4c1c57e96eb8363b3baa849a4aac16f47f0577d01fb4360335d44f8a9e8a2c81","observation_id":"a1bc2924-1ed8-44f8-8905-60e3d79b44ae","resolution":{"observed_at":"2026-08-04T17:55:19.551303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.555550Z","title":"Computational Visual Media , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.555550Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:f4c0a7f56a2dc99c89aae4e531702fe21d3be8e171c3743dcfb895ba37b985c3","observation_id":"bf999bd1-19d3-48cd-8f47-3d0f4c5c2643","resolution":{"observed_at":"2026-08-04T17:55:19.555550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.559837Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.559837Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:aff8fa1ff3632cb9bb5cd09babe4917d5086a0f9ef718d745f34f7e10975e229","observation_id":"4b0b85d3-5b58-4933-95ff-34322e53f7b8","resolution":{"observed_at":"2026-08-04T17:55:19.559837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-08-15T23:16:19.228206Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-08-04T17:55:19.564018Z","title":"arXiv preprint arXiv:2511.10647 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.564018Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:670793c24a25c9d1a59b535fd5c554f8621e8a5b8545e572da1fdac8e37cbe75","observation_id":"3ad60806-3ace-4321-92bd-76a64e07175f","resolution":{"observed_at":"2026-08-04T17:55:19.564018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.568411Z","title":"The journal of machine learning research , volume=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.568411Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:afb5ec2a55d1c1477540f73912ef4cb831effa2207baf6bfbdbbb44d9e2df937","observation_id":"b26fcbde-0198-46cd-b7e3-99d10cc50d44","resolution":{"observed_at":"2026-08-04T17:55:19.568411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-08-16T18:58:56.056540Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-08-04T17:55:19.572932Z","title":"arXiv preprint arXiv:2604.14148 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.572932Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:642ae2d22e853a2f44ed89cf1d073144db0aba7017012b14242443d6b33a3f3b","observation_id":"75bc52f1-1408-462c-8916-fa3e61f5c72e","resolution":{"observed_at":"2026-08-04T17:55:19.572932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.577597Z","title":"Proceedings of the SIGGRAPH Asia 2025 Conference Papers , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.577597Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:4f782f4bc250460d06351128cf915b301dd9e58729b66cfaee86250237ebe409","observation_id":"5a81f53b-ff9c-4732-b6cf-6d68c311b58a","resolution":{"observed_at":"2026-08-04T17:55:19.577597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.583353Z","title":"arXiv preprint arXiv:2601.05138 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.583353Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:93cd875eb1d25938174c19ddacf2b58f0722cb88709dfc831186c1faca61abc4","observation_id":"b1d85eb1-9a9f-457d-8064-e79518ac499c","resolution":{"observed_at":"2026-08-04T17:55:19.583353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.588369Z","title":"IEEE Transactions on Visualization and Computer Graphics , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.588369Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:5d6ebf8c5053cbc65e530c1faa085483a78a4fcbc34538002010a5f24e9af66e","observation_id":"88999b08-250f-466a-a8bf-ce4cc162b6f9","resolution":{"observed_at":"2026-08-04T17:55:19.588369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.592589Z","title":"arXiv preprint arXiv:2602.15989 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.592589Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:1bd94ede31168daedb86fddef2ec3b394d8ce33b1623de394dfcc8b829f93e21","observation_id":"c9c8f06e-d699-4a11-bc75-338afe8f04db","resolution":{"observed_at":"2026-08-04T17:55:19.592589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.596692Z","title":"China University of Mining Technology Beijing Graduate School , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.596692Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:dffcc263fe9ffaa98a0dfd5f33bc22c096ac12ab37e2969cb5f2007abdbe4df7","observation_id":"9b2f2b9d-60ab-4966-81d5-2c74dca93a1b","resolution":{"observed_at":"2026-08-04T17:55:19.596692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.601013Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.601013Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:bce1b080943b70dd588c8898ffebac4d59715894fbafba6c679d92867faa7781","observation_id":"515120aa-7e04-4962-b631-2c614d8262f8","resolution":{"observed_at":"2026-08-04T17:55:19.601013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.606074Z","title":"On the content bias in fr","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.606074Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:5b540c32572e3fa9eb8d91ba910b4fbf4d83cec546045c634b9ff9f4f4c44aa2","observation_id":"a1516324-1a17-4179-86d8-e0227548d6f1","resolution":{"observed_at":"2026-08-04T17:55:19.606074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-16T13:38:51.127960Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-04T17:55:19.610372Z","title":"arXiv preprint arXiv:2406.19680 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.610372Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:65a84186a8c2ed27f830fb35ce4a686456c590e6cf271d6c57a08a9c67dd40f3","observation_id":"c9fc0812-7dc7-475b-aff9-d548cb658ebd","resolution":{"observed_at":"2026-08-04T17:55:19.610372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.614889Z","title":"Proceedings of the Special Interest Group on Computer Graphics and Interactive Techniques Conference Conference Papers , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.614889Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:fa5009275b91854b0ef2c37de2b1f761069b8e2d4c459a293323f28fe69a2f41","observation_id":"44cea419-8af4-46f1-abaf-2e5aad3303b2","resolution":{"observed_at":"2026-08-04T17:55:19.614889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.621118Z","title":"Science China Information Sciences , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.621118Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:b37a7fae2bc4b54a0450e734a5a536462a6f4205a57ef83fed8d8919b4668465","observation_id":"52436f48-fae9-4f2d-8deb-81e77629b3ae","resolution":{"observed_at":"2026-08-04T17:55:19.621118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.625690Z","title":"arXiv preprint arXiv:2509.14055 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.625690Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:882a4fd314f3a083969ac8e3955f93f33aa4f5eac2f78c9e81797e6a7c0c3477","observation_id":"7651121d-3c00-468c-877b-0aa7307e728c","resolution":{"observed_at":"2026-08-04T17:55:19.625690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.629850Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.629850Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:e21339670a7c06312621db4ed21b6d235f88c02180800a18c10e4f6859fe776b","observation_id":"61bc3dd5-ad07-4128-b03e-c62a2abe7a78","resolution":{"observed_at":"2026-08-04T17:55:19.629850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.634070Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.634070Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:b8f14db475ef0d3a4cb15d17cf43f3dfa358fb14748aa0167f84b2c9c84f385b","observation_id":"276a78c7-280e-45df-94f9-98cea33e7cd8","resolution":{"observed_at":"2026-08-04T17:55:19.634070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.638241Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.638241Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:e0f9adb6be52a899e2116d57f4911ee242e86ae7f847e681a87f1adae539cad5","observation_id":"0d3b3454-837b-4960-8932-00f6d7f3d668","resolution":{"observed_at":"2026-08-04T17:55:19.638241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10306","last_updated":"2024-12-11T02:55:31Z","snapshot_observed_at":"2026-08-17T02:05:24.887374Z","submitted_at":"2024-10-14T09:06:55Z","title":"Animate-X: Universal Character Image Animation with Enhanced Motion Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10306","snapshot_observed_at":"2026-08-04T17:55:19.642542Z","title":"arXiv preprint arXiv:2410.10306 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.642542Z"},"links":{"cited_paper":"/paper/2410.10306","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:ba7199df06b14eae58aff20586aa42cdd8f5e19a409bdf227933395680c69360","observation_id":"de2a6a73-0c6c-487e-99c5-db0b20614fdd","resolution":{"observed_at":"2026-08-04T17:55:19.642542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.647007Z","title":"Seminal Graphics Papers: Pushing the Boundaries, Volume 2 , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.647007Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:00f9c11583178f8e324735505a15bb5d325d4248b4c2b32966da1267fd097384","observation_id":"510a23f8-dedf-4ce3-a4e7-f383dbf3cc8e","resolution":{"observed_at":"2026-08-04T17:55:19.647007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.651121Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.651121Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:046f1e8c9493e0a5f19ace67cf0b5c1dbc02938b6759ee772fffc4eed959a532","observation_id":"95c20330-930f-4a4b-bac3-376043aca542","resolution":{"observed_at":"2026-08-04T17:55:19.651121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.655786Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.655786Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:6c1019e712f574c9dea221080067200d67c96780d7bcd00d3b2ad60d86e458ec","observation_id":"24f63585-b0f0-4926-a555-ee75db458ef7","resolution":{"observed_at":"2026-08-04T17:55:19.655786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.660683Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.660683Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:e3528e07adcbfe30097abdc711ad3faadcad0a5abeb87e26c0d49276fe6421b8","observation_id":"2c2a270a-0a70-40bc-b256-86186d00bccb","resolution":{"observed_at":"2026-08-04T17:55:19.660683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.665326Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.665326Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:21ea0475da2b59774df2744c948adc7b84c1abcb0dbcc9ae16734ff13605a68c","observation_id":"05c3b670-8baf-49a1-845b-7a1071c37c0b","resolution":{"observed_at":"2026-08-04T17:55:19.665326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.669943Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.669943Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:08697c59adb2716ee35b4c13943046ff3beeea0f535f05be655022eeb3defd32","observation_id":"055ffed6-51f5-49f3-acf1-3d42777c6e16","resolution":{"observed_at":"2026-08-04T17:55:19.669943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-13T21:19:07.777045Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-04T17:55:19.674234Z","title":"arXiv preprint arXiv:2412.00131 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.674234Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:bfbefae38738469ae1f217a9b8f52003e98709ea8caa61d3e3354f8d38a68473","observation_id":"76259ac3-ccd3-4139-aeb9-b9efd11f0efc","resolution":{"observed_at":"2026-08-04T17:55:19.674234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.679200Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.679200Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:830dc0066792766f648ba0daf1d3db487a18dbc8ecbf0914d21885332ee8f1c2","observation_id":"5ea5773e-ced3-4fa1-8bc3-4e3561ed9020","resolution":{"observed_at":"2026-08-04T17:55:19.679200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.683735Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.683735Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:6834df5900a021388e3621979b9fccb00e66805f9474e6bb9f61934ca76b5abf","observation_id":"7cbb3b76-5837-43f6-9d75-6f77f0a51e27","resolution":{"observed_at":"2026-08-04T17:55:19.683735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.687945Z","title":"Proceedings of the computer vision and pattern recognition conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.687945Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:ba8bbc9db2991ef7a25a18f8be48d8b85e9c112147f3c522d87411d532cd7122","observation_id":"328907aa-38a9-423c-8324-8b4d435476d2","resolution":{"observed_at":"2026-08-04T17:55:19.687945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.692294Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.692294Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:e66dd163c94781f8b8d07d71a62c62062bb079078744e96309a8800b57ba9fc7","observation_id":"2bf0af53-5060-4f00-9871-4174b38e1586","resolution":{"observed_at":"2026-08-04T17:55:19.692294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.31946","last_updated":"2026-07-14T06:00:42Z","snapshot_observed_at":"2026-08-14T12:09:02.486667Z","submitted_at":"2026-06-30T16:52:53Z","title":"World Narrative Model for Highly Controllable Video Generation: A Paradigm Shift from Pixel Sampling to Physical World Orchestration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.31946","snapshot_observed_at":"2026-08-04T17:55:19.696746Z","title":"arXiv preprint arXiv:2606.31946 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.696746Z"},"links":{"cited_paper":"/paper/2606.31946","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:b1d52037d48e8d3d190983f75b95379150c337fda7951d7ea45b7651307537bd","observation_id":"b7f47b17-78d1-4b62-9f8c-5ac7e3856ea1","resolution":{"observed_at":"2026-08-04T17:55:19.696746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.701369Z","title":"arXiv preprint arXiv:2510.12256 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.701369Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:82cd2b30e001e7ebe0e4574363eccb466da2cee6fe0d6bcbe432eb2053f99503","observation_id":"8b4585b0-4bd8-4946-9252-5f379d11fa0a","resolution":{"observed_at":"2026-08-04T17:55:19.701369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-15T23:24:13.384254Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-04T17:55:19.705417Z","title":"arXiv preprint arXiv:2505.04512 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.705417Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:e7202787277a726b6aac03565d683df3f705349950be1f481b115dc4d21c7288","observation_id":"f34af647-a454-47b8-99ea-6fd7f628fb95","resolution":{"observed_at":"2026-08-04T17:55:19.705417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-16T00:06:16.567037Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02753","snapshot_observed_at":"2026-08-04T17:55:19.709947Z","title":"arXiv preprint arXiv:2606.02753 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.709947Z"},"links":{"cited_paper":"/paper/2606.02753","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:29b166231f09b68c6cd95d953739680d8766adc0fe240dd846a6549c2a2ce072","observation_id":"3b4f27d2-e2df-4162-9f11-07a1c519cf7c","resolution":{"observed_at":"2026-08-04T17:55:19.709947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15789","last_updated":"2024-05-01T02:37:18Z","snapshot_observed_at":"2026-08-16T13:58:15.220232Z","submitted_at":"2024-04-24T10:28:54Z","title":"MotionMaster: Training-free Camera Motion Transfer For Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15789","snapshot_observed_at":"2026-08-04T17:55:19.714539Z","title":"arXiv preprint arXiv:2404.15789 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.714539Z"},"links":{"cited_paper":"/paper/2404.15789","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:1154d621338c5ef48f39c50c42ac39843581ae7f019fcfccf71294369323efea","observation_id":"af75675e-ded9-49cb-860c-528317d18847","resolution":{"observed_at":"2026-08-04T17:55:19.714539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T15:17:53.729487Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":69,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2608.01944."}