{"as_of":"2026-08-07T08:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48e00d4e79954912e646ee76fb45d4e8f572ff1e126886a9dc8bee4a5386f277","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:41:07.918981Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T01:23:09.117957Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12847","snapshot_observed_at":"2026-08-01T10:37:54.999164Z","title":"idit-hoi: Inpainting-based hand object interaction reenactment via video diffusion transformer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20174","last_updated":"2026-07-22T14:06:39Z","snapshot_observed_at":"2026-08-06T22:13:37.273683Z","submitted_at":"2026-07-22T14:06:39Z","title":"StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T10:37:54.999164Z"},"links":{"cited_paper":"/paper/2506.12847","citing_paper":"/paper/2607.20174"},"observation_digest":"sha256:4ce305c10d0c572dc3414dabe6da035adb0887c2df64d4719285d1d0433d7491","observation_id":"7addece3-57dc-4b59-ad74-400167705ffc","resolution":{"observed_at":"2026-08-01T10:37:54.999164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12847","snapshot_observed_at":"2026-08-01T05:27:18.894578Z","title":"idit-hoi: Inpainting-based hand object interaction reenactment via video diffusion trans- former.arXiv preprint arXiv:2506.12847, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22241","last_updated":"2026-07-30T03:34:42Z","snapshot_observed_at":"2026-08-06T04:16:05.161328Z","submitted_at":"2026-07-24T12:17:57Z","title":"AgentHOI: Multi-Agent Reasoning for Human-Object-Interaction Video Generation via Implicit Representation Alignment","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T05:27:18.894578Z"},"links":{"cited_paper":"/paper/2506.12847","citing_paper":"/paper/2607.22241"},"observation_digest":"sha256:60798af91743eab758818351ead50201c28e402dbeebb861852677e8d40ad008","observation_id":"7100c40b-5eb5-4d71-b27d-1189285c9be0","resolution":{"observed_at":"2026-08-01T05:27:18.894578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12847","snapshot_observed_at":"2026-07-31T08:51:27.095194Z","title":"idit- HOI: Inpainting-based hand object interaction reenact- ment via video diffusion transformer.arXiv preprint arXiv:2506.12847, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T23:11:29.841318Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":1},"reference_index":205,"source":"pdf_text","source_observed_at":"2026-07-31T08:51:27.095194Z"},"links":{"cited_paper":"/paper/2506.12847","citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:71816e7c1e29048878a1e4f108285a49f431c0b69eebd8cccb2a3affee11d14d","observation_id":"f587cc87-3ff3-4bb0-8e72-3fd690d0778d","resolution":{"observed_at":"2026-07-31T08:51:27.095194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12847","snapshot_observed_at":"2026-08-04T01:23:09.117957Z","title":"idit- HOI: Inpainting-based hand object interaction reenact- ment via video diffusion transformer.arXiv preprint arXiv:2506.12847, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T23:11:29.841318Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":187,"source":"pdf_text","source_observed_at":"2026-08-04T01:23:09.117957Z"},"links":{"cited_paper":"/paper/2506.12847","citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:32e5e8f4cfbb70760b741d9df09d71864fba1fb9191ba7cefded7b884a14cbba","observation_id":"30d0897e-a33f-44be-8a63-bbebb729aaee","resolution":{"observed_at":"2026-08-04T01:23:09.117957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12847/citation-record","integrity":"/paper/2506.12847/integrity","json":"/paper/2506.12847/citation-record.json","paper":"/paper/2506.12847"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:55.849134Z","title":"Person image synthesis via de- noising diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:55.849134Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:115546fe62ff4b6e3ca93c68d868231925ca7c8d302178cfe5a09a1a304980ca","observation_id":"1d78cc45-a367-4c45-9b1d-ed589175f3ab","resolution":{"observed_at":"2026-08-07T00:40:55.849134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:56.026603Z","title":"Videopainter: Any- length video inpainting and editing with plug-and-play con- text control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.026603Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:9769566322e787ffa95f3eb44712b1f3b5d097e238e1e40c05fe1719edec9aac","observation_id":"87e4ccb9-97a3-4d1d-88c0-96a38758b037","resolution":{"observed_at":"2026-08-07T00:40:56.026603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:56.147395Z","title":"Smpler-x: Scaling up expressive human pose and shape estimation.NeurIPS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.147395Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:cce7ac4e8f2eae18fe1205f9f08c458ee32955202e23d1a2b1cd286681d2624b","observation_id":"3c87dd3b-a552-442f-a769-09586745fb9e","resolution":{"observed_at":"2026-08-07T00:40:56.147395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:56.276084Z","title":"Pix2video: Video editing using image diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.276084Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:cf5244557b4c72f89b0644903d035f208433ce1d93a8bbd82e55052fbdc80d61","observation_id":"b7b6547e-4d76-439d-8174-ab27619128e3","resolution":{"observed_at":"2026-08-07T00:40:56.276084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:56.407455Z","title":"Magicpose: Realistic human poses and facial expressions retargeting with identity-aware diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.407455Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:61c4278c4a4df6eff07b4833b7dc5780a84d399742d5c50b7554929a900ffe24","observation_id":"3c527140-e1f0-462f-936b-7748adb26f9f","resolution":{"observed_at":"2026-08-07T00:40:56.407455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-07T00:40:56.552104Z","title":"Pixart-α: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.552104Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:4bb829ebdca2ff600b672bc404a26995e9b3a9923d9af574ae9c9941cdd1cf2d","observation_id":"d0cd001b-8d41-4423-92d4-90dcb07eaa0c","resolution":{"observed_at":"2026-08-07T00:40:56.552104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:56.697928Z","title":"Control-a-video: Controllable text-to-video generation with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.697928Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:9590fc67df8c689730b2b160cb65ee557e837dfcfa468ae08f98bf7d9dc806d9","observation_id":"8eec9d24-25f8-4151-9226-3683a7196b86","resolution":{"observed_at":"2026-08-07T00:40:56.697928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.730721Z","title":"Cg-hoi: Contact-guided 3d human-object interaction generation","venue":null,"work_id":"ec8eac3e-9d21-48ce-9d8b-512f43125176","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.763263Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:f6c38355b960220f3e8eed25bc52f5e024c5c5b4b0bf11d78fef60e61c6abb1a","observation_id":"d4bfc890-7a8e-4d38-a338-c94ad7667d51","resolution":{"observed_at":"2026-08-07T00:41:18.736762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.711105Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":"0c96fbf1-689b-46be-82d4-a0dc3b3b965a","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:56.841966Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:299bfc5ee3486bfb054a864808cb6fbdc0a4220f28e2a9a1a15f756b534accc9","observation_id":"dd4570e3-0316-4bbc-8397-25a22af4e0c0","resolution":{"observed_at":"2026-08-07T00:41:18.717139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:57.009521Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.009521Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:cea86d41c7db4c925d6f4318c729ead44cc34b67fd52cee8d638adfd81a666e6","observation_id":"28603426-b44b-423b-825c-2a8a5bbee419","resolution":{"observed_at":"2026-08-07T00:40:57.009521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.676544Z","title":"Re-hold: Video hand object interaction reen- actment via adaptive layout-instructed diffusion model","venue":null,"work_id":"f86f5603-7d6f-4731-8926-c82d3a137f2d","year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.115303Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:b8fbe16162e82d606fbd659e134da01f7f8a2aa19dd35539fff9e8b70244cd5c","observation_id":"946c9b23-1f5d-4fc3-805c-9019e4e3eaf0","resolution":{"observed_at":"2026-08-07T00:41:18.682177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.658884Z","title":"Ccedit: Creative and controllable video editing via diffusion models","venue":null,"work_id":"cbe9b00a-bc2b-4696-b2f4-3b75a3416830","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.204044Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:57dc8ed1990d2add77bb5e44ae3b703c6f00cf71a17ad133e6b94baf5ed9b92a","observation_id":"444ee6dc-b79b-48c1-b1ee-f76fd6ff1325","resolution":{"observed_at":"2026-08-07T00:41:18.665051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-05T01:30:44.891750Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-08-07T00:40:57.359048Z","title":"Humandit: Pose-guided diffusion transformer for long- form human motion video generation.arXiv preprint arXiv:2502.04847, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.359048Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:719f144fd890c89e8e06060144f528ebf58d9a4b46e6fc6063320ed870626c0b","observation_id":"7ac5ae84-74b1-4c0d-8aae-4c50a97ad4c1","resolution":{"observed_at":"2026-08-07T00:40:57.359048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.640777Z","title":"Tokenflow: Consistent diffusion features for consistent video editing.arXiv, 2023","venue":null,"work_id":"9a82d746-032e-4593-9675-4ffad6ee7131","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.530289Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:ff8cf379ecd0ec570b8080b5b54735dda25431a419b850c0ee89b9fa46aa3acd","observation_id":"375e4770-abf2-456f-8dc5-8c9e8339deaa","resolution":{"observed_at":"2026-08-07T00:41:18.646670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.620455Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":"0c721936-344e-4e29-8629-ff4b6d577c87","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.712846Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:b937a904f9b2d2509afa16fd528656ea7b6e5a76b46050faf724976c68d7c0b7","observation_id":"891ee0a2-a6b1-4f00-96c4-38ad8a68f67b","resolution":{"observed_at":"2026-08-07T00:41:18.626921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.599470Z","title":"Videoswap: Customized video subject swapping with interactive seman- tic point correspondence","venue":null,"work_id":"ca0d7f28-44a4-4da5-a893-89e5c7134c31","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.888052Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:caf4d3daae6a58ebbcbec0915c8f5be1fbed751272c015242f3bf09c8c143ed9","observation_id":"a74efc51-aa1f-442b-b944-fa215e95add4","resolution":{"observed_at":"2026-08-07T00:41:18.606275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.581075Z","title":"Talk-act: Enhance textural- awareness for 2d speaking avatar reenactment with diffusion model.SIGGRAPH Asia, 2024","venue":null,"work_id":"9ccdbff2-68eb-493c-8bc4-88658fec12db","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:58.033983Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:c4ea773ecb4ad4f92cb8d830d50c803115aa68ab3613799e56d9c311aa5b8a1d","observation_id":"ba21eacd-fd29-4ff8-b905-621052d961e4","resolution":{"observed_at":"2026-08-07T00:41:18.588021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.563619Z","title":"Livepor- trait: Efficient portrait animation with stitching and retarget- ing control.arXiv, 2024","venue":null,"work_id":"cc8ccf73-d9bf-4b8e-ad9a-c339d669e0e8","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:58.141288Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:34b5a7fc44ba46cde47221a2ce723c8521168fecb8319382d56065756ab68dbb","observation_id":"8a25d911-f505-423f-8ea9-2127cd6a0025","resolution":{"observed_at":"2026-08-07T00:41:18.569441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.545096Z","title":"Resolving 3d human pose ambigui- ties with 3d scene constraints","venue":null,"work_id":"cb880067-a07e-4c40-a0c7-28b090e6b8e1","year":2019},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:58.247226Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:f2c1d0a5d0b5fc48a7229d250785efc315f3abb450bd2ec96dada073070a4b47","observation_id":"6c07f26e-efc0-4834-a2f8-88d5c99d8dd6","resolution":{"observed_at":"2026-08-07T00:41:18.551542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.514218Z","title":"Populating 3d scenes by learning human-scene interaction","venue":null,"work_id":"af292262-d8cd-47e0-9cba-828c3b806e72","year":2021},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:58.327537Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:8146f7f5217a85686cc2b0ba2e8b3d4a3f69932f822059c9c65e554172c254da","observation_id":"7768c4ab-da41-48e1-a27a-a94e565f3f9d","resolution":{"observed_at":"2026-08-07T00:41:18.528089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.393033Z","title":"Synthesizing physi- cal character-scene interactions","venue":null,"work_id":"83baf031-ad56-4e90-9971-06c97bd354b8","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:58.419397Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:241a69106aa321834512362c064c0a6dcf8d6a1ee54d5a3463c762f1f805f2c8","observation_id":"f652b488-9eb5-4420-8e2a-b8c3201b3c65","resolution":{"observed_at":"2026-08-07T00:41:18.443031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.181496Z","title":"Hand-object interaction image generation.NeurIPS,","venue":null,"work_id":"d3b5c1a1-328e-4eae-8f3e-38da0663e5e4","year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:58.505914Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:bd606b6b2b293e91441e7db046b6585f1b85f33dc7c3b880bd2e0d7e74531492","observation_id":"ee101561-8130-4d4f-b99d-e6d58a8674e8","resolution":{"observed_at":"2026-08-07T00:41:18.272435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:18.011491Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":"a611dbb8-6d3c-4338-912a-c310be523c3b","year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:58.587901Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:5ce6d961fd3b0573fddccf1a15704b1bcf7cea9b454310fc866c11a5ddbe118f","observation_id":"c58761c5-83cf-436a-97f4-c6afe99a70db","resolution":{"observed_at":"2026-08-07T00:41:18.062117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06145","last_updated":"2025-02-10T04:20:11Z","snapshot_observed_at":"2026-07-06T20:33:43.357335Z","submitted_at":"2025-02-10T04:20:11Z","title":"Animate Anyone 2: High-Fidelity Character Image Animation with Environment Affordance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06145","snapshot_observed_at":"2026-08-07T00:40:58.645841Z","title":"Animate anyone 2: High-fidelity character image animation with environment affordance.arXiv preprint arXiv:2502.06145, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:58.645841Z"},"links":{"cited_paper":"/paper/2502.06145","citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:9002872cacd17adf36fd8382b2b35023ea07ff739392deab410fd1025c587267","observation_id":"42031114-248d-4ed7-9e35-685b36367ebc","resolution":{"observed_at":"2026-08-07T00:40:58.645841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-08-07T00:40:58.747297Z","title":"Vace: All-in-one video creation and editing.arXiv preprint arXiv:2503.07598, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:58.747297Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:86498eccfee7fc3525d3a5ad6e4ca9c8e35143a7dd65d6bbeb5ac8d29af9d3cf","observation_id":"b1c244ba-1ebc-459c-ab1f-38d2afd9f69a","resolution":{"observed_at":"2026-08-07T00:40:58.747297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:17.879511Z","title":"Dreampose: Fashion image-to-video synthesis via stable diffusion","venue":null,"work_id":"b4739045-24e9-4389-8b00-2dd962902756","year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:58.861552Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:2a7dbf3f5572ed22a7258b94bca442c8abd54a82a544a19e98ec311142abf427","observation_id":"1b1427ab-33b7-4321-9ca6-48409fc65980","resolution":{"observed_at":"2026-08-07T00:41:17.923114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T00:40:58.985574Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:58.985574Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:b38afc02ae04b36afabaee4b790c6bd259972a976104b88ad7735805ea676fb4","observation_id":"b7ea3f57-8e41-466c-861b-fa63dce0ba4b","resolution":{"observed_at":"2026-08-07T00:40:58.985574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:17.732934Z","title":"Anyv2v: A plug-and-play framework for any video- to-video editing tasks.arXiv, 2024","venue":null,"work_id":"67465732-ba13-4e84-bb0d-fa78d36b77bc","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.071513Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:d0785a04224d3102a2cb161ea53d42f0ce42a3ab1503a9764efb40987a829aa4","observation_id":"3f2c233f-983d-4237-8e3d-570a41636637","resolution":{"observed_at":"2026-08-07T00:41:17.845182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:17.600383Z","title":"Flux.https://github.com/ black-forest-labs/flux, 2024","venue":null,"work_id":"ff42808b-826a-4393-b0d2-989d9eec474f","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.129725Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:a9425c5bbe0a02b623cdf93d0e9e1bc79099d04a28a55a695b7cb31e7eb95602","observation_id":"5bffd73d-dcee-4468-8fb5-52609dddfbf6","resolution":{"observed_at":"2026-08-07T00:41:17.650595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:17.375237Z","title":"Lego: Learning egocentric ac- tion frame generation via visual instruction tuning","venue":null,"work_id":"6058a88b-cde4-4384-98a5-c14c2d250249","year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.225938Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:e205256504aa98940a2ce34b2b92e4a7ad1a5032163c8836d4390698936f81e5","observation_id":"46857b48-d2cc-43fd-8860-b9fb80935fb5","resolution":{"observed_at":"2026-08-07T00:41:17.470230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:17.291232Z","title":"Shape-aware text-driven lay- ered video editing","venue":null,"work_id":"5bf698a9-34d5-4c9b-b712-0c6c79f3b006","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.323533Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:a3a6cbd5a21f51248469ca7afbd5adc68220f0afe0029472a1a0f12263748ca4","observation_id":"5ac1839c-76f6-4fac-92e1-f41c9f028dd3","resolution":{"observed_at":"2026-08-07T00:41:17.322349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:17.185172Z","title":"Generative om- nimatte: Learning to decompose video into layers.arXiv,","venue":null,"work_id":"e7ed8fa8-ff0d-45e6-ae12-c17c5993afc3","year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.406104Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:657cfca69670a4e05a1635b835536665fe04968a46ddf40e8e7a7af23983a3f8","observation_id":"5f05962b-104c-477a-aaed-7848f3fd0afb","resolution":{"observed_at":"2026-08-07T00:41:17.230606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:16.906431Z","title":"Vidtome: Video token merging for zero-shot video editing","venue":null,"work_id":"812d65d6-89bc-4690-aebf-b408499e147b","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.468695Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:cf2e9d69bf72a517fb09cd989ec8c55aaf09f35947e5b3d1acfa8673a0bf39a9","observation_id":"20f1775c-f3c3-45ef-a6b6-5ea631e9b977","resolution":{"observed_at":"2026-08-07T00:41:17.036408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:16.607230Z","title":"Video generation from text","venue":null,"work_id":"985d1a31-010d-4f43-910c-22f329aa916d","year":2018},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.569258Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:649006f530bbb9e1e8d1c6d148ca3a9af6686fa4198705c1a56ff5c2522f7135","observation_id":"133a9f74-e380-4fa8-84b3-bb139730b507","resolution":{"observed_at":"2026-08-07T00:41:16.739371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T00:40:59.660776Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding.arXiv preprint arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.660776Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:5f5c80912d8a2c61165efbc37001e3b9fe93095546749e4d43f4c8ecb881317f","observation_id":"4158dac0-cec8-4cd3-bf99-534b47953d49","resolution":{"observed_at":"2026-08-07T00:40:59.660776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:16.375816Z","title":"Flowvid: Taming imperfect opti- cal flows for consistent video-to-video synthesis","venue":null,"work_id":"51cf1059-71bf-40f2-b202-0d52c83e59b7","year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.767048Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:97d5a262f130afb7531635c4f7299e1ac05c50e5d8707e3f770aa4c1d0c021eb","observation_id":"237fda55-aa45-4e5b-acbc-6a79a7f5f4bf","resolution":{"observed_at":"2026-08-07T00:41:16.482657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:16.167484Z","title":"Video-p2p: Video editing with cross-attention control","venue":null,"work_id":"5d68784d-e5bd-417a-82ad-de9448198115","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.852408Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:abcd9eb55f7a3ba6cd1141f15756a73522229d11752c4a711bb8bdb4bbda062b","observation_id":"ccd59e8f-5f78-471c-b09d-8b6dd3b0cb1e","resolution":{"observed_at":"2026-08-07T00:41:16.274883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:15.944055Z","title":"Iterative ensemble training with anti-gradient control for mitigating memorization in diffusion models","venue":null,"work_id":"551f9219-7e19-4b2d-9b38-5353cf2601b1","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.952831Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:401eda79e101c4b04bd789307b1921adda0a6b5c0664fc5082851fe0ca23752f","observation_id":"3a6392ac-1bf7-4d7c-bc07-7e55bdc26d36","resolution":{"observed_at":"2026-08-07T00:41:16.035930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:15.701892Z","title":"Live speech por- traits: real-time photorealistic talking-head animation.TOG,","venue":null,"work_id":"be230735-6b55-4868-a504-956a8814d982","year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:00.025488Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:af82da518a0843f242bb7ce0373aecda227a4f137bf22c272d432366da26bd6f","observation_id":"21c8291f-9cfd-47cd-a041-c7b69fe23212","resolution":{"observed_at":"2026-08-07T00:41:15.816820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:15.485177Z","title":"Dreamactor-m1: Holistic, expressive and robust human image animation with hybrid guidance, 2025","venue":null,"work_id":"bbcc09f5-e45d-4057-b2ff-e49850bb1e43","year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:00.125115Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:4a8e480df2c7ab988065b2a95a989c3dee4a5e14135d9271b84b8a52457c21e5","observation_id":"d59c705e-ab3b-49b6-9c01-69b88252813f","resolution":{"observed_at":"2026-08-07T00:41:15.614113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02487","last_updated":"2025-01-15T13:07:56Z","snapshot_observed_at":"2026-07-06T20:16:40.311377Z","submitted_at":"2025-01-05T09:40:58Z","title":"ACE++: Instruction-Based Image Creation and Editing via Context-Aware Content Filling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02487","snapshot_observed_at":"2026-08-07T00:41:00.228866Z","title":"Ace++: Instruction- based image creation and editing via context-aware content filling.arXiv preprint arXiv:2501.02487, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:00.228866Z"},"links":{"cited_paper":"/paper/2501.02487","citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:55a17d0eda8c6f7f377578e7ec6663ef9d8a293431b50665a7dd8134ae267529","observation_id":"e418d60b-fe81-41ae-b4c5-e3e8adca9598","resolution":{"observed_at":"2026-08-07T00:41:00.228866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:15.171937Z","title":"Mimo: Controllable character video synthesis with spatial decomposed modeling","venue":null,"work_id":"4b72e02d-db97-4e73-981f-3aa67f8fff10","year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:00.689236Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:bb44b9438136872c5fce2b9c70e2b770bc299631c86a93a2052e6981293fc7c8","observation_id":"e5ab77f8-b365-4af5-b0b8-fbc15c25910f","resolution":{"observed_at":"2026-08-07T00:41:15.304385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:14.921648Z","title":"Sora: Creating video from text.https:// openai.com/sora/, 2024","venue":null,"work_id":"08be1c13-933d-4ada-a2f2-00279e6b58d0","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:02.570292Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:eb0af248ae0a3cdabb6a2e80573efa87c5bdc4c7010c56f68bc45c4d03211a70","observation_id":"4d4c7e16-5d70-4c67-8d23-969a26fe7c26","resolution":{"observed_at":"2026-08-07T00:41:15.006145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:14.796601Z","title":"Reconstruct- ing hands in 3d with transformers","venue":null,"work_id":"08621a87-46c3-4856-a85f-b6cde23c665c","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:02.794703Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:295f228eb7851ba64627525c533b9e25b2252a7206071346069e0047208ff04f","observation_id":"ee9e51ab-dfc4-4569-8929-8ce1c90d0b96","resolution":{"observed_at":"2026-08-07T00:41:14.877718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:14.620723Z","title":"Vase: Object-centric appearance and shape manipulation of real videos.arXiv, 2024","venue":null,"work_id":"cfa416eb-41ab-4ff3-9b56-1ff514f7081d","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:04.395040Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:75e3db37eefdca15b64a329667ddbd0b2d3c4dcf9e5aaba5200544793479df66","observation_id":"93e9b51d-433f-4654-a869-9ff43e1212b1","resolution":{"observed_at":"2026-08-07T00:41:14.710627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:14.488597Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":"03837ed2-96c5-4732-924f-4c4292c9f7bd","year":2020},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:04.643291Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:8b902eb9e6c3653effac3fb7fb8d2bd6ab82aa794814107c07737dc5edfb1423","observation_id":"04adb67f-2efb-4d33-af6a-4a884744d84c","resolution":{"observed_at":"2026-08-07T00:41:14.536687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:14.364516Z","title":"Fatezero: Fus- ing attentions for zero-shot text-based video editing","venue":null,"work_id":"ffec00c8-e721-484e-bb6d-ac67f2596de0","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:04.745650Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:1b52bfa7d38417d932799d2be3dab4300a6522d34e4214db022baf11cba3c75f","observation_id":"f8e562a0-d805-4eed-97e3-6bea44ee846b","resolution":{"observed_at":"2026-08-07T00:41:14.425726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:14.235214Z","title":"Stable diffu- sion 2 inpainting.https : / / huggingface","venue":null,"work_id":"6d5f7745-a190-495e-8de4-8617a8aa0abd","year":2022},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:04.868749Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:36eddd6110a4022a2a99da31925e02aa48196f19fe6b02dc00fbfe6ca8391a6f","observation_id":"6dfce370-292e-4c4c-805d-fa5807744f9f","resolution":{"observed_at":"2026-08-07T00:41:14.274527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:04.923402Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:04.923402Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:473d88f0feb06725136b2b0958bc2cd3d76abf6d7eef12a8c9adf0c255171ce6","observation_id":"db8cc9c2-7702-4c71-abc2-e3b9ec5bb039","resolution":{"observed_at":"2026-08-07T00:41:04.923402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:04.929104Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:04.929104Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:9a1ed8a026a9cda1d74a76894bfa9a438b7b98b9e49b6777f46b877c14a54432","observation_id":"79bedfab-3e06-479d-90e1-5b4817113664","resolution":{"observed_at":"2026-08-07T00:41:04.929104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17405","last_updated":"2024-09-23T20:52:01Z","snapshot_observed_at":"2026-07-06T18:20:44.070255Z","submitted_at":"2024-05-27T17:53:29Z","title":"Human4DiT: 360-degree Human Video Generation with 4D Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17405","snapshot_observed_at":"2026-08-07T00:41:04.992398Z","title":"Human4dit: 360-degree human video generation with 4d diffusion transformer.arXiv preprint arXiv:2405.17405, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:04.992398Z"},"links":{"cited_paper":"/paper/2405.17405","citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:0a8040528793cd3e81c8c1f1ea48add3172bd9b311854af376521168ef432040","observation_id":"6256689b-ee15-4038-8bda-8e49319670bb","resolution":{"observed_at":"2026-08-07T00:41:04.992398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:14.037419Z","title":"Edit-a-video: Single video editing with object-aware consistency","venue":null,"work_id":"c74c85d5-173d-4fb7-9cf2-9b22ae392f61","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.054638Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:c5763eb247ab790ac68c981ea52cea13eded4c1f7e5c55f4a82e39d852ecfd52","observation_id":"1531149b-5832-43c2-a3da-32aad6c2706d","resolution":{"observed_at":"2026-08-07T00:41:14.118624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:13.908454Z","title":"Make-a-video: Text-to-video generation without text-video data.arXiv, 2022","venue":null,"work_id":"fd41666a-cd02-4c0c-914f-2e6d51c11f81","year":2022},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.127368Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:c759d2838d0d01c5ee30d6474f8362e08d8c4f769ee4244d0dcae2a1cdf1db32","observation_id":"76a50cca-916c-46f7-8a5d-960b83b9e323","resolution":{"observed_at":"2026-08-07T00:41:13.967877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:13.793084Z","title":"Emo: Emote portrait alive-generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":"8616b00f-91b1-4c2a-83f8-2f2c6796a2b8","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.215658Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:85220e230ed01c1b6e6e79ad1240c09d0c17707902a4c9ed6175081e74de9205","observation_id":"4fcbaeb9-bbc8-4323-936a-98225a940114","resolution":{"observed_at":"2026-08-07T00:41:13.844013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:13.683174Z","title":"Attention is all you need.NeurIPS, 2017","venue":null,"work_id":"abe70f81-805a-4ff3-81ea-6c7570a0b6bb","year":2017},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.282748Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:262f322f66e74b48da73f992484b91792dbeebea1e5e8a9e6721d7b11db124b5","observation_id":"1833d2a1-9209-449d-a166-9147a385e97e","resolution":{"observed_at":"2026-08-07T00:41:13.725532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:13.509445Z","title":"Wan: Open and advanced large-scale video gen- erative models, 2025","venue":null,"work_id":"4dd6be02-e50c-4785-a284-e1a13fb0616a","year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.351828Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:04b3f2dcc0cddefcdbe8d3a5340338228eb36e53b27604a9c058a11caab56566","observation_id":"84e4ab52-6e9c-41ae-ae7f-98caa501a480","resolution":{"observed_at":"2026-08-07T00:41:13.590511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:13.345109Z","title":"Robust video portrait reenact- ment via personalized representation quantization","venue":null,"work_id":"7c862ab8-47e2-4c5a-b009-732be2216f6a","year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.445126Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:181648db0950f8c1817041c626917f37def969f281f18183a25317bd2b3b2d37","observation_id":"fca04e0f-4ebc-4160-b035-cb2e592d659f","resolution":{"observed_at":"2026-08-07T00:41:13.434166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:13.218427Z","title":"Efficient video portrait reenactment via grid-based codebook","venue":null,"work_id":"ae7b655d-1db7-4949-b141-d76847cabc25","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.540143Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:7e7cb3b08f6000ae585958a21d6658f7bdb481b6bb5dcf0c0a7f39c66e7e89ef","observation_id":"37e5e87b-32f7-40a8-9e2f-4f006ad5689c","resolution":{"observed_at":"2026-08-07T00:41:13.264151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:13.020451Z","title":"Diffusion in diffusion: Cyclic one-way diffusion for text-vision-conditioned generation.ICLR, 2023","venue":null,"work_id":"6a74da06-cab3-4fbc-93b8-6d917dec7f6a","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.609950Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:57f7b3cd609c7ec7fbdacb00c883c9c46c7aedfd9624599a9a9b7b9934b876af","observation_id":"54a117d9-1ed8-4d65-927d-c2d7e24f1d09","resolution":{"observed_at":"2026-08-07T00:41:13.133190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:12.881961Z","title":"Disco: Disentangled control for realistic human dance generation","venue":null,"work_id":"aac293d7-435f-4cc3-90af-82ff756fce52","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.693536Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:a5d578401fa7061e0d35b9f00a19a0e3d5ec89bdd8df658beb4978770360cef7","observation_id":"a34be035-95e6-4c89-b858-84db5d41886d","resolution":{"observed_at":"2026-08-07T00:41:12.936533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:12.653410Z","title":"One-shot free-view neural talking-head synthesis for video conferenc- ing","venue":null,"work_id":"1db6bfb9-59c1-45a5-85fb-eb4697daa93c","year":2021},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.791022Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:93ed5d9cdfbbe2d20f85472efb359216dc1d01ded59bdb8bf6d5d5116bed6acd","observation_id":"3fbab669-8ebb-455d-8e72-fd981d2c52ff","resolution":{"observed_at":"2026-08-07T00:41:12.730327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:12.451485Z","title":"Videocomposer: Compositional video synthesis with motion controllability.NeurIPS, 2024","venue":null,"work_id":"65d4ca59-5a88-48cf-b463-f2bfd35690c1","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.885683Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:bb50d341bd55cabc97c614f892b82ad35f614c07ee3ec16c7a0ced1d989101ad","observation_id":"9b960a2d-fb93-481d-845f-7143d44f64e8","resolution":{"observed_at":"2026-08-07T00:41:12.534289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:05.956615Z","title":"Unianimate-dit: Human image animation with large-scale video diffusion transformer.arXiv preprint arXiv:2504.11289, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:05.956615Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:c1b6e291d7fcff6dd750721b4f74128c0dd5b60b154bbeae6ae80b68367eb6f2","observation_id":"98c38943-a261-4899-8dcb-9822c011902e","resolution":{"observed_at":"2026-08-07T00:41:05.956615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:12.276532Z","title":"Latent image animator: Learning to animate im- ages via latent space navigation.arXiv, 2022","venue":null,"work_id":"0e566fa0-53d9-47ab-85ae-e8e0282a0c96","year":2022},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.058039Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:6bbadf454d94db4325540920bcc110c7af6f14b073f3b324d08abdefe0480e7e","observation_id":"f9d141e7-259d-49fe-94be-f4cdaf127bd8","resolution":{"observed_at":"2026-08-07T00:41:12.358387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:12.111339Z","title":"Foundationpose: Unified 6d pose estimation and tracking of novel objects","venue":null,"work_id":"9ab59dbd-785d-49cd-8258-4c9011374e8a","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.158274Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:ee8f990a25741b0b2c48425e0784700205beeaa1d7051c445d4f0aa288b8ebec","observation_id":"88f8bc3d-fdd1-41cb-abf3-75b1f792f7bd","resolution":{"observed_at":"2026-08-07T00:41:12.187867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:11.909208Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":"815974ff-28c2-4eba-9604-fd3d7151309c","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.227531Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:5ee61f163ce15dd92b9dbe7500adffc93564969626c54ead488dca49ac57f0c7","observation_id":"93e611b8-95ff-4542-a080-9dbed1fe7a5d","resolution":{"observed_at":"2026-08-07T00:41:11.988082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:11.765569Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation.arXiv, 2024","venue":null,"work_id":"39a197e8-5639-464b-8c91-af45d0a8d068","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.307583Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:105cdd7be5e299f1462159d7301e3ee6feb82abd66aaf3124f92e4033fcc5904","observation_id":"d884100c-e331-4ee7-b609-eb18e98646e3","resolution":{"observed_at":"2026-08-07T00:41:11.830962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:11.568703Z","title":"Hoi-swap: Swapping objects in videos with hand-object in- teraction awareness.NeurIPS, 2024","venue":null,"work_id":"5afab5f1-bb68-41cb-bd18-81c4ee4a31fe","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.377089Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:fa64bb837d2eaa112c630c4483f578889d2fd2b9393efeab7272afeb69b266b2","observation_id":"3ea10905-0ca3-4cd4-a13b-ac1908019815","resolution":{"observed_at":"2026-08-07T00:41:11.670573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:11.374207Z","title":"Showmaker: Creating high-fidelity 2d human video via fine-grained diffusion mod- eling.NeurIPS, 2024","venue":null,"work_id":"d49203e8-4eba-4c87-bb00-e968dd766281","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.445388Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:eb92bebbe9f554d954962c6b2015d4620086cbedbbbf4a88bfd75917dd8c2111","observation_id":"180c060e-094b-4a4b-a15d-ad6630d416b7","resolution":{"observed_at":"2026-08-07T00:41:11.431258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:11.233646Z","title":"Rerender a video: Zero-shot text-guided video-to-video translation","venue":null,"work_id":"026aea19-903f-4803-8062-dc7e10f000b7","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.520664Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:ff7abdcb05575562301c18571a1fb016b0572c3a0d6c4917d1a7154b717d55d6","observation_id":"c6a856d5-2818-4056-95cd-7c779519471e","resolution":{"observed_at":"2026-08-07T00:41:11.304565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:11.038199Z","title":"Effec- tive whole-body pose estimation with two-stages distillation","venue":null,"work_id":"423e8a9e-67af-4712-9b61-9d08b766e162","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.594525Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:650932db7c9bafad86a9078255b8107479355ca322a12b64969fdc9c6571a58b","observation_id":"ffe09eaf-ae67-474f-a342-7cac1ae98853","resolution":{"observed_at":"2026-08-07T00:41:11.126525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:10.877452Z","title":"Space-time diffusion features for zero-shot text-driven motion transfer","venue":null,"work_id":"29eb0b14-ffc5-4172-97ab-5b975dff9e81","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.674585Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:79fb0afb7740daabe08ef38f30602b1c875d6b47bd88c73845faf30189d9d974","observation_id":"dcc5f97e-bee4-4cb1-983c-c7613a11b563","resolution":{"observed_at":"2026-08-07T00:41:10.950453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:10.705268Z","title":"Diffusion-guided reconstruction of everyday hand- object interaction clips","venue":null,"work_id":"42f57a08-3c01-4487-9831-a8f8914f6006","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.773556Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:50a11d035407224ae81c4004a76deab154246ac0f2fc23c35b0bb0fa32ee38cc","observation_id":"b47d8aa3-a7b1-4180-8aa7-15ad68ed279f","resolution":{"observed_at":"2026-08-07T00:41:10.782808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:10.551305Z","title":"Affordance diffusion: Synthesizing hand-object inter- actions","venue":null,"work_id":"c5e9c207-5de8-42a4-ac86-ac8b05fb889f","year":2023},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.846684Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:314e4e658a20d18fa50b89b4012a77adcc02e1d461c610589d4496802ec22f92","observation_id":"d42757ab-d2b5-405e-b095-279a5de21aab","resolution":{"observed_at":"2026-08-07T00:41:10.615828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:10.312870Z","title":"Moonshot: To- wards controllable video generation and editing with multi- modal conditions.arXiv, 2024","venue":null,"work_id":"fffcd304-b741-4e6d-85e4-a1adc3763a06","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.915945Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:db0274b4971d21ee0d519802f1b0f3985eca2565e8d144678c92be09df230831","observation_id":"2a5871f5-458d-4221-823f-9bf05474adcf","resolution":{"observed_at":"2026-08-07T00:41:10.436269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:10.136601Z","title":"Graspxl: Generating grasping motions for di- verse objects at scale","venue":null,"work_id":"699dd871-d80f-4155-9c7e-ce0803831c10","year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:06.985295Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:768feac25e865ff8295ccb06ac7c5a219ce39952ed2708438f3e4765f07eb143","observation_id":"4ffb5d07-6954-4cfe-9af1-3d347d2e6729","resolution":{"observed_at":"2026-08-07T00:41:10.220306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:09.939809Z","title":"Hoidiffusion: Generating realistic 3d hand-object interaction data","venue":null,"work_id":"3d43b8c8-89e6-4ed0-ad6b-2d6788f574d4","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:07.056644Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:8ae2f4e9cb1da74aa5f39cf48b9bdbe3f505db5a0700fa3e1002f22c9fc3a25d","observation_id":"18df7205-b067-46c6-b67d-2504aa2089dd","resolution":{"observed_at":"2026-08-07T00:41:10.041631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:09.780965Z","title":"Place: Proximity learning of articulation and con- tact in 3d environments","venue":null,"work_id":"403e9d12-38f1-49fe-b8a7-269e67959638","year":2020},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:07.125844Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:98bc8ac4a0543059a5731c811e4c46e5729439700512338b650e3dad2b01d591","observation_id":"ee2636fd-962e-40aa-b2af-a097141604fa","resolution":{"observed_at":"2026-08-07T00:41:09.852017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:09.548881Z","title":"Generating 3d people in scenes with- out people","venue":null,"work_id":"03758c23-d48c-481a-b43f-b4aea3847aa8","year":2020},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:07.207170Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:a763d276b7591be0d737555fe5a0d4f998ae42a85fc2a95faedee34e502cf252","observation_id":"05fe2724-05d6-488f-83ef-168f9d183dec","resolution":{"observed_at":"2026-08-07T00:41:09.673946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-04T16:03:06.733403Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-07T00:41:07.314086Z","title":"Mim- icmotion: High-quality human motion video generation with confidence-aware pose guidance.arXiv preprint arXiv:2406.19680, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:07.314086Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:a457212c399400511479641744597fb557fe34d706356ed5ca6997136d952366","observation_id":"072c37cb-e248-4725-ba45-2e8b6c1da1bc","resolution":{"observed_at":"2026-08-07T00:41:07.314086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:09.362623Z","title":"Avid: Any-length video inpainting with diffusion model","venue":null,"work_id":"20ffa6ae-d172-4654-a0fc-d24cd7f43af2","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:07.430241Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:3d3a74ac63b3af593308610449f46dbb08eee296f5da2be49925efb74b05e9a9","observation_id":"789bac7d-8272-4bab-8e76-4cdd1d12f094","resolution":{"observed_at":"2026-08-07T00:41:09.464243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:09.129712Z","title":"Pose-controllable talking face generation by implicitly modularized audio-visual rep- resentation","venue":null,"work_id":"fd172c84-d0a4-493b-8577-72c5926b71e5","year":2021},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:07.513431Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:0b1f686c4442aa265e76e749851e923782413b711f8d3488c45f220773c838ef","observation_id":"3cbbf123-e7e0-49fa-8dac-c73266f3dae7","resolution":{"observed_at":"2026-08-07T00:41:09.247269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:08.925026Z","title":"Realisdance: Equip controllable character ani- mation with realistic hands.arXiv, 2024","venue":null,"work_id":"87aca25f-784c-429d-ad62-7bdfa8744f92","year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:07.594471Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:e02eedbd963db0c6eec48a7e5a4a689a7b45b967e01382c6f99dc628377b4cc2","observation_id":"ae7da5e1-6bca-4c2c-9f02-5fcb4cafb4b8","resolution":{"observed_at":"2026-08-07T00:41:09.007311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:08.746991Z","title":"Discrete contrastive diffusion for cross-modal music and image generation.ICLR, 2022","venue":null,"work_id":"8ee895f7-781c-492a-ac84-5de8f81b53da","year":2022},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:07.671543Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:95b7fc6ea678badc0f499ff25ce5856521ea010e723629713cef5213cfa17227","observation_id":"a4e8ed7d-5a25-419c-ac8b-949aafbc6019","resolution":{"observed_at":"2026-08-07T00:41:08.827167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:08.557904Z","title":"Cococo: Improving text-guided video inpainting for better consistency, controllability and compatibility","venue":null,"work_id":"5f3547b7-2f1f-4e47-a134-2bdae50e0620","year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:07.779574Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:f5348fdb9e0bb337f60f3fe45bf6cc4ce5aff9f2d7ed9002cbd7c57f220508d2","observation_id":"9d0c6260-f658-4548-b34f-d47e83a80825","resolution":{"observed_at":"2026-08-07T00:41:08.662632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:41:08.370354Z","title":"Cut-and-paste: Subject- driven video editing with attention control.Neural Networks,","venue":null,"work_id":"9115acc1-0167-48fb-8c83-c0dcc69eaae5","year":null},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:07.918981Z"},"links":{"citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:5c5b09ae740372f8e0b3fab7c83eb838dcd3f0411b2a01f1c32a0bcfe1587f49","observation_id":"500b1a36-b8f8-4578-88ea-446576a18f7f","resolution":{"observed_at":"2026-08-07T00:41:08.442439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","latest_version":1,"primary_category":"cs.GR","snapshot_observed_at":"2026-08-07T00:44:07.685075Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":67},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 4 inbound Pith citation observations for arXiv:2506.12847."}