{"as_of":"2026-08-06T16:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bd95e33c5c701e55f8e72974ad7f8ea5009a3a300de3bbf2da0ee567440bb616","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T05:51:18.368996Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T00:59:43.745654Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:09:56.485116Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"cited_work":{"arxiv_id":"2603.14686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.14686","snapshot_observed_at":"2026-08-04T01:52:33.282752Z","title":null,"venue":null,"work_id":"b20be148-7368-4a2e-8332-958a47edf80a","year":2026},"citing_paper":{"arxiv_id":"2604.14556","last_updated":"2026-04-16T02:39:15Z","snapshot_observed_at":"2026-07-06T23:02:18.425249Z","submitted_at":"2026-04-16T02:39:15Z","title":"Controllable Video Object Insertion via Multiview Priors","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T11:44:17.033051Z"},"links":{"cited_paper":"/paper/2603.14686","citing_paper":"/paper/2604.14556"},"observation_digest":"sha256:fa7726a4ab2bd01bea43f1a3a5f37918deb492afda16585bf2f526291fba5e87","observation_id":"d380bd2e-4ecb-4882-b390-a636882722b2","resolution":{"observed_at":"2026-08-04T01:52:33.282752Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"cited_work":{"arxiv_id":"2603.14686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.14686","snapshot_observed_at":"2026-08-04T01:52:33.282752Z","title":null,"venue":null,"work_id":"b20be148-7368-4a2e-8332-958a47edf80a","year":2026},"citing_paper":{"arxiv_id":"2606.24498","last_updated":"2026-06-23T12:30:04Z","snapshot_observed_at":"2026-08-05T20:07:28.394395Z","submitted_at":"2026-06-23T12:30:04Z","title":"VistaRef: Boosting Visual Spatial Orientation Awareness for Pointing-to-Object Detection","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-26T00:59:43.745654Z"},"links":{"cited_paper":"/paper/2603.14686","citing_paper":"/paper/2606.24498"},"observation_digest":"sha256:79153c115e5ea06e49e5714be89817a8ca8a9439cea6cd2f345bbfb0f3ed2164","observation_id":"38925e92-2ad6-4530-97bb-74311b3b8347","resolution":{"observed_at":"2026-08-04T01:52:33.282752Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.14686/citation-record","integrity":"/paper/2603.14686/integrity","json":"/paper/2603.14686/citation-record.json","paper":"/paper/2603.14686"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-04T05:51:18.098812Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.098812Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:431e3b45872c8d68e8d2778700e5745d9d93b02c6d4ed692620748d8a87a5e6c","observation_id":"b1aa708c-375e-4a52-867e-68f4f8ab4712","resolution":{"observed_at":"2026-08-04T05:51:18.098812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.105517Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.105517Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:6d8d87e4c99a380102fd5737226a522d640078b84356f180c1de06090d5885e6","observation_id":"e29c055a-350e-4ff8-9f65-44c65b6e6ee6","resolution":{"observed_at":"2026-08-04T05:51:18.105517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-04T20:35:29.456194Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-08-04T05:51:18.110781Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.110781Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:1c041208ed8812c05a21c7546111664a1eac089783dc36f13ab314464b08b844","observation_id":"e55e8956-b8f0-4f28-8a80-3d82ee835944","resolution":{"observed_at":"2026-08-04T05:51:18.110781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.115975Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.115975Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:a780ec57f20d2b29a713eb3850197d3d34963bf666bcfb3e99e623ff9a354a60","observation_id":"b510ec62-daa0-4da5-ae4a-7cb0773c249d","resolution":{"observed_at":"2026-08-04T05:51:18.115975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.120659Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.120659Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:201e2aa010b12012a398873f0822b429ae4fd2b81b825e6f1a914cc8ce24b9cd","observation_id":"d18c06b5-69be-4030-9fce-1223b936dc7b","resolution":{"observed_at":"2026-08-04T05:51:18.120659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.126833Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.126833Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:0c5bb957c2295a9e0a151ae36e77591f7b003313b4632b5f9b793d886d6388aa","observation_id":"9ff5ed00-7ae5-492b-b778-91a3e60a7ea9","resolution":{"observed_at":"2026-08-04T05:51:18.126833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.138845Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.138845Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:982f36454e47cdc285a5b0f9f6b0c765c2995f310561b072e048f1b5c742b55d","observation_id":"490134c9-613a-49b7-b5bf-be4e2c19bd48","resolution":{"observed_at":"2026-08-04T05:51:18.138845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.143944Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.143944Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:19c4ee764ebef607525200e4d1b7e8c14fd525708cc61e61e74078220370e046","observation_id":"c6840a51-fe24-4d12-a38e-61f3f85afeb0","resolution":{"observed_at":"2026-08-04T05:51:18.143944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-04T05:51:18.152357Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.152357Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:33daaf0b58f217dc2da88c113ba6adea35077fbc0da9766de34b07f055f32f93","observation_id":"038ae1d7-c724-47d8-860d-9402ba8ba5e0","resolution":{"observed_at":"2026-08-04T05:51:18.152357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-04T05:51:18.157830Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.157830Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:a78b36c2912978715fce243101d7fa88576d3cae12083093d2a651a09371a94b","observation_id":"bb95b24b-9a80-490d-b510-3b6420cf8919","resolution":{"observed_at":"2026-08-04T05:51:18.157830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17117","last_updated":"2024-06-13T06:37:20Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T12:27:15Z","title":"Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17117","snapshot_observed_at":"2026-08-04T05:51:18.163164Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.163164Z"},"links":{"cited_paper":"/paper/2311.17117","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:1c7749fa7b1a7f37118caf51183e5864148d78a5071d7dc89d4ebae34a9d43e6","observation_id":"133b439f-3eac-4fb4-9b53-14a50f0180d9","resolution":{"observed_at":"2026-08-04T05:51:18.163164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-07-06T21:20:22.224369Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-04T05:51:18.169044Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.169044Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:6c626350fd5b39240620c38dec94573c63854811f18c2188ebb88f69381cbc10","observation_id":"c97ce011-c67f-4cbf-a1d6-0403d5d9fecc","resolution":{"observed_at":"2026-08-04T05:51:18.169044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-07-29T23:52:03.880515Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08797","snapshot_observed_at":"2026-08-04T05:51:18.179232Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.179232Z"},"links":{"cited_paper":"/paper/2506.08797","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:8303af9c2676edb07de27d96e61b1e8043b83353d27f89fc82a55d7b6287f0cd","observation_id":"d6adda24-10da-4a15-b2b2-8317664b43b4","resolution":{"observed_at":"2026-08-04T05:51:18.179232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08634","last_updated":"2024-07-11T16:15:47Z","snapshot_observed_at":"2026-07-06T18:44:57.578408Z","submitted_at":"2024-07-11T16:15:47Z","title":"RTMW: Real-Time Multi-Person 2D and 3D Whole-body Pose Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08634","snapshot_observed_at":"2026-08-04T05:51:18.185135Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.185135Z"},"links":{"cited_paper":"/paper/2407.08634","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:aa434e55e86fbd3cd354109a7156ce33981973a026f1412aa272198774e1bee4","observation_id":"cd5008ab-a760-4c54-a698-5794c5011dfa","resolution":{"observed_at":"2026-08-04T05:51:18.185135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.192246Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.192246Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:2f7ddfa4a34e0635a3eaaf7e8f94ee0da3f3816b562f4d51aa251e840fe423a5","observation_id":"ce23bc03-0137-4b26-82cf-d439a1628d84","resolution":{"observed_at":"2026-08-04T05:51:18.192246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-04T05:51:18.204730Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.204730Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:2f4fc14d6e8bde7e92356dd1da56a9a07707bd5fbce27f7a15c0064d7b92c2de","observation_id":"b218307f-9b56-46b9-9a4b-36196cf3f4be","resolution":{"observed_at":"2026-08-04T05:51:18.204730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-07-06T22:35:46.018050Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-08-04T05:51:18.215614Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.215614Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:600125bdba51826c964cbaabd44801748900f17bdc06d77f98b6f90b8f87d9e7","observation_id":"c5b06e17-aa0b-4273-a73b-8b29735ecb1a","resolution":{"observed_at":"2026-08-04T05:51:18.215614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.221154Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.221154Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:fbc8d4c2aaedd57e0c165a709275fce5d93b6b75a15bb58d1f47b12c6faa1334","observation_id":"e21ede37-84ea-46d8-a57f-ad12acb28182","resolution":{"observed_at":"2026-08-04T05:51:18.221154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-07-06T20:37:18.647879Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-04T05:51:18.232473Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.232473Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:8b6fcdcd24c977736106bc0d23cbd2aedd99d23225f30aa9140ab43d53c033e2","observation_id":"b16c105f-f6af-4215-ad0b-6fb297f91cdc","resolution":{"observed_at":"2026-08-04T05:51:18.232473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-04T05:51:18.237773Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.237773Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:5d089300612f71508cc37943441c526fd63a4be9f030e6ae00dce1a0bf0a654d","observation_id":"16979f16-ebb9-4677-b32a-776376fd6c4f","resolution":{"observed_at":"2026-08-04T05:51:18.237773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.243683Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.243683Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:8455a4ed1a48c1e78566b224a36ccc6b89c31a02f73738e27bdb7e67c6688e6d","observation_id":"04d54133-eb18-4228-a6f2-5658f12fa613","resolution":{"observed_at":"2026-08-04T05:51:18.243683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.255365Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.255365Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:44a24d173228f3904ee6afbd53846b9ba1337b7d9606502cb27b8ef840e29b86","observation_id":"f01654d5-378e-4f14-9079-a98f9a64b87e","resolution":{"observed_at":"2026-08-04T05:51:18.255365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.260833Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.260833Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:a45c23639938aea44e90b44dda316d04cb48b1fc717350b25c2a9c6cf0b580fc","observation_id":"068d8b06-fb24-4022-888d-ab858b393888","resolution":{"observed_at":"2026-08-04T05:51:18.260833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-04T05:51:18.267443Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.267443Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:0c598f760d0e3bd97f0d4a54af658cb34d4590d85ddebbe76b5e066bb06f7e53","observation_id":"5c40f80d-7768-49f7-a28a-f4b114bbe64c","resolution":{"observed_at":"2026-08-04T05:51:18.267443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.248963Z","title":"InProceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.248963Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:da55c645332c743e885dff744fb6b28376b2f1a27af2e1d5b999f6f51f70a535","observation_id":"04532f0f-0f71-4dac-8848-862446cf5bc6","resolution":{"observed_at":"2026-08-04T05:51:18.248963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.278318Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.278318Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:9976859c184b48f9567a47e2a865ea201cc8b667ad4f4dd23cfdb99c74ba6d86","observation_id":"455c3f13-6a47-4e7c-af02-b4c4abf191af","resolution":{"observed_at":"2026-08-04T05:51:18.278318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-04T05:51:18.283800Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.283800Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:877ec3e4698f7bc05900766d360f2c0e02f28287b4911dec8328d8c34fa324ec","observation_id":"18119a37-0603-4057-9a07-671a26fcbc29","resolution":{"observed_at":"2026-08-04T05:51:18.283800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.288763Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.288763Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:38997187b96a170677eb0d4355eb64a561f34521e0630f23a75b3392f9f67e87","observation_id":"e32f25a6-a742-480c-a4dc-8e7b60e0d4a6","resolution":{"observed_at":"2026-08-04T05:51:18.288763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.272924Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.272924Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:602ce078aa488e0e6eee1de7d9d18c5fe71a15ac996c5fd2b31dd043a42640f2","observation_id":"3f551690-9f63-4a02-b25b-03ae57310c35","resolution":{"observed_at":"2026-08-04T05:51:18.272924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.300737Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.300737Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:45b38eae316946165c89e6fba0884264beb3ef46dbd05657ef4965e3ad16b4aa","observation_id":"6aebffb1-0f1a-44a7-86ae-ab297ce6e65e","resolution":{"observed_at":"2026-08-04T05:51:18.300737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13347","last_updated":"2026-03-07T07:01:59Z","snapshot_observed_at":"2026-08-02T12:12:15.465550Z","submitted_at":"2025-07-17T17:59:53Z","title":"$\\pi^3$: Permutation-Equivariant Visual Geometry Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13347","snapshot_observed_at":"2026-08-04T05:51:18.305928Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.305928Z"},"links":{"cited_paper":"/paper/2507.13347","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:3e527283bce5b95200ef804c0561ff59b1c1c2c670b8071eefd54cc7124d695b","observation_id":"6b6c40c3-0cb7-466a-804b-f41bee43aa1f","resolution":{"observed_at":"2026-08-04T05:51:18.305928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.311084Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.311084Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:e8869374f1072f7e6069cac1a23f255cb0afa3c56ca16af3f19f1c12a17740bf","observation_id":"03da2018-497a-4bf2-9c50-105062db989f","resolution":{"observed_at":"2026-08-04T05:51:18.311084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10568","last_updated":"2025-08-27T03:34:57Z","snapshot_observed_at":"2026-07-06T21:40:55.071294Z","submitted_at":"2025-06-12T10:58:23Z","title":"DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10568","snapshot_observed_at":"2026-08-04T05:51:18.294240Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.294240Z"},"links":{"cited_paper":"/paper/2506.10568","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:4d440737b56d18a25a3aa6237ad29e5d82bc632385e4e4acd5255957b6f8d076","observation_id":"be3e3eba-ad2f-4489-b69e-9ae609aadbb7","resolution":{"observed_at":"2026-08-04T05:51:18.294240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.321386Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.321386Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:194419ddcec812e04ac65b02233adc0cdda511066706d4763747658f535cb988","observation_id":"3040c207-a712-458a-84e4-e2076723cad9","resolution":{"observed_at":"2026-08-04T05:51:18.321386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.326505Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.326505Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:6ca51039a4094e1d17882c9749579d05f9e84a5c99cb060c028e74a05aa536cd","observation_id":"500fe1d5-d8c3-499e-a066-fcbdc3341779","resolution":{"observed_at":"2026-08-04T05:51:18.326505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.331988Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.331988Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:06fa0f14003af2b77114c319317e43513e652de22eedd0951df4eec279c40860","observation_id":"c5a55f1f-e6f0-4b1e-bd12-009264df94b3","resolution":{"observed_at":"2026-08-04T05:51:18.331988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17383","last_updated":"2025-06-23T06:27:21Z","snapshot_observed_at":"2026-07-06T19:57:14.289258Z","submitted_at":"2024-11-26T12:42:13Z","title":"AnchorCrafter: Animate Cyber-Anchors Selling Your Products via Human-Object Interacting Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17383","snapshot_observed_at":"2026-08-04T05:51:18.316887Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.316887Z"},"links":{"cited_paper":"/paper/2411.17383","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:e9c9eb671d638ad5a2d99f8a585673a0ed42eb035a9153ec79f90b638a9a177d","observation_id":"6604432f-ebaa-4d44-a338-b4e6769e4fa7","resolution":{"observed_at":"2026-08-04T05:51:18.316887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-04T05:51:18.341928Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.341928Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:c16c2818b1e4d10e7d944391516f3d7719f3271e03fec81ca03f3b77f0cc2e1e","observation_id":"a3c75d5f-5f17-46d8-a0a3-a045909e59d5","resolution":{"observed_at":"2026-08-04T05:51:18.341928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.347090Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.347090Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:f95775eb1b118dced6e6f67370a096297742f2165d927d3626aaf22a71bd9c5e","observation_id":"51ff2502-47e8-4c67-9e06-75716d625942","resolution":{"observed_at":"2026-08-04T05:51:18.347090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.18154","last_updated":"2025-09-16T19:41:48Z","snapshot_observed_at":"2026-07-06T22:30:31.933240Z","submitted_at":"2025-09-16T19:41:48Z","title":"MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.18154","snapshot_observed_at":"2026-08-04T05:51:18.351672Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.351672Z"},"links":{"cited_paper":"/paper/2509.18154","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:e684e89e9e23092276a1f88ccf1c2e2ff393cdb39ea393b1efb38fbf9e441fb7","observation_id":"ac46fc77-f504-4418-8c2e-e76e0b9c3484","resolution":{"observed_at":"2026-08-04T05:51:18.351672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.336435Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.336435Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:7e5460cbea3a5a898586e3cebe097c34218c4b37c7bd914ac011cd89345e56c3","observation_id":"ed2c303c-9e75-4f58-9952-0a77f0615b85","resolution":{"observed_at":"2026-08-04T05:51:18.336435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.362675Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.362675Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:05b39a055455bf7f0bf934072edc8c48de71fd8fdb5aa22ea44c6ad7aa08a4f2","observation_id":"13bfb6fa-cde1-4de3-9fb3-a6e25a97abc5","resolution":{"observed_at":"2026-08-04T05:51:18.362675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.368996Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.368996Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:9ed32018dd2f29db26a215e2b3d258093f8232d3b3ded99767fde629f78f6dff","observation_id":"bacbffde-6624-4b81-93d3-eaa7844ff749","resolution":{"observed_at":"2026-08-04T05:51:18.368996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.357386Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.357386Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:66addf4e4097109cd4ed2227cb53ab600b9a63e2b72f7dc34741202fed66b068","observation_id":"69f03735-c228-4fb3-b692-a0287f117ffa","resolution":{"observed_at":"2026-08-04T05:51:18.357386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-04T05:51:18.226041Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.226041Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:7fe6310763a6b01507bc7b887c75d36a5ae9735052e97190d77342e7fc9a0a79","observation_id":"89f85e54-5606-424c-b4e4-237bd2bbec87","resolution":{"observed_at":"2026-08-04T05:51:18.226041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:51:18.132547Z","title":"InProceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.132547Z"},"links":{"citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:1ee00b522a9f3d5913bc2548fc9144441907717507508f3a0e28726842266b8d","observation_id":"ed24f181-dec8-4e7a-a322-aaee1267b8d0","resolution":{"observed_at":"2026-08-04T05:51:18.132547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-08-04T05:51:18.200198Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.200198Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:3531ba8acd56990b9bbf3c5f7d06b99dd10b997101077a1d5c3a287244669963","observation_id":"c19dee81-eaf7-4b91-be3f-d3db49139466","resolution":{"observed_at":"2026-08-04T05:51:18.200198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T16:10:21.190160Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 2 inbound Pith citation observations for arXiv:2603.14686."}