{"as_of":"2026-08-06T14:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b5d9fee8413778b9e3a54525d35289607fc4bd49dd8bc4b93aaca8ab7d80dc2b","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:09:02.727887Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:58:52.344771Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-11T12:41:04.415342Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"cited_work":{"arxiv_id":"2604.11804","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.11804","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","venue":"cs.CV","work_id":"4185c7fc-2ff2-4338-a18d-e0421d891b58","year":2026},"citing_paper":{"arxiv_id":"2604.19636","last_updated":"2026-04-21T16:25:43Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T16:25:43Z","title":"CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T03:14:45.834520Z"},"links":{"cited_paper":"/paper/2604.11804","citing_paper":"/paper/2604.19636"},"observation_digest":"sha256:edae877bd3bbd8440fef5811847994df562a4ba2359ff02d1c98f975416b55e8","observation_id":"588a0fcf-f17a-4baf-8d4d-98bc2e668000","resolution":{"observed_at":"2026-05-11T12:41:04.418452Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.11804","snapshot_observed_at":"2026-08-02T01:27:25.434955Z","title":"Omnishow: Unifying multimodal condi- tions for human-object interaction video generation.arXiv preprint arXiv:2604.11804, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14681","last_updated":"2026-07-16T07:43:27Z","snapshot_observed_at":"2026-08-06T12:57:36.194341Z","submitted_at":"2026-07-16T07:43:27Z","title":"ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:25.434955Z"},"links":{"cited_paper":"/paper/2604.11804","citing_paper":"/paper/2607.14681"},"observation_digest":"sha256:27bdac8215ea564d05d3c5fc799d1b17aedd99019c5e118ea9883b674764f105","observation_id":"b9e24e88-7ce4-47a6-b35e-5728b371dc09","resolution":{"observed_at":"2026-08-02T01:27:25.434955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.11804","snapshot_observed_at":"2026-08-03T04:58:52.344771Z","title":"Omnishow: Unifying multimodal conditions for human-object interaction video generation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29545","last_updated":"2026-07-31T15:38:56Z","snapshot_observed_at":"2026-08-06T05:12:46.100384Z","submitted_at":"2026-07-31T15:38:56Z","title":"MoRoute: Dynamic Routing for In-Context Multimodal Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T04:58:52.344771Z"},"links":{"cited_paper":"/paper/2604.11804","citing_paper":"/paper/2607.29545"},"observation_digest":"sha256:4e4b9e404e630a05f29b11fa3b5473b2d8460d734744dd92ba1690e6c1bc0d1e","observation_id":"adbe0d63-f762-49f6-80d5-4e0a436c0e7f","resolution":{"observed_at":"2026-08-03T04:58:52.344771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.11804/citation-record","integrity":"/paper/2604.11804/integrity","json":"/paper/2604.11804/citation-record.json","paper":"/paper/2604.11804"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"wav2vec 2.0: A framework for self- supervised learning of speech representations.Advances in neural information processing systems, 33:12449–12460","venue":null,"work_id":"f7b19754-3b04-4dbd-be68-925ee1cab173","year":2020},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:90b7f79d73cebc74672d7c48fb56c1bb7bd6bce3bba1d9e0ef65a84536975b4d","observation_id":"7c0e0ab3-8b5c-46a1-9ab6-317818d6db75","resolution":{"observed_at":"2026-05-18T07:42:30.119097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pyscenedetect: Python and opencv-based scene cut/transition detection program & library","venue":null,"work_id":"1070796c-ca93-4539-836b-c1ab04c50eee","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:2a88c00f375be568b46050885115669e558c7bf0d0de9f94207041ae59ff6f1e","observation_id":"0a11ef38-8f34-497f-bbe9-3778fef293b1","resolution":{"observed_at":"2026-05-18T07:42:30.122167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09985","last_updated":"2024-05-16T11:05:41Z","snapshot_observed_at":"2026-07-06T18:15:11.806744Z","submitted_at":"2024-05-16T11:05:41Z","title":"VirtualModel: Generating Object-ID-retentive Human-object Interaction Image by Diffusion Model for E-commerce Marketing","version":1},"cited_work":{"arxiv_id":"2405.09985","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09985","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Virtualmodel: Generating object-id-retentive human-object interaction image by diffusion model for e-commerce marketing","venue":null,"work_id":"f64d5898-58fe-4c67-aa20-79b3e1864eff","year":2024},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2405.09985","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:f04618cd34843ab00b78aa790e1668de8360cf029986a2dc6ca37118a5199cd8","observation_id":"d78f62b0-a7ab-4b1e-a4f5-6106ce7fac0a","resolution":{"observed_at":"2026-05-11T11:11:00.859329Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-04T20:35:29.456194Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":"2509.08519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-04T21:10:09.676485Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning","venue":null,"work_id":"313111a9-b492-44f5-bf1f-6b5c2c642abf","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:8c6e3f52f18f1f7c855ccf8bc4adf9984792ab8d118cb923ec32822a4f1e8f4b","observation_id":"c0aa2cf3-d9d9-4912-b478-6bb81d717bd9","resolution":{"observed_at":"2026-05-11T11:11:00.846071Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.12127","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:28:58.270364Z","title":"Posteromni: Generalized artistic poster creation via task distillation and unified reward feedback","venue":null,"work_id":"7e2be7d1-86aa-4430-aee2-b48185a78ee2","year":2026},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:fa17ea6074ca4a8891b6c24b8811dfff74be2f20d76814e03a03c77cb290e374","observation_id":"69fa8af0-a40b-4691-8988-975eaecdbabb","resolution":{"observed_at":"2026-05-11T11:11:00.676680Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:d178bcf31e50b623fb422386ee1560dc4679715f043f8ced4dadf7b25d17be8a","observation_id":"d234a1bb-a95d-4a21-870b-5da508d07eaa","resolution":{"observed_at":"2026-05-16T01:35:37.953991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-07-06T21:30:46.863005Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":"2505.20156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-07-05T12:41:04.394160Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters","venue":"cs.CV","work_id":"cb746e54-5ed4-4c60-903c-02e347b9ddf0","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:8e5eac1f96eef2a6264954ff7029fe038cfc44ce0157515b87d766e723ac0ea2","observation_id":"a70e2c08-2720-43c8-ab53-4ee090b879ef","resolution":{"observed_at":"2026-05-11T11:11:00.831890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Out of time: automated lip sync in the wild","venue":null,"work_id":"25cf9179-5fe9-4e6c-ba83-b0c1678a003d","year":2016},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:f32b16e83c0a8640cc07d73fcebc5ca432a51d5991035f5f41e6c867ab6710b1","observation_id":"1e0deade-a0fc-441c-a69f-1d71fc7c4483","resolution":{"observed_at":"2026-05-18T07:42:30.113205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.23525","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:48:32.699472Z","title":"Hallo4: High-fidelity dynamic portrait animation via direct preference optimization and temporal motion modulation","venue":null,"work_id":"b914f057-838a-4918-95db-e35d7f5369d2","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:7082137a6ae2be1720a08843167c9344e36cb4c34b477d36fb9c3d627597f508","observation_id":"5dda2b6c-5a65-4c0b-b65d-ebe7ba1e6547","resolution":{"observed_at":"2026-05-11T11:11:00.774839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hallo3: Highly dynamic and realistic portrait image animation with video diffusion transformer","venue":null,"work_id":"0fd7406e-60fe-4d98-8b80-b70108e76e7b","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:bde65a025b7bd33f437eccc21409de2db6648ba03a018f48144f9b50f7d7c7e6","observation_id":"b992870a-45a2-4560-9a3b-bdb6a46030d4","resolution":{"observed_at":"2026-05-18T07:42:30.053218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cg-hoi: Contact-guided 3d human-object interaction generation","venue":null,"work_id":"4d3e2252-1e8a-4411-91df-90495e37b0ee","year":2024},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:94945b537a9c354eceed249875769ded52e9c34283063e8c63cbb096f551cfaf","observation_id":"2474ed55-67f8-4df7-83a7-40a46e12e8f2","resolution":{"observed_at":"2026-05-18T07:42:30.032473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Elevenlabs: The most realistic voice ai platform","venue":null,"work_id":"766a4060-0d97-45f0-8c4c-0b13b9e68007","year":2026},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:6ace3480fe4146a4db8501f2b4e4db24f4a679f72764c19c96f774129e1216fe","observation_id":"2f250b84-4147-482e-b721-6df31f58e8e8","resolution":{"observed_at":"2026-05-18T07:42:30.055705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:05:48.537771Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"8331d9c0-b11b-4b03-89a7-e461fa541183","year":2024},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:2de3453ca7609ae68cbbd999409265e5656793874d63336001dd9e5dd075a044","observation_id":"43e4b1f9-9535-4e37-900f-e14a34faf8b9","resolution":{"observed_at":"2026-05-18T07:42:30.061791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Re-hold: Video hand object interaction reenactment via adaptive layout-instructed diffusion model","venue":null,"work_id":"8e74c2da-f70c-4bad-89ab-0b7d58ef2b20","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:bc7be6ceb431765c3fbb7dc428555bb315b84748479f87d3abf81e1a9e3d3c93","observation_id":"8038e625-0a36-4e33-a68f-f695e43e8a77","resolution":{"observed_at":"2026-05-18T07:42:30.053914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Two-frame motion estimation based on polynomial expansion","venue":null,"work_id":"752f39cf-2b8f-4f2e-8b09-46148af4d17e","year":2003},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:633947344b661aee8496fb2e91325fec1e39b71da425da79d74ab1a8ad8f81b5","observation_id":"7be73ee3-1d8f-4aa0-a671-589d0b55a3ea","resolution":{"observed_at":"2026-05-18T07:42:30.044227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-02T14:38:26.145151Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:6b5a95b68e81b7b6d68b4c6aedc785c5948de68c236d425ebb4e014b3c967cb5","observation_id":"6d430c7f-fd44-475e-80bd-e20e4a92d472","resolution":{"observed_at":"2026-05-11T11:11:00.589537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-05T01:30:44.891750Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":"2502.04847","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-07-02T16:27:09.332551Z","title":"Humandit: Pose-guided diffusion transformer for long- form human motion video generation","venue":null,"work_id":"f79a82ad-b302-40d3-bc68-724b8d3220d9","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:a1db6eb42f25b8d79f189b522ad78a2201c7decfe4189b5ebad1f72bb70755b6","observation_id":"d78da58c-5a2f-425c-a00f-78ab574cdf1f","resolution":{"observed_at":"2026-05-11T11:11:00.606070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18866","last_updated":"2025-06-23T17:33:03Z","snapshot_observed_at":"2026-07-06T21:46:30.250293Z","submitted_at":"2025-06-23T17:33:03Z","title":"OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation","version":1},"cited_work":{"arxiv_id":"2506.18866","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18866","snapshot_observed_at":"2026-07-05T12:41:04.353072Z","title":"Jianzhu Guo, Dingyun Zhang, Xiaoqiang Liu, Zhizhou Zhong, Yuan Zhang, Pengfei Wan, and Di Zhang","venue":"cs.CV","work_id":"39a3b79f-ec88-448d-a078-0ca1e7f561bc","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2506.18866","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:67dae847e3231174cae00359dbd9aa5638d5892caaed2a8418dc8684ebcd9c9e","observation_id":"12c4009b-f34c-4184-9261-dbdc18e49691","resolution":{"observed_at":"2026-05-11T11:11:00.788856Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nano banana","venue":null,"work_id":"bffc2996-c184-4ec4-b300-970a0cb13726","year":2026},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:ae6eb92469251f50ba6c1d1af9af528d562db4ca5160274c2ba09c36b21d4b54","observation_id":"5dde06dd-01e1-4411-83d8-9171573b25ad","resolution":{"observed_at":"2026-05-18T07:42:30.116094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-07-06T22:40:51.136169Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"cited_work":{"arxiv_id":"2601.03233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.03233","snapshot_observed_at":"2026-07-10T01:46:41.047035Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","venue":"cs.CV","work_id":"1334671f-ee98-4c53-a1d4-0805281f8d2b","year":2026},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2601.03233","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:b48c8a25d548845ecc26c6541fdd078fff84e7371253014557b403eb562f9e47","observation_id":"16312be4-5a15-43be-8551-a33f0c4f803c","resolution":{"observed_at":"2026-05-11T11:06:05.914673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-07-06T21:20:22.224369Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:324f63b98f8cd8ea7b4b0966215726da44a827dbd8ce2cd5d7df09e0c0babcc3","observation_id":"c1d8d2a0-a7d1-48f9-9bb7-bff428615352","resolution":{"observed_at":"2026-05-11T11:11:00.806138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magicfight: Personalized martial arts combat video generation","venue":null,"work_id":"9f5ba817-99dc-484e-ad7f-d0f21da6d49d","year":2024},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:d675c4644cb5f574cc7fdef7fbb18cd343a020c645594c0dba6a7b18407671c0","observation_id":"6863fa26-4df1-46ec-b2ed-2a160aa76563","resolution":{"observed_at":"2026-05-18T07:42:30.061022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dual-schedule inversion: Training-and tuning-free inversion for real image editing","venue":null,"work_id":"a5c5bf97-3483-4378-bc87-7316c83dc1e9","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:28e48ff5324b079a73d8831476ef4db3ef7795128c1ef3d0d1fe88baf143b500","observation_id":"db41c143-0e15-4ef0-96ed-cddfe57c7860","resolution":{"observed_at":"2026-05-18T07:42:30.070649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-07-15T23:17:31.999466Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2506.10915","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.10915","snapshot_observed_at":"2026-07-08T14:44:59.794530Z","title":"M4v: Multi-modal mamba for text-to-video generation","venue":"cs.CV","work_id":"42351ceb-2a18-4578-ba0d-b855394cb673","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2506.10915","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:398dbd3565114a02c47c98069ad6ef4bf8c3d2554534c2dc11676aef78b1962a","observation_id":"c8844a78-64e8-4506-aee1-dfe9f0ec77da","resolution":{"observed_at":"2026-05-11T11:11:00.767995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T23:14:18.016086Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"cited_work":{"arxiv_id":"2512.13677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.13677","snapshot_observed_at":"2026-08-03T03:15:29.416338Z","title":"Jova: Unified multimodal learning for joint video-audio generation","venue":null,"work_id":"db4a0fa0-6496-4b05-893b-51006ad3ac59","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2512.13677","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:dbf4ee0266d026c49963301fa1d84e320f472a5834d90ce8062d4bc55b841377","observation_id":"106168a0-6b39-4c67-a652-01b39ba9afa4","resolution":{"observed_at":"2026-08-03T03:15:29.416338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:07:50.611559Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"2383dbc4-0e5d-40ed-a102-5aac37332eae","year":2024},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:85b098d774694578c0ed662ecfe690b21a832ac3dce4b9243ed18a1c3d311595","observation_id":"5af15bff-4151-4342-8651-a88c127594c5","resolution":{"observed_at":"2026-05-18T07:42:30.041097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-07-29T23:52:03.880515Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"cited_work":{"arxiv_id":"2506.08797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08797","snapshot_observed_at":"2026-07-09T01:19:36.380554Z","title":"Hunyuanvideo- homa: Generic human-object interaction in multimodal driven human animation.arXiv preprint arXiv:2506.08797","venue":null,"work_id":"6dec4a37-023c-4e80-a013-93fb065d282f","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2506.08797","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:639d603a154b605a4c3c232d9673e285e3848885ecc33f8d81abf36d54d10cf4","observation_id":"85627e22-73e7-4684-b5a1-bea08e89bdd5","resolution":{"observed_at":"2026-07-09T01:19:36.380554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:fa79152e35401c2370ab42273461e535ac602dbd51ea7c141e0112a6d3fe664e","observation_id":"b0e241ac-e508-4514-8400-ee23df8a4e38","resolution":{"observed_at":"2026-05-11T11:06:05.898145Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":"2309.14509","doi":"10.48550/arxiv.2309.14509","metadata_source":"pith","pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","venue":"cs.LG","work_id":"bb119d0b-c7f0-412a-a426-f74bd6949a51","year":2023},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:3fba991b0da6e6cf90ff8e3c91419b21d2f36008912ce6ec1f37ddeb055c9374","observation_id":"7646f2dc-3ccc-4346-b9bf-599f0d9694a9","resolution":{"observed_at":"2026-05-13T01:07:22.650116Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-05T07:44:02.175955Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":"2409.02634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-06-29T07:53:13.362380Z","title":"Loopy: Taming audio- driven portrait avatar with long-term motion dependency","venue":null,"work_id":"859b3e77-263d-470a-b684-a710acd16630","year":2024},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:70f9289088124d546cb19e781c0897874c0fc70a075408c63488d1b1ebf031cd","observation_id":"bd328091-e011-475a-81cf-d0acb6ef7d7f","resolution":{"observed_at":"2026-05-11T11:11:00.798707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":"2503.07598","doi":"10.48550/arxiv.2503.07598","metadata_source":"pith","pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"VACE: All-in-One Video Creation and Editing","venue":"cs.CV","work_id":"c68efbde-3431-4655-a337-87e2871ad6a3","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:ac605bf1860f23cf51bcce9fb5375725130b6cab3324806c3d12188af36c4bba","observation_id":"f3b4905b-9c3c-4370-862c-3e9719185e14","resolution":{"observed_at":"2026-05-16T00:53:54.408026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:14.2036+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:14.2036+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fulldit: Video generative foundation models with multimodal control via full attention","venue":null,"work_id":"00b02f98-7b3b-42df-b853-be11f1149815","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:5300fa76ca74b3c52948cd3239fd993485f5a2d07b01bca4333f0d814689cbbc","observation_id":"d7b726b8-ea76-40d6-baae-3f7019829382","resolution":{"observed_at":"2026-05-18T07:42:30.057330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.16776","last_updated":"2025-12-18T17:08:12Z","snapshot_observed_at":"2026-07-06T22:39:28.855621Z","submitted_at":"2025-12-18T17:08:12Z","title":"Kling-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2512.16776","doi":"10.48550/arxiv.2512.16776","metadata_source":"pith","pith_arxiv_id":"2512.16776","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kling-Omni Technical Report","venue":"cs.CV","work_id":"52d502bd-9d8e-4944-9bf2-cfd097cfdb4e","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2512.16776","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:dfa483995c6dcc9a512dc2841216c0d9dcc69e364d1a02c1d1e6ac36b23e66d4","observation_id":"789d9386-e5fa-4bdc-9bb3-9bbcd33da32b","resolution":{"observed_at":"2026-05-15T21:00:58.771713Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.73319+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.73319+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":"2505.22647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-07-04T10:09:44.572116Z","title":"Let them talk: Audio-driven multi-person conversational video generation","venue":null,"work_id":"b6c07d96-7a45-4c6f-9ca7-641329c5a3b5","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:730ac0289cb06f502b80735519d9d3b3b5a9f6885788c5693c0119e4aecc789e","observation_id":"8a522e79-6f7f-40c3-9027-d8ac000648e5","resolution":{"observed_at":"2026-05-11T11:06:05.818834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-07-06T20:05:55.982214Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:e35d00e349c11e3f830129b980e8eb2cd3f13560ab0c6f822849dae9dbc34ad6","observation_id":"aedb031d-19e2-402c-90cd-b707372eda83","resolution":{"observed_at":"2026-05-11T11:11:00.648558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omnihuman-1: Rethinking the scaling-up of one-stage conditioned human animation models","venue":null,"work_id":"fae1d221-2056-419f-9c80-4fa105eb26c6","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:1b36321a687bbba07632a494cd5a3eca473a987433e1f44e5ce661482085ee2f","observation_id":"b5d5222c-58c6-4e63-a675-b14c2f4d778a","resolution":{"observed_at":"2026-05-18T07:42:30.099469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Apoavatar: Expressive audio-driven avatar generation via refocused audio-pose priors","venue":null,"work_id":"b061133d-d47e-426a-85a8-19bd371243fe","year":null},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:c780c925588d881dc5d6fdf06e83b2d443f45f38bea0905c96decdbab548f09b","observation_id":"224727c4-3375-483c-89c8-3fe684d959c7","resolution":{"observed_at":"2026-05-18T07:42:30.103213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.23002","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:43:13.994646Z","title":"JarvisEvo: Towards a self-evolving photo editing agent with synergistic editor-evaluator optimization","venue":null,"work_id":"a8df6034-be76-449d-b2a7-7f7ae72db474","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:1782e24157658b8ebb767caa652934d4e659021c3e632194297a296074183fa3","observation_id":"7d92686b-176f-4cef-9db2-f4464c4cb97b","resolution":{"observed_at":"2026-05-11T11:11:00.699778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mofu: Scale-aware modulation and fourier fusion for multi-subject video generation","venue":null,"work_id":"d4b71dd2-00f7-4959-9a3f-e7804d699956","year":2026},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:babf4d0ce1b881a822a762ccab921d32f58bea1c000425188e0b7f39e4eed4ba","observation_id":"7db8cd8d-d960-41c3-a896-f37002162a86","resolution":{"observed_at":"2026-05-18T07:42:30.110199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:dccac88756d116fe8e45923b95c1bd92f3f451872bc2c9b8b26a11bf30fb9bb2","observation_id":"6fca9cd2-8638-4bca-ac43-ed6b6e80d1c0","resolution":{"observed_at":"2026-05-11T11:06:05.833272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13918","last_updated":"2025-10-27T08:22:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-23T18:55:41Z","title":"Improving Video Generation with Human Feedback","version":2},"cited_work":{"arxiv_id":"2501.13918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.13918","snapshot_observed_at":"2026-07-04T13:19:51.115512Z","title":"Improving Video Generation with Human Feedback","venue":"cs.CV","work_id":"cfe4c01d-1cf7-4a00-ba86-06d583ca2cff","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2501.13918","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:c58c7a56777fbbb304c3a441d510e4fd4d00759d06183319ef21d1f55d1072ef","observation_id":"d395414f-ee34-4f9b-b9c6-279fdbed163f","resolution":{"observed_at":"2026-05-13T15:30:03.116566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-07-06T20:37:18.647879Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:643e61bec3aa3403f22cccd6f85fe1b1d22ee9dad5edf4204200fd516d79b975","observation_id":"78cd8348-c81b-4c6c-8519-b0c3160d0004","resolution":{"observed_at":"2026-05-11T11:06:05.893388Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.02210","last_updated":"2026-04-17T08:00:11Z","snapshot_observed_at":"2026-07-06T22:47:37.679205Z","submitted_at":"2026-03-02T18:59:36Z","title":"HiFi-Inpaint: Towards High-Fidelity Reference-Based Inpainting for Generating Detail-Preserving Human-Product Images","version":3},"cited_work":{"arxiv_id":"2603.02210","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.02210","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HiFi-Inpaint: Towards High-Fidelity Reference-Based Inpainting for Generating Detail-Preserving Human-Product Images","venue":"cs.CV","work_id":"f466d148-7377-4698-9ca6-f8c4f66cd467","year":2026},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2603.02210","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:843c347d1c0151f7d025d53537989829d880b45ea1a2e5d9afb1d53bbba8f2bf","observation_id":"40f71188-02fd-412c-b9af-d41ddf073a70","resolution":{"observed_at":"2026-05-11T11:06:05.849493Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:0deadd282fbf5d950029c7d9f8105a59248e3e71df48e4c076c8adf2a4c06143","observation_id":"780d9e9b-b15e-475f-885f-ff553ae129c0","resolution":{"observed_at":"2026-05-11T11:11:00.639353Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-06T11:49:53.749464Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"cited_work":{"arxiv_id":"2510.01284","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.01284","snapshot_observed_at":"2026-07-05T12:41:04.361399Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","venue":"cs.MM","work_id":"4ea3b1fc-d272-47f2-88a8-36cbeaa92448","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2510.01284","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:9b521baa3a737630bc5313937e4d694f00d5c023eed55bd2ea8083237e1c7c44","observation_id":"bd144a32-dee2-4f37-ac36-96724636dad6","resolution":{"observed_at":"2026-05-17T01:03:15.294735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echomimicv2: Towards striking, simplified, and semi-body human animation","venue":null,"work_id":"5f16d3f9-8067-4461-8912-d876bff2674b","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:0d9f11f472a1619e97220df73c8ce60f9a99642f64c1c5cf2c057b402a1f57a2","observation_id":"2b4c8b52-aec9-4833-8315-9f910e82535e","resolution":{"observed_at":"2026-05-18T07:42:30.082206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hoi-diff: Text-driven synthesis of 3d human-object interactions using diffusion models","venue":null,"work_id":"051402b7-3e89-4c60-b290-83c286e12b88","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:08ece8b4d5b9a74f986042bfdcfa29e5ff92f1016af9e1cee17e17f27a846b4b","observation_id":"81a642b5-b0b2-4134-a1c6-bdcf4de6de8c","resolution":{"observed_at":"2026-05-18T07:42:30.078501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.05898","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Innoads-composer: Efficient condition composition for e-commerce poster generation","venue":null,"work_id":"227dcc36-991d-406d-b14b-de466f064a47","year":2026},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:95e799a308c11dac010c2f30549bf0436ca988b3508ec0e98facdd46d71903bb","observation_id":"57c6b94f-3749-46eb-a887-b090a8b5d12f","resolution":{"observed_at":"2026-05-11T11:11:00.816000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13319","last_updated":"2025-03-31T11:03:18Z","snapshot_observed_at":"2026-07-06T20:54:00.272496Z","submitted_at":"2025-03-17T15:58:27Z","title":"MagicDistillation: Weak-to-Strong Video Distillation for Large-Scale Few-Step Synthesis","version":2},"cited_work":{"arxiv_id":"2503.13319","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.13319","snapshot_observed_at":"2026-07-03T20:48:55.720483Z","title":"Magicdistillation: Weak-to-strong video distillation for large-scale few-step synthesis","venue":null,"work_id":"bb8a052f-d70e-4522-91df-4a5c570391e5","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2503.13319","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:9bbe36c17ad4276522d9dee5e61e3d6cb1b6c169cf5664ff6847cb4e1fbac9e4","observation_id":"ed4aee16-b160-4111-aed8-b9ac8270b8e5","resolution":{"observed_at":"2026-05-11T11:06:05.806264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17588","last_updated":"2026-05-14T09:03:20Z","snapshot_observed_at":"2026-07-06T22:17:57.808775Z","submitted_at":"2025-08-25T01:22:15Z","title":"HERO: Hierarchical Extrapolation and Refresh for Efficient World Models","version":2},"cited_work":{"arxiv_id":"2508.17588","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17588","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hero: Hierarchical extrapolation and refresh for efficient world models","venue":null,"work_id":"ca81cdeb-b001-4d96-a658-ff1937f53c30","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2508.17588","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:ef7b2d6add7e5946d905c700945b6976bf907bc48a64f08e0fc4646cd0dcca21","observation_id":"89f7c18e-ebbf-42a1-9d1a-8ae16292ae35","resolution":{"observed_at":"2026-05-15T02:43:07.893654Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.22994","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:00:08.929397Z","title":"Scenedecorator: Towards scene-oriented story generation with scene planning and scene consistency","venue":null,"work_id":"ed482ccc-78af-485d-8ca7-34e1a7bdcd1e","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:fc978c24f674a453577b8d8d19b5cb1aae1f452d13fbd5da2ac6237acc95cd9f","observation_id":"fbec8712-353d-4f58-bcd6-b1bc2dbf7421","resolution":{"observed_at":"2026-05-11T11:06:05.887041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:57:26.595007Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063","venue":null,"work_id":"b5fd43ff-336f-45fd-933c-ffddf3003880","year":2024},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:9cf3e9e06805fad483c2b8aa1ad6cc67b8c1480f84d502f1459f512440482954","observation_id":"5fe34f3c-5a62-48a1-8191-9cf55f247d50","resolution":{"observed_at":"2026-05-18T07:42:30.095811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ominicontrol: Minimal and universal control for diffusion transformer","venue":null,"work_id":"96b6fef4-8ca9-41a0-972b-2aceddcbd900","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:6a35a879729d4ca9b33c9275ad097f1b180e07dbe32b1ae31d2123bc6776ce73","observation_id":"5396e65f-354a-42dd-89de-e8a75dad615d","resolution":{"observed_at":"2026-05-18T07:42:30.012286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:f39ad5aa1444c5998fcd0098eb21d0160cc9fa29bfe0026a5395b1a859ce0c2e","observation_id":"79a901a0-f9ae-4edf-836e-c405c8ea8cc1","resolution":{"observed_at":"2026-05-11T11:06:05.856685Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08153","last_updated":"2025-03-11T08:10:03Z","snapshot_observed_at":"2026-08-05T04:09:10.445597Z","submitted_at":"2025-03-11T08:10:03Z","title":"WISA: World Simulator Assistant for Physics-Aware Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2503.08153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.08153","snapshot_observed_at":"2026-07-04T13:19:51.064913Z","title":"Wisa: World simulator assistant for physics-aware text-to-video generation","venue":null,"work_id":"faa75e3b-50f4-44b5-bfe5-65f0dc911f7e","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2503.08153","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:7773deefd77820fd1ea39edff836e3e5f9c85ab1fe5b8529aca665a49a608b66","observation_id":"eb1f977d-5453-4bb6-a48c-b10c9c130485","resolution":{"observed_at":"2026-05-11T11:06:05.928659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language model based text-to-audio generation: Anti-causally aligned collaborative residual transformers","venue":null,"work_id":"928a3b3a-2a4d-4b19-a5eb-eccc96a5a25a","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:9cccc494c0c94eb66b8ce098ae83b961d93280b8081485580b9e409e2c1c20d6","observation_id":"6d2e36d4-16ea-45da-b32b-a61bb3019548","resolution":{"observed_at":"2026-05-18T07:42:30.071692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10568","last_updated":"2025-08-27T03:34:57Z","snapshot_observed_at":"2026-07-06T21:40:55.071294Z","submitted_at":"2025-06-12T10:58:23Z","title":"DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers","version":2},"cited_work":{"arxiv_id":"2506.10568","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10568","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dreamactor-h1: High- fidelity human-product demonstration video generation via motion-designed diffusion transformers","venue":null,"work_id":"fc08b140-4f49-4f5a-aa23-0788d049694a","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2506.10568","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:85a23103e7e29bcd6faefb0951b2c78b92f539389f08f0fed5d5c2924a749a10","observation_id":"f9652e81-3c17-4d91-bb19-dae390acd5be","resolution":{"observed_at":"2026-05-11T11:11:00.709409Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fantasytalking: Realistic talking portrait generation via coherent motion synthesis","venue":null,"work_id":"82a7cdd3-7242-4b03-a602-097b4c4d5335","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:38c32d3fe26bde49b1d6610c6366a1025c7ffd0d57c5e26c0501b4a15ce8872c","observation_id":"0ea98015-ddf6-441c-bedd-44687b90c40e","resolution":{"observed_at":"2026-05-18T07:42:30.024248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.09984","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In- terActHuman: Multi-concept human animation with layout- aligned audio conditions","venue":null,"work_id":"d7453402-be9f-41d2-964a-fe433fdf1dc9","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:6fd5edd326e6667ef1841e610a4adb38ecd4861f6d803a340b9cd5be043aa531","observation_id":"2becd6ce-b95d-4dc3-b932-8384b7748564","resolution":{"observed_at":"2026-05-11T11:06:05.874895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mocha: Towards movie-grade talking character generation","venue":null,"work_id":"8f663c94-7806-4bcb-b30b-45810d0d500d","year":null},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:e4d56120f6cf4c8c824869db7fa0943661cecae90bd73b03a9af2f7222fd3f91","observation_id":"d741a0f5-5443-4135-8300-49bb3c0d2ecb","resolution":{"observed_at":"2026-05-18T07:42:30.086563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:3b370b173f1bb14c9ffac9cc4ed70bb00ec426c3a7767d4763f47972aa35ed84","observation_id":"b9539934-7b00-4ba7-b8a8-243a28e219ed","resolution":{"observed_at":"2026-05-15T02:31:35.128127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.08420","last_updated":"2021-08-19T00:49:01Z","snapshot_observed_at":"2026-07-06T11:39:26.575335Z","submitted_at":"2021-08-19T00:49:01Z","title":"D3D-HOI: Dynamic 3D Human-Object Interactions from Videos","version":1},"cited_work":{"arxiv_id":"2108.08420","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.08420","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D3d-hoi: Dynamic 3d human-object interactions from videos","venue":null,"work_id":"a66c9d1a-b114-4adc-836f-a05578cf7e41","year":2021},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2108.08420","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:26f3dfcf6a7a0910f6b77ef6f3204b7beb6e5a26ba1cd835a025a5c591225c95","observation_id":"1e47092f-291f-4559-800e-6c313b8ad0c4","resolution":{"observed_at":"2026-05-11T11:11:00.722409Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magicanimate: Temporally consistent human image animation using diffusion model","venue":null,"work_id":"ee386029-3955-4a77-a8bc-e941a42e0e7b","year":2024},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:3e9c3ec161e818d915cbd40d44fdd11d61858f10534661615efa3a331c280793","observation_id":"bdb5a142-c123-418c-ad72-ad2b9f362a96","resolution":{"observed_at":"2026-05-18T07:42:30.106741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17383","last_updated":"2025-06-23T06:27:21Z","snapshot_observed_at":"2026-07-06T19:57:14.289258Z","submitted_at":"2024-11-26T12:42:13Z","title":"AnchorCrafter: Animate Cyber-Anchors Selling Your Products via Human-Object Interacting Video Generation","version":2},"cited_work":{"arxiv_id":"2411.17383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17383","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anchorcrafter: Animate cyberanchors sal- ing your products via human-object interacting video gen- eration","venue":null,"work_id":"d0853815-241f-45a2-9ca3-b04b9432e7a8","year":2024},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2411.17383","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:1b1ce5ea22963b6def8812067aad82731558dbb6d0375ef6ed775c34d322351a","observation_id":"e8344706-456b-48f0-bf70-7eb1f68e219e","resolution":{"observed_at":"2026-05-11T11:11:00.565785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Follow-your-pose v2: Multiple-condition guided character image animation for stable pose control.arXiv e-prints, pages arXiv–2406","venue":null,"work_id":"4c79c470-5c56-40e7-9f86-e13bbeddc910","year":2024},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:7663dd8e8bbe171bde68c4f80dccd4fc3cdfde65a7def7d4a167e07121872bd6","observation_id":"1de117d3-2386-4086-8726-75efef6dd041","resolution":{"observed_at":"2026-05-18T07:42:30.092349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hoi-swap: Swapping objects in videos with hand-object interaction awareness.Advances in Neural Information Processing Systems, 37:77132–77164","venue":null,"work_id":"da816e2b-f164-4dff-96c6-f326881b04ca","year":2024},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:17689c7e9eaec6381ad6fa25db405be4cb98e3dbf88ee6b59264ecb21d37771c","observation_id":"ed8bc4fc-3e2a-4194-b89f-6285583a5ccd","resolution":{"observed_at":"2026-05-18T07:42:30.016377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Effective whole-body pose estimation with two-stages distillation","venue":null,"work_id":"4a9fae5e-26a2-4d37-b787-ae2c754e6f60","year":2023},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:9e68e56aa9ee86900a4fbd70f2e252575f560706559218a3860847d11c05e913","observation_id":"715c3ac9-04bc-4eb8-83ba-5f56206943a5","resolution":{"observed_at":"2026-05-18T07:42:30.068047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion-guided reconstruction of everyday hand-object interaction clips","venue":null,"work_id":"78a5fcdf-7f4b-4c31-8cb3-131b5a0b209a","year":2023},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:b4573884cfed0a7bb54a857000a9a887524461164745a2645c3f900e6f568e98","observation_id":"6d23955a-9035-441c-8a17-9f761317c7aa","resolution":{"observed_at":"2026-05-18T07:42:30.047248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05978","last_updated":"2025-03-07T23:21:11Z","snapshot_observed_at":"2026-07-06T20:48:55.297689Z","submitted_at":"2025-03-07T23:21:11Z","title":"MagicInfinite: Generating Infinite Talking Videos with Your Words and Voice","version":1},"cited_work":{"arxiv_id":"2503.05978","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.05978","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magicinfinite: Generating infinite talking videos with your words and voice","venue":null,"work_id":"883dc780-a649-41df-baf4-a8c11df6eda0","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2503.05978","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:72d2f5e4f628d47e67619879895135ce1803abfa3bacfa33de1e4af167bf3b58","observation_id":"d85924bc-fd09-4bc1-82c1-58bee8dda5da","resolution":{"observed_at":"2026-05-11T11:11:00.823368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-07-06T21:30:52.246162Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:b32f240d6b4a1d125f6bdc9a078981e8f6a47591f6ca05bf213e235c93cf52a0","observation_id":"47eeac02-5dbc-4b30-b9c4-37208fa942b8","resolution":{"observed_at":"2026-05-11T11:11:00.839751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Identity- preserving text-to-video generation by frequency decomposition","venue":null,"work_id":"2bb4c821-d64b-4e8c-ac83-ac5773b7b93a","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:4cd9b3a800010c2986676b170a1037c21795c739e8d2c89c401df724fe89074c","observation_id":"e641314b-9792-4f9e-b913-99cd95c05601","resolution":{"observed_at":"2026-05-18T07:42:30.047787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:35:10.861683Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"3168d701-c64b-4fb9-808f-b1e9e35b1bf5","year":2023},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:73359960361c98bff650406203defbc285a6f781f87e3a29952a90ba3d04c503","observation_id":"2d4ab8e6-f913-4d1e-b7a5-a8b370588c47","resolution":{"observed_at":"2026-05-18T07:42:30.064563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:35:10.858235Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio-driven single image talking face animation","venue":null,"work_id":"4157d01c-31d5-425f-83d1-b78c39c70927","year":2023},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:d21fd5bb8a9ecadaaf8cbd8e6d9b0be1f03fbf8749f5a420edd615f878724b3b","observation_id":"199cb090-1855-4413-888f-f4b95dbb5ac4","resolution":{"observed_at":"2026-05-18T07:42:30.044544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:522e9e013745cabb4699b774811fdeb6aab9f3bdbe1d2b2f67b3dfa4ed5c6eb9","observation_id":"f57c246d-ff62-4f4c-8b9f-9827500d268f","resolution":{"observed_at":"2026-05-11T11:11:00.740481Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":"2304.11277","doi":"10.48550/arxiv.2304.11277","metadata_source":"pith","pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","venue":"cs.DC","work_id":"bee7755e-b855-401d-813a-06ae9451d768","year":2023},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:b6d416163edbc3b2d27e5c7a8b00d3a449b9934116d74a0fb6f0958ce9801950","observation_id":"1b6b86ba-0476-4aa6-afc4-89da3b0f88e7","resolution":{"observed_at":"2026-05-12T04:15:20.153254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.23475","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:50:10.474174Z","title":"Anytalker: Scaling multi- person talking video generation with interactivity refine- ment","venue":null,"work_id":"f2e60f07-9318-4b9e-9016-a2c12e46983b","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:1cec4838965a9f038b31be10500319b25b409459ae94458f3142e858bcafa55f","observation_id":"07d5f765-e915-4aa0-9739-a987e41c1b6b","resolution":{"observed_at":"2026-05-11T11:06:05.783116Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13370","last_updated":"2025-05-21T08:18:59Z","snapshot_observed_at":"2026-07-06T19:35:08.846184Z","submitted_at":"2024-10-17T09:22:53Z","title":"MagicTailor: Component-Controllable Personalization in Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":"2410.13370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13370","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magictailor: Component-controllable person- alization in text-to-image diffusion models","venue":null,"work_id":"049448a3-06e5-4317-9126-a970db810777","year":2024},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2410.13370","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:b26f150827cc038e2a5607978a789c8055d3089e0e89376b328fb6db1cf79fe6","observation_id":"366a78d4-111e-4e45-b269-d6f9b701451c","resolution":{"observed_at":"2026-05-11T11:06:05.796535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Identitystory: Taming your identity-preserving generator for human-centric story generation","venue":null,"work_id":"a0837aa8-7ea8-474b-8157-cf82c1c9d7a1","year":2026},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:bd5ea504c42ad5e940c574a085a660e29de4bde4bc7303063fe864472c26964a","observation_id":"6777b833-b724-4837-9248-097df5455720","resolution":{"observed_at":"2026-05-18T07:42:30.074870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.06905","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling zero-shot reference-to-video generation.arXiv preprint arXiv:2512.06905","venue":null,"work_id":"b80f3719-9914-4bfe-b1d4-b10a36215e38","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:9ecdd479b8081471405bf17ea4ce8c785847be053041ddbbb2122486e2df9188","observation_id":"333a1358-7d21-46e6-a6ae-6c04614f6027","resolution":{"observed_at":"2026-05-11T11:06:05.826762Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":43,"verified_fuzzy":33},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 3 inbound Pith citation observations for arXiv:2604.11804."}