{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:BEMKLZOIYHC4KZNHKZDSB7Y4R5","short_pith_number":"pith:BEMKLZOI","schema_version":"1.0","canonical_sha256":"0918a5e5c8c1c5c565a7564720ff1c8f555770a321b8793122b0af6fa5592c9d","source":{"kind":"arxiv","id":"2503.20118","version":1},"attestation_state":"computed","paper":{"title":"Zero-Shot Human-Object Interaction Synthesis with Multimodal Priors","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CV"],"primary_cat":"cs.GR","authors_text":"Mingyi Shi, Rui Zhao, Taku Komura, Wenjia Wang, Yiming Wang, Yuke Lou, Zhen Wu","submitted_at":"2025-03-25T23:55:47Z","abstract_excerpt":"Human-object interaction (HOI) synthesis is important for various applications, ranging from virtual reality to robotics. However, acquiring 3D HOI data is challenging due to its complexity and high cost, limiting existing methods to the narrow diversity of object types and interaction patterns in training datasets. This paper proposes a novel zero-shot HOI synthesis framework without relying on end-to-end training on currently limited 3D HOI datasets. The core idea of our method lies in leveraging extensive HOI knowledge from pre-trained Multimodal Models. Given a text description, our system"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.20118","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.GR","submitted_at":"2025-03-25T23:55:47Z","cross_cats_sorted":["cs.AI","cs.CV"],"title_canon_sha256":"b6c59dbefd39803fe9463a0c35fc6078f721d60df90579056d5187029c9b2345","abstract_canon_sha256":"e12b52132b5b33a1ec2fc75fecbff269bdf574d7e46550576ad7a0f2464240e1"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:39:32.568911Z","signature_b64":"ImFPi85DRXNWDkFnTVVN9Cn4ulESBsRQJvKaFyVsEtSbldsQONwRfuC9Pgq1kq7+UfzW4itSjDiFNCNnw8MxAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"0918a5e5c8c1c5c565a7564720ff1c8f555770a321b8793122b0af6fa5592c9d","last_reissued_at":"2026-07-05T10:39:32.568422Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:39:32.568422Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Zero-Shot Human-Object Interaction Synthesis with Multimodal Priors","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CV"],"primary_cat":"cs.GR","authors_text":"Mingyi Shi, Rui Zhao, Taku Komura, Wenjia Wang, Yiming Wang, Yuke Lou, Zhen Wu","submitted_at":"2025-03-25T23:55:47Z","abstract_excerpt":"Human-object interaction (HOI) synthesis is important for various applications, ranging from virtual reality to robotics. However, acquiring 3D HOI data is challenging due to its complexity and high cost, limiting existing methods to the narrow diversity of object types and interaction patterns in training datasets. This paper proposes a novel zero-shot HOI synthesis framework without relying on end-to-end training on currently limited 3D HOI datasets. The core idea of our method lies in leveraging extensive HOI knowledge from pre-trained Multimodal Models. Given a text description, our system"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.20118","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.20118/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.20118","created_at":"2026-07-05T10:39:32.568483+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.20118v1","created_at":"2026-07-05T10:39:32.568483+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.20118","created_at":"2026-07-05T10:39:32.568483+00:00"},{"alias_kind":"pith_short_12","alias_value":"BEMKLZOIYHC4","created_at":"2026-07-05T10:39:32.568483+00:00"},{"alias_kind":"pith_short_16","alias_value":"BEMKLZOIYHC4KZNH","created_at":"2026-07-05T10:39:32.568483+00:00"},{"alias_kind":"pith_short_8","alias_value":"BEMKLZOI","created_at":"2026-07-05T10:39:32.568483+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.22806","citing_title":"Policy-as-Data: Learning Generalizable HOI Diffusion Models from Simulated Physics","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2606.05160","citing_title":"GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors","ref_index":124,"is_internal_anchor":false},{"citing_arxiv_id":"2606.05359","citing_title":"Recovering Physically Plausible Human-Object Interactions from Monocular Videos","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2604.20841","citing_title":"DeVI: Physics-based Dexterous Human-Object Interaction via Synthetic Video Imitation","ref_index":26,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/BEMKLZOIYHC4KZNHKZDSB7Y4R5","json":"https://pith.science/pith/BEMKLZOIYHC4KZNHKZDSB7Y4R5.json","graph_json":"https://pith.science/api/pith-number/BEMKLZOIYHC4KZNHKZDSB7Y4R5/graph.json","events_json":"https://pith.science/api/pith-number/BEMKLZOIYHC4KZNHKZDSB7Y4R5/events.json","paper":"https://pith.science/paper/BEMKLZOI"},"agent_actions":{"view_html":"https://pith.science/pith/BEMKLZOIYHC4KZNHKZDSB7Y4R5","download_json":"https://pith.science/pith/BEMKLZOIYHC4KZNHKZDSB7Y4R5.json","view_paper":"https://pith.science/paper/BEMKLZOI","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.20118&json=true","fetch_graph":"https://pith.science/api/pith-number/BEMKLZOIYHC4KZNHKZDSB7Y4R5/graph.json","fetch_events":"https://pith.science/api/pith-number/BEMKLZOIYHC4KZNHKZDSB7Y4R5/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/BEMKLZOIYHC4KZNHKZDSB7Y4R5/action/timestamp_anchor","attest_storage":"https://pith.science/pith/BEMKLZOIYHC4KZNHKZDSB7Y4R5/action/storage_attestation","attest_author":"https://pith.science/pith/BEMKLZOIYHC4KZNHKZDSB7Y4R5/action/author_attestation","sign_citation":"https://pith.science/pith/BEMKLZOIYHC4KZNHKZDSB7Y4R5/action/citation_signature","submit_replication":"https://pith.science/pith/BEMKLZOIYHC4KZNHKZDSB7Y4R5/action/replication_record"}},"created_at":"2026-07-05T10:39:32.568483+00:00","updated_at":"2026-07-05T10:39:32.568483+00:00"}