{"as_of":"2026-08-09T16:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bd5085939ade38d1172f8f67869e7a86dbf1518fe9cce815088710f767f207b2","coverage":[{"denominator":100,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:09:52.157133Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:10:16.251424Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T09:16:00.558630Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"cited_work":{"arxiv_id":"2507.16813","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.16813","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2507.16813 (2025)","venue":null,"work_id":"3a57c8b7-050b-4f16-a631-98f44de090bb","year":2025},"citing_paper":{"arxiv_id":"2604.10675","last_updated":"2026-04-12T14:59:52Z","snapshot_observed_at":"2026-07-31T19:59:13.487552Z","submitted_at":"2026-04-12T14:59:52Z","title":"HiddenObjects: Scalable Diffusion-Distilled Spatial Priors for Object Placement","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T16:10:16.251424Z"},"links":{"cited_paper":"/paper/2507.16813","citing_paper":"/paper/2604.10675"},"observation_digest":"sha256:fcc9fa06ef36aa1ecc01078b0ab5b86ef874e16b02a3e742d31aa60d77870cb4","observation_id":"9dbe7051-51e7-48a5-83ec-949d504ce1a1","resolution":{"observed_at":"2026-05-11T09:16:00.561806Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.16813/citation-record","integrity":"/paper/2507.16813/integrity","json":"/paper/2507.16813/citation-record.json","paper":"/paper/2507.16813"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.811077Z","title":"Break- a-scene: Extracting multiple concepts from a single image","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.811077Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:d5caea48ac850771d97978ebcdf0b28b15f2c5ece98001e2b4ae14e37858df9f","observation_id":"ed18336e-b048-4630-9f88-488ab3eb687b","resolution":{"observed_at":"2026-08-06T15:09:51.811077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.814804Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.814804Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:88d102ed584b17d1379758341ce9eed863bdda4a1d0bdca42bdce95adb3c53f8","observation_id":"5d6e5b88-3520-4023-8d4f-2faf0e387e61","resolution":{"observed_at":"2026-08-06T15:09:51.814804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.817354Z","title":"FLUX.1-dev: A 12B Parameter Rectified Flow Transformer for Text- to-Image Generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.817354Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:3d3b6d6936e074cc06d7653903ae05a4753d49b14012871182ec7bf29781b24a","observation_id":"115f9948-6260-4bb3-b81b-f08064930164","resolution":{"observed_at":"2026-08-06T15:09:51.817354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.819691Z","title":"FLUX.1-Fill-dev: A 12B Parameter Rectified Flow Transformer for Inpainting and Outpainting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.819691Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:e9e92339512af5043ab47edd487a38a152ede85293c92fdacc94feeddf88a046","observation_id":"c16919f3-1083-457a-8326-558826f3fe2c","resolution":{"observed_at":"2026-08-06T15:09:51.819691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.823401Z","title":"Learning to detect human- object interactions","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.823401Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:2880b8885d4b653168ceb76b0075747c2c28eae02dbf80d9e901b32e6ae582e7","observation_id":"07b9bb78-7e67-48d1-ab58-e8a4ee7a79c1","resolution":{"observed_at":"2026-08-06T15:09:51.823401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09985","last_updated":"2024-05-16T11:05:41Z","snapshot_observed_at":"2026-07-06T18:15:11.806744Z","submitted_at":"2024-05-16T11:05:41Z","title":"VirtualModel: Generating Object-ID-retentive Human-object Interaction Image by Diffusion Model for E-commerce Marketing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09985","snapshot_observed_at":"2026-08-06T15:09:51.827735Z","title":"Vir- tualmodel: Generating object-id-retentive human-object interaction image by diffusion model for e-commerce marketing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.827735Z"},"links":{"cited_paper":"/paper/2405.09985","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:d01eba6ef8c9ae092c5630396e5f8edc2fd59926e196ec42fe08e2ca632a68a3","observation_id":"a14fc399-cdc0-432d-83ab-1876cacd0bc5","resolution":{"observed_at":"2026-08-06T15:09:51.827735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07462","last_updated":"2025-04-04T02:49:47Z","snapshot_observed_at":"2026-07-06T19:48:49.553384Z","submitted_at":"2024-11-12T00:53:20Z","title":"MureObjectStitch: Multi-reference Image Composition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07462","snapshot_observed_at":"2026-08-06T15:09:51.831665Z","title":"Mureobjectstitch: Multi- reference image composition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.831665Z"},"links":{"cited_paper":"/paper/2411.07462","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:49e2c9c0a730bd4c85bdb632b6f1f775ee5e9668f27f40e4ee6928fe7429805e","observation_id":"71e90b04-8313-468d-9f49-19e1ebd4b47f","resolution":{"observed_at":"2026-08-06T15:09:51.831665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.835950Z","title":"Zero-shot image editing with reference imitation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.835950Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:3e40f522f63a16c3a31d9161434cc1df34985106bcb25d51e08c6689cf4613d3","observation_id":"a0d73fb8-a4e9-41f4-b47a-8df4998a5e72","resolution":{"observed_at":"2026-08-06T15:09:51.835950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.838813Z","title":"Anydoor: Zero-shot object-level image customization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.838813Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:0c3eeb59e68ccfbbf7c49b814a65550ad04a943876e7d3e9d05e480fda458e71","observation_id":"276243ef-989c-4e05-b2e9-303d1c154cb7","resolution":{"observed_at":"2026-08-06T15:09:51.838813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07774","last_updated":"2024-12-11T22:51:08Z","snapshot_observed_at":"2026-08-09T15:18:14.347319Z","submitted_at":"2024-12-10T18:59:55Z","title":"UniReal: Universal Image Generation and Editing via Learning Real-world Dynamics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07774","snapshot_observed_at":"2026-08-06T15:09:51.842385Z","title":"Unireal: Universal image generation and editing via learning real-world dynamics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.842385Z"},"links":{"cited_paper":"/paper/2412.07774","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:bf01e7cf87a20b48b5456dbbe07f3d2afbcd27ea0ea667845235b3f1fb992629","observation_id":"c7c9f2e3-1128-46a8-b834-678c30e3a6bd","resolution":{"observed_at":"2026-08-06T15:09:51.842385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.847815Z","title":"Freecom- pose: Generic zero-shot image composition with diffusion prior","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.847815Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:99e32634796712f2e26a83bdac223274d35a28d5a1ca08ad5af0e4b87c35d4f9","observation_id":"b7ee04c4-05a0-4f79-ba76-6f5bd34eabde","resolution":{"observed_at":"2026-08-06T15:09:51.847815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10391","last_updated":"2025-03-13T14:07:58Z","snapshot_observed_at":"2026-08-07T17:07:00.747879Z","submitted_at":"2025-03-13T14:07:58Z","title":"CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10391","snapshot_observed_at":"2026-08-06T15:09:51.852399Z","title":"Cinema: Coherent multi-subject video generation via mllm-based guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.852399Z"},"links":{"cited_paper":"/paper/2503.10391","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:e6612dac0748bbdc9d805d9e3d888e128facc466c33b49ce80aa89e7292b1d99","observation_id":"6a475883-7016-4dfc-a2ec-e9afb0e3bc01","resolution":{"observed_at":"2026-08-06T15:09:51.852399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.856592Z","title":"Freecustom: Tuning-free customized image generation for multi-concept composition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.856592Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:1f85bd2037be8bb5a48e7ba787c5232f17d5053e7db08f7973ba8feab2eb9d40","observation_id":"4165daa2-b811-4678-a41e-b2a04924021f","resolution":{"observed_at":"2026-08-06T15:09:51.856592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.860076Z","title":"Wish you were here: Context-aware human generation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.860076Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:100b6c2f28360a23a4a8aaaed0575ecd98502f9afcc9fa554db19c661d928bec","observation_id":"6720d0b7-54fd-4909-83ef-943eaf455485","resolution":{"observed_at":"2026-08-06T15:09:51.860076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.864545Z","title":"Mix-of-show: Decentralized low-rank adaptation for multi-concept customization of diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.864545Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:f76642a5fa5da811416fcaa553b91b4212245667b96b03f3507bb1a990724289","observation_id":"62d7d043-55c8-4833-9ab6-5a8d6f44cbf9","resolution":{"observed_at":"2026-08-06T15:09:51.864545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14462","last_updated":"2025-04-20T20:58:33Z","snapshot_observed_at":"2026-07-31T03:16:46.613029Z","submitted_at":"2024-12-19T02:23:13Z","title":"Affordance-Aware Object Insertion via Mask-Aware Dual Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14462","snapshot_observed_at":"2026-08-06T15:09:51.868938Z","title":"Affordance- aware object insertion via mask-aware dual diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.868938Z"},"links":{"cited_paper":"/paper/2412.14462","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:bfaf58d19e0b61acdb627c605358b9b49a6218cbf1881d9ba88f02e3e4342553","observation_id":"8bfc216a-2152-4c65-9926-8e6e7bf65499","resolution":{"observed_at":"2026-08-06T15:09:51.868938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.872140Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.872140Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:fbcc63b948587b79252d0fc0947922bd32e97e4febb2ced671b76ed76a06d0b4","observation_id":"d8a3a203-3c13-4f23-a701-25fbedd054a0","resolution":{"observed_at":"2026-08-06T15:09:51.872140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.876044Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.876044Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:35a58abbf3ebd94d8353f1c7a11d6a0ef978460db3e81f651e0cab7216248fe6","observation_id":"2e72bdc0-083a-45fb-a6a7-05c7753de006","resolution":{"observed_at":"2026-08-06T15:09:51.876044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.879982Z","title":"Interactd- iffusion: Interaction control in text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.879982Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:b8dadeadb625cd5d185a9be348f10205fbb4bf567245ded26c25667d17765632","observation_id":"1a3ec387-9a9e-4346-9cef-e045f22dd502","resolution":{"observed_at":"2026-08-06T15:09:51.879982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.883706Z","title":"Viewdiff: 3d-consistent image generation with text-to-image models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.883706Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:2f8e38b81a8270580b92b4d9fb474749d59870c5fd801846b00f5d7ddc984634","observation_id":"993078cc-1f6d-48bf-8198-c173378142b2","resolution":{"observed_at":"2026-08-06T15:09:51.883706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.888637Z","title":"Visual compositional learning for human-object interaction detection","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.888637Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:a1af0d13e9f31b8fe738824c6bb009e8691205c56345f5af5f34f85009b03714","observation_id":"8886dd1f-f97a-416c-95a3-0866569e45e1","resolution":{"observed_at":"2026-08-06T15:09:51.888637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.893852Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.893852Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:a2290a4b8f0ac7abef8ca514ee391a27704576909147c41ba35e9e48ba0cb797","observation_id":"73d05ac8-292f-4225-9cec-a4b7af85f2f9","resolution":{"observed_at":"2026-08-06T15:09:51.893852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.897617Z","title":"Personahoi: Effortlessly improving personalized face with human-object interaction generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.897617Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:283e2d9ad67dbe7b561a7b913796bca308e0dcf7753a1595cc55ef620884ff2f","observation_id":"e6d77a1c-518b-4342-9996-10517a50ea18","resolution":{"observed_at":"2026-08-06T15:09:51.897617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.901746Z","title":"Exploiting relationship for complex-scene image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.901746Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:ff0847df4b0f83446ba25d422d6288ecca8447f5e5450b78e0e9aea84033f1a4","observation_id":"7261d2b6-ba3a-42b0-8e1b-2d23c7935f55","resolution":{"observed_at":"2026-08-06T15:09:51.901746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08291","last_updated":"2025-04-11T06:49:33Z","snapshot_observed_at":"2026-08-07T16:06:38.172609Z","submitted_at":"2025-04-11T06:49:33Z","title":"DreamFuse: Adaptive Image Fusion with Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08291","snapshot_observed_at":"2026-08-06T15:09:51.907290Z","title":"Dreamfuse: Adaptive image fusion with diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.907290Z"},"links":{"cited_paper":"/paper/2504.08291","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:4b1e3de21f40f2e348a155842b1e93a67288587843540dac76033d2ba080b17a","observation_id":"8187005a-14c6-462b-9f67-4a3ba9334d54","resolution":{"observed_at":"2026-08-06T15:09:51.907290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.910447Z","title":"Learning disentangled identifiers for action-customized text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.910447Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:28221cfd1a48757b8c1057df9cedcf4ff56d230793bd4e8dffbf5d49a548ce53","observation_id":"adaee832-258e-477e-bc5f-eaee05f6ee22","resolution":{"observed_at":"2026-08-06T15:09:51.910447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.779364Z","title":"Reversion: Diffusion- based relation inversion from images","venue":null,"work_id":"fad4ec91-a93d-478f-8332-7ea0f1267f1d","year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.913217Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:0cb510a41c21af4a45b072a3fe100bdad0845a74cadbfe881638b6f7d1aad7df","observation_id":"6ce4cb8b-b1fc-45ce-8dc4-fbb7bb7e00ff","resolution":{"observed_at":"2026-08-06T15:09:52.782812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-09T07:08:45.191663Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08797","snapshot_observed_at":"2026-08-06T15:09:51.916002Z","title":"Hunyuanvideo-homa: Generic human-object interaction in multimodal driven human animation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.916002Z"},"links":{"cited_paper":"/paper/2506.08797","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:c50063a554c59c4a02deac6f0fa1bfb720b45961c893588a0b8c2d456afb7ddc","observation_id":"d4776e48-b2a1-4f33-9ac4-7b64aa05c48d","resolution":{"observed_at":"2026-08-06T15:09:51.916002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.770986Z","title":"Record: Reasoning and correcting diffusion for hoi generation","venue":null,"work_id":"8ca6d228-ce92-49ac-99d9-6734b9c2b202","year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.918115Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:57e4bebcd06b57d9f521042571abcd2e8b980968cf3663c535b67857a68df56f","observation_id":"21cadbf3-7552-4276-bafb-39d23715ffad","resolution":{"observed_at":"2026-08-06T15:09:52.774309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.763660Z","title":"Dense text-to-image generation with attention modulation","venue":null,"work_id":"7a4594b9-b4ba-4c24-9b7d-957603d3fa54","year":2023},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.920210Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:9817a3c5d9512ae358b975fe81205b9c8208daa9a81c2ba3c5044b83122e91ab","observation_id":"bb6069d9-0fed-4005-a4b0-f1f72b9f9cf4","resolution":{"observed_at":"2026-08-06T15:09:52.766424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-06T15:09:51.922532Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.922532Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:452fff2a0b1a540af09bb9e31f87702efd159f31861271889cbb4e8d55194653","observation_id":"42d2d036-a046-4627-b9b5-5e8c20f2a3fb","resolution":{"observed_at":"2026-08-06T15:09:51.922532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.754810Z","title":"Omg: Occlusion-friendly personalized multi-concept generation in diffusion models","venue":null,"work_id":"00b48026-db9d-449f-9073-78a135c6581d","year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.926105Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:380be4c6c53b630dccbe7740f1ecf496fa057fd5271caba11db8e0be8070e291","observation_id":"9076c9fe-5d87-45a4-9264-0a5d32b7ce55","resolution":{"observed_at":"2026-08-06T15:09:52.758149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.747012Z","title":"Multi- concept customization of text-to-image diffusion","venue":null,"work_id":"dd968693-0212-43e1-b9a7-144493d79117","year":1931},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.929156Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:d9011863e5adf18e34e19303c62957397c5f795ad694d3f3019b3ba4c4e59f36","observation_id":"75f140a1-cea5-436a-b96a-7fcef0d545ae","resolution":{"observed_at":"2026-08-06T15:09:52.750131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.739313Z","title":"Bifrost: 3d-aware image compositing with language instructions","venue":null,"work_id":"8306852d-eb03-4579-8aab-fcf4c3d8ca2b","year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.931725Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:177441a7e45d6c8a17408a89febaaa38c2904f60ee0dc18a6b3385714ca75e67","observation_id":"06eaf5da-ac7b-41e7-b1b1-f08918ee3b84","resolution":{"observed_at":"2026-08-06T15:09:52.743059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.729841Z","title":"Tuning-free image customization with image and text guidance","venue":null,"work_id":"d45226c2-79b3-4f88-a285-75d7f5f8073d","year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.934829Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:4aee5d8891855fa335ca9a0bcc7d2aeb4f194b125a35d19d9d884217cfaf56c3","observation_id":"29a70a0d-4dd9-468a-afab-c715f02898d2","resolution":{"observed_at":"2026-08-06T15:09:52.733724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.722563Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":"f420c779-83ba-49bc-95af-68e7b4895199","year":2023},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.937426Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:a3850cd1ae8033108e088ed8e9407882027c970cc33dafcc5854ce0b39c45d93","observation_id":"4d32225c-d0cc-4e08-9474-26a7554233d8","resolution":{"observed_at":"2026-08-06T15:09:52.725180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.714890Z","title":"V odiff: Controlling object visibility order in text-to-image generation","venue":null,"work_id":"e0d018cd-f655-48b8-bbd6-58464c19adcc","year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.940091Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:a51568589b0366a7661ecccb740a807bef2014a882820903ef80dde3c11d0275","observation_id":"1dca9f8e-bd4f-4adf-9ea5-871f14f24c6a","resolution":{"observed_at":"2026-08-06T15:09:52.717679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07802","last_updated":"2025-02-04T22:03:26Z","snapshot_observed_at":"2026-08-09T14:38:43.851921Z","submitted_at":"2025-02-04T22:03:26Z","title":"Movie Weaver: Tuning-Free Multi-Concept Video Personalization with Anchored Prompts","version":1},"cited_work":{"arxiv_id":"2502.07802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.07802","snapshot_observed_at":"2026-08-06T15:09:52.323188Z","title":"Movie Weaver: Tuning-Free Multi-Concept Video Personalization with Anchored Prompts","venue":"cs.CV","work_id":"d7b3f0ef-7eb9-4170-9754-fef4926100fd","year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.943559Z"},"links":{"cited_paper":"/paper/2502.07802","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:2b142cb55770130b5da979e76be823355b4b43af85fcbb9c738959a3994c1dea","observation_id":"c00fb4a8-7d60-431e-aec0-32313ac32ead","resolution":{"observed_at":"2026-08-06T15:09:52.326566Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06914","last_updated":"2024-05-11T05:01:53Z","snapshot_observed_at":"2026-07-06T18:12:55.888082Z","submitted_at":"2024-05-11T05:01:53Z","title":"Non-confusing Generation of Customized Concepts in Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06914","snapshot_observed_at":"2026-08-06T15:09:51.946426Z","title":"Non-confusing generation of customized concepts in diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.946426Z"},"links":{"cited_paper":"/paper/2405.06914","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:6a2577163b6811976f937d8928f8cd1d240c95b7be7a8d04154c2ee54417922b","observation_id":"503ac487-5895-4966-82f5-cce8ddef8501","resolution":{"observed_at":"2026-08-06T15:09:51.946426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.705215Z","title":"Multitwine: Multi-object compositing with text and layout control","venue":null,"work_id":"2273f6aa-b689-41cf-969c-b93a1faeb462","year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.949501Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:739b6756f568d69d56c6b818c84717e968fdc989f47cce73b52e5841a4e5716d","observation_id":"345f6a6d-7698-433d-b2a0-4e89dfffae21","resolution":{"observed_at":"2026-08-06T15:09:52.708187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-06T15:09:51.952110Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.952110Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:434be537540a4307b11c536bafd5b61c126717e3d55a4b19da0c14f524af0543","observation_id":"cc7642ca-0f65-423b-a358-cde7df09886c","resolution":{"observed_at":"2026-08-06T15:09:51.952110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-08-06T15:09:51.955415Z","title":"Step1x-edit: A practical framework for general image editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.955415Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:39da125f641718d78afe4bd926a5ffec8903db1be16001b4fad8aeeeb29c5c6b","observation_id":"5b9a9f26-62c3-4025-9d68-1e1a2eb0f3d1","resolution":{"observed_at":"2026-08-06T15:09:51.955415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.696186Z","title":"Cones 2: Customizable image synthesis with multiple subjects","venue":null,"work_id":"b2991606-fb0d-4179-acf0-b48306c20517","year":2023},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.958800Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:4e892ae07cbd610a1c3e9597b15ef701ac053316a40adb197f59709d1f0b8016","observation_id":"af1ef0c8-436b-4f78-8477-caf19687093a","resolution":{"observed_at":"2026-08-06T15:09:52.699844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.687296Z","title":"Customizable image synthesis with multiple subjects","venue":null,"work_id":"3d13806a-7197-4aba-9aa1-330f7bbfdf8f","year":2023},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.961615Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:5b1d55f9d0b5f41df0b0f136fb5dbf7d031c93f2662928e2b4591a1a027aa00f","observation_id":"c011002a-5c92-4a15-8892-3f02667b8676","resolution":{"observed_at":"2026-08-06T15:09:52.690717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.679066Z","title":"Tf-icon: Diffusion-based training-free cross-domain image composition","venue":null,"work_id":"f8237926-ffd2-4fbd-9659-3df625d33224","year":2023},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.964465Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:56324ba0fc7b8b855efeb73efd84e64876ec7dc954509d6723561a51473b4806","observation_id":"1f983e4d-8462-423e-a32e-f391be661b7f","resolution":{"observed_at":"2026-08-06T15:09:52.682514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.671674Z","title":"Midjourney official website, 2025","venue":null,"work_id":"0d8e9e12-0697-4018-9355-4de42bad28eb","year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.967872Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:b60cbc254bb882bfdfb784e7e27de73a897a817d4343a80f35e2b83aefee0897","observation_id":"7d7c8db5-4b94-4942-992e-8077c94648ca","resolution":{"observed_at":"2026-08-06T15:09:52.674659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01595","last_updated":"2025-04-09T22:27:10Z","snapshot_observed_at":"2026-07-31T11:14:27.360156Z","submitted_at":"2024-10-02T14:33:12Z","title":"KnobGen: Controlling the Sophistication of Artwork in Sketch-Based Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01595","snapshot_observed_at":"2026-08-06T15:09:51.971446Z","title":"Knobgen: Controlling the sophistication of artwork in sketch-based diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.971446Z"},"links":{"cited_paper":"/paper/2410.01595","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:5452e1188c66505ffba70890870063dc20d9950d2dd558d2aa03f5e3499c32cf","observation_id":"c3452eeb-f38e-43e1-a68b-2edc40bb3c6e","resolution":{"observed_at":"2026-08-06T15:09:51.971446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.663577Z","title":"ChatGPT (model 4o)","venue":null,"work_id":"e59a14cd-f941-478d-b851-fb9dd12ecd73","year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.975854Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:bb04d6ebd8864527977b4607c75888a043a607e20d4c39d5c2b4921032c045e1","observation_id":"a4b9a08b-1723-4573-8cbe-2879831a12e4","resolution":{"observed_at":"2026-08-06T15:09:52.666093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.656928Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":"a2f93323-487c-490f-917e-d1f8f27fc386","year":null},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.979097Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:3efa956f4aed77da18e4b64a0c89fa691c52f4cc537c988bb827892bf5cccb12","observation_id":"13728ab1-97ad-4454-8061-328573ef80bc","resolution":{"observed_at":"2026-08-06T15:09:52.659499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.649082Z","title":"Text2place: Affordance- aware text guided human placement","venue":null,"work_id":"dc1f81b3-cdc2-42b5-8d21-abd1c0eed4ec","year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.983400Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:e5c7865146bebda998ef88c858c52a6f1052459091113421d86c3873c5a65f88","observation_id":"eaca2cea-2cf9-44c6-b097-271b3cb8f025","resolution":{"observed_at":"2026-08-06T15:09:52.651994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.640589Z","title":"Zero-shot image-to-image translation","venue":null,"work_id":"d2e83d51-7368-42b3-8bac-faedf01799ab","year":2023},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.988266Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:ca96347fb1649b5d238edfafa07d5d235d78f70b4fa6010cd75e46b753e3f568","observation_id":"56864d56-b00c-4d37-8773-9234312d0c0c","resolution":{"observed_at":"2026-08-06T15:09:52.643637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.629515Z","title":"λ-eclipse: Multi-concept personalized text-to-image diffusion models by leveraging clip latent space","venue":null,"work_id":"b1615185-22fa-4eab-8d04-f4a1a598934c","year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.991550Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:6b6b1e7de76e78754dda4b50987550229ef72d782a1f7a7db56093696ee2da9f","observation_id":"f5464fc4-6f71-4e3b-b791-0b205276ee35","resolution":{"observed_at":"2026-08-06T15:09:52.634351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.995141Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.995141Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:6ccf349c69d12f6bf2750890b3b4eca63dc04b35780a1e65716bd0d6ef8e1c2a","observation_id":"dc234698-b939-4eec-881a-dc0171dde865","resolution":{"observed_at":"2026-08-06T15:09:51.995141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.617817Z","title":"Tale: Training-free cross-domain image compo- sition via adaptive latent manipulation and energy-guided optimization","venue":null,"work_id":"79b731ff-a1e6-4fe9-a6a4-b61179bad43e","year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.998236Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:2e459c53f65a1d3242cac4ee75433b2a6beceb4fedf6f4f9422c884ec9ccdc64","observation_id":"702a73d5-6006-44fe-b065-6f2d144f8b89","resolution":{"observed_at":"2026-08-06T15:09:52.620670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.001379Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.001379Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:d15b4151fde2035ca8a10e140c0f8e11d8bdafdbad75b109ee5ffda2ee83c0d2","observation_id":"503750af-c2b3-4e65-9a6c-c30c9c28e283","resolution":{"observed_at":"2026-08-06T15:09:52.001379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-06T15:09:52.004807Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.004807Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:a91d8fabe13275370657cce33f988ad3e381aee18df9082f78a93af21f47cca9","observation_id":"1b2a1a8d-c16b-45ce-a9a9-00cfb544e2b1","resolution":{"observed_at":"2026-08-06T15:09:52.004807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.606665Z","title":"Relightful harmonization: Lighting-aware portrait background replacement","venue":null,"work_id":"4ac5a00e-cfa1-41ab-b850-99059ef56c9e","year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.008018Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:1d79962cde77947c5f3390b510dca4d5e5299d373963ead6ec3b30a8572aa4b4","observation_id":"f4622964-fb1a-4638-b594-15c73309c29b","resolution":{"observed_at":"2026-08-06T15:09:52.609403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02489","last_updated":"2024-07-02T17:59:50Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:50Z","title":"Magic Insert: Style-Aware Drag-and-Drop","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02489","snapshot_observed_at":"2026-08-06T15:09:52.011646Z","title":"Magic insert: Style-aware drag-and-drop","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.011646Z"},"links":{"cited_paper":"/paper/2407.02489","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:0cc5b52857c9ba0a7219193b2e6c005faec341b8886dc11d5e7b8f6fd6883804","observation_id":"4d553b18-9d5f-48d9-be37-419847459179","resolution":{"observed_at":"2026-08-06T15:09:52.011646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.598285Z","title":"Clic: Concept learning in context","venue":null,"work_id":"e92dea16-bd5d-45a9-ae5a-dc8f3fe437a5","year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.015306Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:bf25e33cf865f2d151682bfe496d98e76c45704fbddda2f5eb330e12abeb5715","observation_id":"cf0b856f-3bc8-4215-b440-68c5e4f1569e","resolution":{"observed_at":"2026-08-06T15:09:52.601949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.589434Z","title":"Dreamrelation: Bridging customization and relation generation","venue":null,"work_id":"8d55f6d7-a9f2-410a-bdda-cad5399b0206","year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.018375Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:ef7c609a80a138e3ec6f7b226994260a0df1e220cbd4a02db288c514c879717d","observation_id":"f359e179-9697-4b0e-8b8a-36d140db4a16","resolution":{"observed_at":"2026-08-06T15:09:52.592306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15110","last_updated":"2023-10-23T17:18:59Z","snapshot_observed_at":"2026-07-06T16:37:19.963994Z","submitted_at":"2023-10-23T17:18:59Z","title":"Zero123++: a Single Image to Consistent Multi-view Diffusion Base Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15110","snapshot_observed_at":"2026-08-06T15:09:52.022125Z","title":"Zero123++: a single image to consistent multi-view diffusion base model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.022125Z"},"links":{"cited_paper":"/paper/2310.15110","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:30b1fd6114314908165c2c4857076eda5f5a6e4ec770c1f38ed5f3a88b3f50ee","observation_id":"21daeac7-cf4e-40c9-8a3c-12851d850d14","resolution":{"observed_at":"2026-08-06T15:09:52.022125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15009","last_updated":"2025-04-21T10:19:12Z","snapshot_observed_at":"2026-08-07T16:00:37.570235Z","submitted_at":"2025-04-21T10:19:12Z","title":"Insert Anything: Image Insertion via In-Context Editing in DiT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15009","snapshot_observed_at":"2026-08-06T15:09:52.025934Z","title":"Insert anything: Image insertion via in-context editing in dit","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.025934Z"},"links":{"cited_paper":"/paper/2504.15009","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:b0850cd3ccdf4691a7d80b451924a62c31b13b55971c85c7b3560192c0d2552e","observation_id":"57c960d5-28b2-4f3f-9a97-2ddaa2697eae","resolution":{"observed_at":"2026-08-06T15:09:52.025934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.581393Z","title":"Objectstitch: Object compositing with diffusion model","venue":null,"work_id":"af257bb6-a401-4168-92d2-85eea49cb34c","year":2023},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.028811Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:254dad43e8fde560d756cdad4f6338a89946fa9335b7c9924a109ab591308db2","observation_id":"03a069b7-71c9-4cee-ba5e-4ffc29083fc1","resolution":{"observed_at":"2026-08-06T15:09:52.584587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.574498Z","title":"Imprint: Generative object compositing by learning identity-preserving representation","venue":null,"work_id":"362e6e76-8069-4c06-b3df-922c6e595998","year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.032194Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:6b27398029dbe38a33df4ef55e1a4e4892bc389872fbf28d0c8ec4988c5ac89e","observation_id":"2d55c796-6530-4dcb-9286-202a46492679","resolution":{"observed_at":"2026-08-06T15:09:52.577372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10090","last_updated":"2025-09-09T08:10:04Z","snapshot_observed_at":"2026-07-06T19:15:52.640101Z","submitted_at":"2024-09-16T08:44:17Z","title":"InteractPro: A Unified Framework for Motion-Aware Image Composition","version":3},"cited_work":{"arxiv_id":"2409.10090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10090","snapshot_observed_at":"2026-08-06T15:09:52.272181Z","title":"InteractPro: A Unified Framework for Motion-Aware Image Composition","venue":"cs.CV","work_id":"a6396ad9-f8b0-4227-a991-17b7a78f6af6","year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.036162Z"},"links":{"cited_paper":"/paper/2409.10090","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:1d456e11de40131449f7701c2fac4420507b2b2d6c753d4cf5d7edbd9dd5b95f","observation_id":"e413a9c6-ed14-4ac8-9f52-869b501e09cf","resolution":{"observed_at":"2026-08-06T15:09:52.274742Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04559","last_updated":"2024-09-11T11:05:56Z","snapshot_observed_at":"2026-07-30T16:35:31.547244Z","submitted_at":"2024-09-06T18:42:30Z","title":"Thinking Outside the BBox: Unconstrained Generative Object Compositing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04559","snapshot_observed_at":"2026-08-06T15:09:52.039883Z","title":"Thinking outside the bbox: Unconstrained generative object compositing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.039883Z"},"links":{"cited_paper":"/paper/2409.04559","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:926c988d1c0f46db483d2a6c595e4199f9a2b9f9a20d07a217cae88d4b7466ec","observation_id":"b8f52c38-0ac2-4196-94a9-df380c6c979d","resolution":{"observed_at":"2026-08-06T15:09:52.039883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.565042Z","title":"Key-locked rank one editing for text-to-image personalization","venue":null,"work_id":"767a466a-8594-448f-af80-1f1758a30e09","year":2023},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.043355Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:c537cd7c0349f9da087830671763dce2caa21008c0804bdc3dde19a8a9060e14","observation_id":"e1ef27a9-0d41-4a38-afc9-c6599ebdb142","resolution":{"observed_at":"2026-08-06T15:09:52.568641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21291","last_updated":"2025-07-27T05:54:21Z","snapshot_observed_at":"2026-08-09T08:06:22.574714Z","submitted_at":"2025-02-28T18:21:08Z","title":"MIGE: Mutually Enhanced Multimodal Instruction-Based Image Generation and Editing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21291","snapshot_observed_at":"2026-08-06T15:09:52.047840Z","title":"Mige: A unified framework for multimodal instruction-based image generation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.047840Z"},"links":{"cited_paper":"/paper/2502.21291","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:997d59a19f45dd3333fb728a157641c8d678220a836c5e4977fca48f4c384cbf","observation_id":"b72d1a01-eb1f-4750-88f5-29d4ae36769a","resolution":{"observed_at":"2026-08-06T15:09:52.047840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.557759Z","title":"Sv3d: Novel multi-view synthesis and 3d generation from a single image using latent video diffusion","venue":null,"work_id":"5e2c320d-87b5-45b6-85e4-7ec754be62ee","year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.050865Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:6782847c64c427b163b0303a43902e00abb1c3fb7d2f94efc079689ece4fe02a","observation_id":"f8e7b813-4b1a-4d4e-b884-96cb7b791df8","resolution":{"observed_at":"2026-08-06T15:09:52.560549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09277","last_updated":"2025-07-08T14:44:44Z","snapshot_observed_at":"2026-08-09T09:54:46.850976Z","submitted_at":"2025-03-12T11:22:47Z","title":"UniCombine: Unified Multi-Conditional Combination with Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09277","snapshot_observed_at":"2026-08-06T15:09:52.055327Z","title":"Unicombine: Unified multi-conditional combination with diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.055327Z"},"links":{"cited_paper":"/paper/2503.09277","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:82222f6fec0f795df6feabe1bc113f4e819f58f7760fd3e92ec09ff40ddf6b89","observation_id":"0e28d8ae-57fc-4f0f-9097-bcc7a67cc72a","resolution":{"observed_at":"2026-08-06T15:09:52.055327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10568","last_updated":"2025-08-27T03:34:57Z","snapshot_observed_at":"2026-08-08T16:12:04.523586Z","submitted_at":"2025-06-12T10:58:23Z","title":"DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10568","snapshot_observed_at":"2026-08-06T15:09:52.059140Z","title":"Dreamactor-h1: High-fidelity human-product demonstration video generation via motion-designed diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.059140Z"},"links":{"cited_paper":"/paper/2506.10568","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:afa064db79981b258de595d84e5750a238ef392aee38bcbc684530c397473909","observation_id":"b382ba05-d73c-4728-9785-9a213ceaca1e","resolution":{"observed_at":"2026-08-06T15:09:52.059140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.547956Z","title":"Ms-diffusion: Multi- subject zero-shot image personalization with layout guidance","venue":null,"work_id":"3de33b06-d0ce-424f-99a6-afe505c6ecb7","year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.062320Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:833632df22a14ca8e8a088e50e868bb0d0ac2fdf127f3054bfca18a3c58bf284","observation_id":"08233f5d-4e60-4a72-af9b-b06ba6bb2442","resolution":{"observed_at":"2026-08-06T15:09:52.551975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07433","last_updated":"2024-11-18T03:14:37Z","snapshot_observed_at":"2026-07-06T19:00:35.877802Z","submitted_at":"2024-08-14T10:08:46Z","title":"MagicFace: Training-free Universal-Style Human Image Customized Synthesis","version":5},"cited_work":{"arxiv_id":"2408.07433","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.07433","snapshot_observed_at":"2026-08-06T15:09:52.240666Z","title":"MagicFace: Training-free Universal-Style Human Image Customized Synthesis","venue":"cs.CV","work_id":"aae83266-4b78-40bd-b36a-042184ce75cc","year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.065561Z"},"links":{"cited_paper":"/paper/2408.07433","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:e5f260d7474f6eb4318d4bc6d17490a20867ffe70d3f7db9087bcde0afc41295","observation_id":"25ba812d-a5a1-4d4d-8248-9431b24a4573","resolution":{"observed_at":"2026-08-06T15:09:52.244758Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.536884Z","title":"Primecomposer: Faster progres- sively combined diffusion for image composition with attention steering","venue":null,"work_id":"ff53188a-f5e2-477d-8b3f-f68ef3d6429e","year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.068684Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:f42325105d65ba1fcd956890f1c97b29cce875763a91c8cf6a8f23ff9b6a5ef2","observation_id":"7051b153-49b1-490e-9a43-862a5a64f864","resolution":{"observed_at":"2026-08-06T15:09:52.540111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.528856Z","title":"Genartist: Multimodal llm as an agent for unified image generation and editing","venue":null,"work_id":"fe19d7cd-831d-4a2c-898e-5c8526132a85","year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.071798Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:69e95a48296e22cbe76b4e249fece5d6cdafc3ca1f5b5e2b103eb2fd3a577cb5","observation_id":"842b2310-9005-47d2-9831-2c5b3512871e","resolution":{"observed_at":"2026-08-06T15:09:52.531545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.520468Z","title":"Bovik, Hamid R","venue":null,"work_id":"cc469d80-0094-4958-bfb3-f9eadcd3fb4f","year":2004},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.076265Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:6f360e1ac35a1c7cf5bbd6315f391373ec0e1ba215311fd292884d9c2fb4fe20","observation_id":"8f67df96-7107-4fb7-bbda-94e3422c2cf0","resolution":{"observed_at":"2026-08-06T15:09:52.524530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07602","last_updated":"2025-03-10T17:58:03Z","snapshot_observed_at":"2026-08-07T17:15:55.158517Z","submitted_at":"2025-03-10T17:58:03Z","title":"DreamRelation: Relation-Centric Video Customization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07602","snapshot_observed_at":"2026-08-06T15:09:52.079999Z","title":"Dreamrelation: Relation-centric video customization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.079999Z"},"links":{"cited_paper":"/paper/2503.07602","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:a5089d0abdc28bad26e3aab3bb36c5d68da193f8a8050fd8b713627ef0d102da","observation_id":"9cf37dbe-199e-4135-bb5c-e83c83eb9bda","resolution":{"observed_at":"2026-08-06T15:09:52.079999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.511432Z","title":"Objectdrop: Bootstrapping counterfactuals for photorealistic object removal and insertion","venue":null,"work_id":"b2ae0a00-ad82-4a19-b30e-25ea9f1b0aab","year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.084330Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:72db2302884008fb932b5c16c0bcfb7c540e265d12d3446afcc33074b670562c","observation_id":"78cf577c-67e9-46d4-98df-7b5f9215cbc2","resolution":{"observed_at":"2026-08-06T15:09:52.515245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08645","last_updated":"2024-12-11T18:59:53Z","snapshot_observed_at":"2026-08-05T05:04:08.112463Z","submitted_at":"2024-12-11T18:59:53Z","title":"ObjectMate: A Recurrence Prior for Object Insertion and Subject-Driven Generation","version":1},"cited_work":{"arxiv_id":"2412.08645","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.08645","snapshot_observed_at":"2026-08-06T15:09:52.222434Z","title":"ObjectMate: A Recurrence Prior for Object Insertion and Subject-Driven Generation","venue":"cs.CV","work_id":"5c765a1e-bc86-4cca-9550-bdd5430170e7","year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.088769Z"},"links":{"cited_paper":"/paper/2412.08645","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:05f04b4003f05212605b5f4baff2a9c40ce680d92f773733474f28ba6ba2cfa7","observation_id":"bd7641f1-f00b-4fed-acf5-c73b20daf700","resolution":{"observed_at":"2026-08-06T15:09:52.226241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15203","last_updated":"2025-07-16T02:44:24Z","snapshot_observed_at":"2026-08-07T17:59:57.905654Z","submitted_at":"2025-02-21T04:37:18Z","title":"FlipConcept: Tuning-Free Multi-Concept Personalization for Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2502.15203","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.15203","snapshot_observed_at":"2026-08-06T15:09:52.212068Z","title":"FlipConcept: Tuning-Free Multi-Concept Personalization for Text-to-Image Generation","venue":"cs.CV","work_id":"8d3bac73-ecaf-4fda-adfd-45c031760a94","year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.092223Z"},"links":{"cited_paper":"/paper/2502.15203","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:fb925a62e729e8e17d56db02793fdcfb6832d934c3a8cf6af796f2574cbf20f3","observation_id":"878baf73-971e-42be-b096-699708387510","resolution":{"observed_at":"2026-08-06T15:09:52.214972Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.504085Z","title":"Grok 3: The age of reasoning agents","venue":null,"work_id":"5b8267fd-132c-4345-a851-923b26a3b56b","year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.095149Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:86e830a08089af27aa3e32088b1e06923c28326cd66c428f431b1f4cd14ac059","observation_id":"5434697e-7de5-44a1-a75d-6c7343bc95de","resolution":{"observed_at":"2026-08-06T15:09:52.506846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.493606Z","title":"Fastcom- poser: Tuning-free multi-subject image generation with localized attention","venue":null,"work_id":"e471d56c-ee99-4efe-b513-bff40dbf1dbf","year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.098561Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:ddcec76420225f74095d171eb49363596208744f09643afad5bbcda4262b4166","observation_id":"742dda4c-5e05-4442-b001-820d7382c49f","resolution":{"observed_at":"2026-08-06T15:09:52.497338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.485750Z","title":"Omnigen: Unified image generation","venue":null,"work_id":"4244928e-6708-468e-8071-8f51e43d3cab","year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.101424Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:fb5b88e08adae83c0d8f3646fa14c5d822ad4f11d7cf3528993a7f97aa794e19","observation_id":"5d8f95d4-0baf-458b-ba27-b3ca9b9468a9","resolution":{"observed_at":"2026-08-06T15:09:52.489168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17383","last_updated":"2025-06-23T06:27:21Z","snapshot_observed_at":"2026-07-06T19:57:14.289258Z","submitted_at":"2024-11-26T12:42:13Z","title":"AnchorCrafter: Animate Cyber-Anchors Selling Your Products via Human-Object Interacting Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17383","snapshot_observed_at":"2026-08-06T15:09:52.104100Z","title":"Anchorcrafter: Animate cyberanchors saling your products via human-object interacting video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.104100Z"},"links":{"cited_paper":"/paper/2411.17383","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:55850d6591e70164c92e5dcfbff7ab0ecf6e346ace5cef852fed80b739a1eecc","observation_id":"ed5c4d0d-5c6f-45f0-91a5-816dd67ca666","resolution":{"observed_at":"2026-08-06T15:09:52.104100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.476848Z","title":"Dccf: Deep comprehensible color filter learning framework for high-resolution image harmonization","venue":null,"work_id":"fdd964b1-53ea-4dec-820a-0e77ec4bcb41","year":2022},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.107661Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:1b07d243fb56b1054b6f4c30a6ba9cc1102dea02614b35f5d726c5a2992e28be","observation_id":"224c3492-320e-4327-a3c6-18187db0f485","resolution":{"observed_at":"2026-08-06T15:09:52.480129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.468741Z","title":"Hoi-swap: Swapping objects in videos with hand-object interaction awareness","venue":null,"work_id":"9a0395c7-8d35-4df4-93be-25a40b09a772","year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.111863Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:78074c555ddaf94f3e640a125f35728ebe5524b7c6bd9f4bc8a75cac7b0cd6af","observation_id":"2955b0e1-be60-4b83-b110-b630a5dbe3c8","resolution":{"observed_at":"2026-08-06T15:09:52.472510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.459562Z","title":"Paint by example: Exemplar-based image editing with diffusion models","venue":null,"work_id":"6024cbf8-c29b-4af5-b106-51919b75e620","year":2023},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.114501Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:69149df7183114a52a5a629e9aa9f22f222c1f4b3a04005bd15a81c538bf0d33","observation_id":"0f3d2f42-e8b9-4dc8-8752-e5782521f395","resolution":{"observed_at":"2026-08-06T15:09:52.463089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.451422Z","title":"Person in place: Generating associative skeleton-guidance maps for human-object interaction image editing","venue":null,"work_id":"4b5d255a-9432-4cf4-8db6-ed41228e2cda","year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.118039Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:7dd469e3788aa4b74e5fc0bd315adc0185283ea74af76ee94d8632d56db33fa4","observation_id":"fa23813d-8958-4446-97ca-8688d5b32dc3","resolution":{"observed_at":"2026-08-06T15:09:52.454786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.444022Z","title":"Effective whole-body pose estimation with two-stages distillation","venue":null,"work_id":"fef50b69-81d9-405b-a413-72c982e6bac3","year":2023},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.120596Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:671ae85a5e4325d5d37878a9192936daf7a7851fbd9394ed1eb80f349cafc96c","observation_id":"ba2ec26e-c7d1-4c4d-b5e9-c7b859cd82ff","resolution":{"observed_at":"2026-08-06T15:09:52.447059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15958","last_updated":"2026-04-06T07:28:38Z","snapshot_observed_at":"2026-08-06T06:03:56.041460Z","submitted_at":"2025-04-22T14:55:23Z","title":"FreeGraftor: Training-Free Cross-Image Feature Grafting for Subject-Driven Text-to-Image Generation","version":5},"cited_work":{"arxiv_id":"2504.15958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.15958","snapshot_observed_at":"2026-08-06T15:09:52.193617Z","title":"FreeGraftor: Training-Free Cross-Image Feature Grafting for Subject-Driven Text-to-Image Generation","venue":"cs.CV","work_id":"d69e98b4-e9e8-4dcf-a245-91c0b86d13b9","year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.124381Z"},"links":{"cited_paper":"/paper/2504.15958","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:ceb412570722bdd057f8bc128bb63b7127399a346b13aa46ddaecd4cf59c5928","observation_id":"843460e8-3291-412b-8ce5-530fe2e8dd60","resolution":{"observed_at":"2026-08-06T15:09:52.198656Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.435536Z","title":"Affordance diffusion: Synthesizing hand-object interactions","venue":null,"work_id":"b967a89c-a0ad-4042-8440-d24bc8159215","year":2023},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.128145Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:2db09252f95a500fc7ce5fc6205a00e3b5559d7b1ed353407a519c6d5fe91e8e","observation_id":"ddc3259b-f62c-4e78-a57d-893cc3f6f534","resolution":{"observed_at":"2026-08-06T15:09:52.438509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08677","last_updated":"2025-03-12T17:05:47Z","snapshot_observed_at":"2026-08-07T17:12:12.799298Z","submitted_at":"2025-03-11T17:55:27Z","title":"OmniPaint: Mastering Object-Oriented Editing via Disentangled Insertion-Removal Inpainting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08677","snapshot_observed_at":"2026-08-06T15:09:52.131280Z","title":"Omnipaint: Mastering object- oriented editing via disentangled insertion-removal inpainting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.131280Z"},"links":{"cited_paper":"/paper/2503.08677","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:2b049e690a2b4353dda40891773e5e48f27813ff4370240b3e05f2b1055049e4","observation_id":"69a70a52-ee82-4d25-a2f4-d6bb15454f2f","resolution":{"observed_at":"2026-08-06T15:09:52.131280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10040","last_updated":"2023-08-19T14:56:44Z","snapshot_observed_at":"2026-07-06T16:08:00.845026Z","submitted_at":"2023-08-19T14:56:44Z","title":"ControlCom: Controllable Image Composition using Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10040","snapshot_observed_at":"2026-08-06T15:09:52.134602Z","title":"Controlcom: Controllable image composition using diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.134602Z"},"links":{"cited_paper":"/paper/2308.10040","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:c31f157bcf440bbebd2f6d2edb8e4da366661e84b74de865c7fc5699cc41955b","observation_id":"323b2a96-368a-458a-a254-e9d5062a32f7","resolution":{"observed_at":"2026-08-06T15:09:52.134602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.425386Z","title":"Efficient two-stage detection of human- object interactions with a novel unary-pairwise transformer","venue":null,"work_id":"12fc7eaf-8278-44ec-b225-1e07cc6b7201","year":2022},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.137812Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:705ef698ec0df6058e73e54447306acd4ccfab922c56f147d09080fb94d028de","observation_id":"251f5808-ef23-4ad5-a884-839ceaa2375a","resolution":{"observed_at":"2026-08-06T15:09:52.428694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.416471Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"28d6f9fb-06ba-480e-9ba1-9a29cc8933a1","year":2023},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.140138Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:2696ba9903e63a8ddae902ed109e43b40fdc03008a760980e552f957dfd49f8d","observation_id":"6a1832b4-0344-40b9-be35-d68a9b728697","resolution":{"observed_at":"2026-08-06T15:09:52.419531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05288","last_updated":"2024-01-02T10:39:11Z","snapshot_observed_at":"2026-07-06T16:58:59.299777Z","submitted_at":"2023-12-08T16:31:04Z","title":"MotionCrafter: One-Shot Motion Customization of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05288","snapshot_observed_at":"2026-08-06T15:09:52.143508Z","title":"Motioncrafter: One-shot motion customization of diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.143508Z"},"links":{"cited_paper":"/paper/2312.05288","citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:211353f5e8cae4500cb133de981ec9bd2eeb4efdb68ea3c28d5c874ea5752ce1","observation_id":"4d36eb50-8154-410c-9d21-1f4455b981d1","resolution":{"observed_at":"2026-08-06T15:09:52.143508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.406756Z","title":"A woman is holding an apple with one","venue":null,"work_id":"d5fc46b7-e490-4cb1-be9a-c4104160f714","year":2024},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.146952Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:27754169f314ac400a62e1d51719a1edbe5eb5ccbc0246b7bc59f41650510edc","observation_id":"2e4d8efb-af13-4f2b-bb61-50d5a1b8b4ed","resolution":{"observed_at":"2026-08-06T15:09:52.410538Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.397184Z","title":"Please analyze and describe a suitable type of interaction between them and generate a simple prompt for this interaction","venue":null,"work_id":"1afe439c-a67a-4dd7-ac31-79bbcb62ef78","year":null},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.150374Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:e0f32823e987a5811c80e54908347b264e0c2ad2e8a98f558e1375d518642814","observation_id":"3538ce11-bd4b-4aef-82c6-afe92e09deb3","resolution":{"observed_at":"2026-08-06T15:09:52.401474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.386889Z","title":"Please describe the position of the foreground object and give bounding box coordinates so that it aligns with the specified interaction","venue":null,"work_id":"41831ee1-a179-4037-a009-ac98a7307159","year":null},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.154265Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:753ae00afc7c8f1f16945d15bf713818393a08f0f2d98823fdacf54882d7e673","observation_id":"58cdeedb-a4cc-44b5-a7a6-5246c15fda4b","resolution":{"observed_at":"2026-08-06T15:09:52.390589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.376197Z","title":"A woman is riding a horse","venue":null,"work_id":"42423918-3d13-41fb-9343-a2bec32280aa","year":null},"citing_paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:52.157133Z"},"links":{"citing_paper":"/paper/2507.16813"},"observation_digest":"sha256:fe606c2b32b28e37f792d3163e5a40894a4194d53f8107b1b57e122f33be5a93","observation_id":"ba384412-8187-46d4-bab2-673fe9c5679d","resolution":{"observed_at":"2026-08-06T15:09:52.379525Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.16813","last_updated":"2025-07-22T17:59:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:18:21.057983Z","submitted_at":"2025-07-22T17:59:21Z","title":"HOComp: Interaction-Aware Human-Object Composition"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":6,"verified_fuzzy":45},"total_outbound_references":100},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 100 outbound references and 1 inbound Pith citation observation for arXiv:2507.16813."}