{"as_of":"2026-08-11T12:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:384618d8bb5a3e7d0b434f5855d6703a70077ff15ef7e9ce22446d6009903416","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:30:48.007551Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.12173/citation-record","integrity":"/paper/2501.12173/integrity","json":"/paper/2501.12173/citation-record.json","paper":"/paper/2501.12173"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.682120Z","title":"Spatext: Spatio-textual representation for con- trollable image generation","venue":null,"work_id":"5d6d4e21-9e21-47f0-9c77-37e86d402277","year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.768865Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:a780fe6dd7ee69a38a740022a387a33dd5a2dc1583178b91d10b6dca05165bc8","observation_id":"d490b31e-3d0d-4c43-b68c-25bcb4026d10","resolution":{"observed_at":"2026-08-10T17:30:48.686884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08113","last_updated":"2023-02-16T06:28:29Z","snapshot_observed_at":"2026-08-07T03:49:49.341219Z","submitted_at":"2023-02-16T06:28:29Z","title":"MultiDiffusion: Fusing Diffusion Paths for Controlled Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08113","snapshot_observed_at":"2026-08-10T17:30:47.773975Z","title":"Multidiffusion: Fusing diffusion paths for controlled image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.773975Z"},"links":{"cited_paper":"/paper/2302.08113","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:f073f8a2af3f9a9fb840ae042001eeeeeed04ee374b8f5a3c75b2481a4cb352f","observation_id":"df8c0798-d017-47ee-be16-10ae77b31b18","resolution":{"observed_at":"2026-08-10T17:30:47.773975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.669598Z","title":"Sutherland, Michael Arbel, and Arthur Gretton","venue":null,"work_id":"1dc0dee5-de66-4cd9-871f-564b973274ad","year":2021},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.778737Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:76d7e1575a7938cf888dfac99d7ce106879d1042af0d4eddf3c1821fcfab00c9","observation_id":"ba481bdf-bd9b-4bab-8d27-4b19380350ed","resolution":{"observed_at":"2026-08-10T17:30:48.673792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09800","last_updated":"2023-01-18T17:31:52Z","snapshot_observed_at":"2026-08-06T07:25:23.651829Z","submitted_at":"2022-11-17T18:58:43Z","title":"InstructPix2Pix: Learning to Follow Image Editing Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09800","snapshot_observed_at":"2026-08-10T17:30:47.782994Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.782994Z"},"links":{"cited_paper":"/paper/2211.09800","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:6c27eda30d8e1a4b54d202ef7f01fe3dae6e032e1835f9793bdf977179215c1c","observation_id":"e15659c6-0fe5-466e-a797-2181377d1e4c","resolution":{"observed_at":"2026-08-10T17:30:47.782994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05793","last_updated":"2023-09-11T19:59:43Z","snapshot_observed_at":"2026-08-03T16:16:19.476471Z","submitted_at":"2023-09-11T19:59:43Z","title":"PhotoVerse: Tuning-Free Image Customization with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05793","snapshot_observed_at":"2026-08-10T17:30:47.787809Z","title":"Photoverse: Tuning-free image customization with text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.787809Z"},"links":{"cited_paper":"/paper/2309.05793","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:60a74efebfb93e1a00601d7e0ee5eb83f71e9c24702a51d08422379db51960b1","observation_id":"a7e13581-a7e8-4a81-a5d6-46a2e4255ddd","resolution":{"observed_at":"2026-08-10T17:30:47.787809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:47.792688Z","title":"Training-free layout control with cross-attention guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.792688Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:284a9d5ddbac234e3e08c37a3444557e4c4d7f98254bc6801dd403a045185db5","observation_id":"b51779b0-dd86-4f76-8c11-dd7cd6fe8f80","resolution":{"observed_at":"2026-08-10T17:30:47.792688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09481","last_updated":"2024-05-08T03:21:34Z","snapshot_observed_at":"2026-08-09T10:44:37.868390Z","submitted_at":"2023-07-18T17:59:02Z","title":"AnyDoor: Zero-shot Object-level Image Customization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09481","snapshot_observed_at":"2026-08-10T17:30:47.798320Z","title":"Anydoor: Zero-shot object-level im- age customization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.798320Z"},"links":{"cited_paper":"/paper/2307.09481","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:1f1bd2e3cd59c67a88c329be5d4001cc8fec0ae96c23bc64da38d9488adfe916","observation_id":"64544040-90d9-42c6-b024-18658ba570df","resolution":{"observed_at":"2026-08-10T17:30:47.798320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08908","last_updated":"2023-02-16T14:20:25Z","snapshot_observed_at":"2026-08-10T05:47:07.606873Z","submitted_at":"2023-02-16T14:20:25Z","title":"LayoutDiffuse: Adapting Foundational Diffusion Models for Layout-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08908","snapshot_observed_at":"2026-08-10T17:30:47.802873Z","title":"Layoutdiffuse: Adapting foundational dif- fusion models for layout-to-image generation.arXiv preprint arXiv:2302.08908, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.802873Z"},"links":{"cited_paper":"/paper/2302.08908","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:0ce087214b7b9841427e5ed47f6e60adeca861f8cb55170bbc4ab0f04c9f693a","observation_id":"84e5c1ab-d65e-4699-993f-ed758ebd7b9d","resolution":{"observed_at":"2026-08-10T17:30:47.802873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04907","last_updated":"2022-10-06T10:00:48Z","snapshot_observed_at":"2026-08-03T06:00:25.289525Z","submitted_at":"2022-03-09T17:38:03Z","title":"KPE: Keypoint Pose Encoding for Transformer-based Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04907","snapshot_observed_at":"2026-08-10T17:30:47.807837Z","title":"Pose guided multi-person image generation from text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.807837Z"},"links":{"cited_paper":"/paper/2203.04907","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:4e6f441ce450d042be31580ad206f20526c8816a2c0fc6167e98e1409ca7b74b","observation_id":"74322a34-e077-4956-a9bb-5c5d8e95b8ae","resolution":{"observed_at":"2026-08-10T17:30:47.807837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.649126Z","title":"Viton-hd: High-resolution virtual try-on via misalignment-aware normalization","venue":null,"work_id":"f5dcbe59-cc55-4f3d-aa71-a0cc4bf28bfa","year":2021},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.812542Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:c8238f139a357ebbfb14cc6554a80c9e9ef67c84973bfc259404c74772ddd5c9","observation_id":"7463dbd3-605e-4864-920a-c7f8f865d4b9","resolution":{"observed_at":"2026-08-10T17:30:48.653415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.636567Z","title":"Measures of the amount of ecologic association between species","venue":null,"work_id":"6afd80ef-a25a-45c6-8e40-b6963a1628d0","year":1945},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.816586Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:971251f9c02668ff94992c801fefe58eb906ca694b93b5da92f4e069b08d667c","observation_id":"a75b5cc1-77df-4446-a201-24c77098d514","resolution":{"observed_at":"2026-08-10T17:30:48.641094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.623555Z","title":"Stylegan-human: A data-centric odyssey of human genera- tion","venue":null,"work_id":"8ef75a8c-fa1d-486a-abed-47f24eb35267","year":2022},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.820786Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:8da4f7299d55e58b4e5b8382445559b3caadf1ee14c15987beaa572148cf0edf","observation_id":"f4ce4cb4-362e-4645-b07b-e210759a69ec","resolution":{"observed_at":"2026-08-10T17:30:48.628108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-10T17:30:47.825923Z","title":"An image is worth one word: Personalizing text-to- image generation using textual inversion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.825923Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:db2f497b2cb896aa4f39ba5e61f5c8be45b7199baf39acfb8b58b3b7af378e5f","observation_id":"c72b606b-1c4d-4089-bd16-dd1af06003e9","resolution":{"observed_at":"2026-08-10T17:30:47.825923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.610945Z","title":"A versatile benchmark for de- tection, pose estimation, segmentation and re-identification of clothing images","venue":null,"work_id":"f5e08bfa-b1e2-474a-94a9-fa9167887e93","year":2019},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.830402Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:474ad7df394cab84844af7e680a06df967712a019183c73934b0c6412e3dbebb","observation_id":"ba458290-f62a-4d56-9c3a-441c41d42976","resolution":{"observed_at":"2026-08-10T17:30:48.615396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.597253Z","title":"Context- aware layout to image generation with enhanced object ap- pearance","venue":null,"work_id":"444c8d03-7cfe-4036-a35b-bac92a210066","year":2021},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.835299Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:35e21a81396c5e29cafa3fef91a53ec45ea4645077508cb7c6c161057164d15f","observation_id":"6536aca5-b052-495a-9982-daf7022e9f41","resolution":{"observed_at":"2026-08-10T17:30:48.602017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:47.839765Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.839765Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:1006e702ef7d55b8369cc634b218cb4f050a54bdfc79273b0e772735c9d0dc72","observation_id":"75ae43e7-c555-42b4-af0a-fe35d4fb7642","resolution":{"observed_at":"2026-08-10T17:30:47.839765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-10T17:30:47.844735Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.844735Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:d9da31e868e92f25c1c1b7fd7e828967585c76e03221862ebc0b6970753cd8b7","observation_id":"e0be945d-b4ad-488d-954a-f4da9bd4ba9b","resolution":{"observed_at":"2026-08-10T17:30:47.844735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T17:30:47.849204Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.849204Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:647e32a30dfc09d2659696e5906af29c32cdf9e154e5c98833e9b853204553b0","observation_id":"66cc599d-d0ce-48dd-bff7-158d4bc5a32d","resolution":{"observed_at":"2026-08-10T17:30:47.849204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.575568Z","title":"´Etude comparative de la distribution florale dans une portion des alpes et des jura","venue":null,"work_id":"b10c4d2e-73c9-4632-a308-7d06745358d2","year":1901},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.854040Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:434788e800ca03f5a68c746cb015bf1ab9e151bd98f212817f88533b98f12485","observation_id":"d177a0fb-e45b-4063-aacc-13e6ea135bf0","resolution":{"observed_at":"2026-08-10T17:30:48.580058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.562943Z","title":"Text2human: Text-driven controllable human image generation","venue":null,"work_id":"4e22a2ff-aee9-436d-8e44-13a359b564ae","year":2022},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.858407Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:32ec92f40fdb94d3217522ff6201d24b82d346a8805d5c42096aece836bf652f","observation_id":"ee5ccada-a3ec-471c-9e24-3d1f12f62f34","resolution":{"observed_at":"2026-08-10T17:30:48.567316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.550749Z","title":"Dense text-to-image generation with attention modulation","venue":null,"work_id":"2fa3b56d-caa7-4651-941a-7d2a2ba1cfa4","year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.862430Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:cacde5cdea15533f76c2f21012a1fcd967d793490426939a7cf273053d083075","observation_id":"fd99474c-d18a-49c5-8832-fbd29d4872e3","resolution":{"observed_at":"2026-08-10T17:30:48.554819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-10T17:30:47.866740Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.866740Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:de1bffafe531c022b6027bf755ac46cd68cab565695c2044fe010ba02a386cf1","observation_id":"e86d74a4-fa59-48f2-adf9-23d908bed295","resolution":{"observed_at":"2026-08-10T17:30:47.866740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-10T17:30:47.871094Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.871094Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:d5185c590e45b23d595e35f4254cb60abb1d8a9a6dddf6fdaa984440ebdd85d5","observation_id":"c50343be-f86d-46d3-9e95-fb61a07c58c5","resolution":{"observed_at":"2026-08-10T17:30:47.871094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:47.875119Z","title":"Multi-concept customization of text-to-image diffusion","venue":null,"work_id":null,"year":1931},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.875119Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:82c21e8993a999467b241c2a618a521d89f950d8e4691531316f44f37ce06ce1","observation_id":"9a33e0e4-b2cd-445b-ad39-14aa23fdc43c","resolution":{"observed_at":"2026-08-10T17:30:47.875119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:47.879911Z","title":"Self- correction for human parsing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.879911Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:50fceeb79e41f5090e077849abfd286b32c5b1598f727e02caaae88b22b1209b","observation_id":"b658aa63-f2b8-4934-8adc-0ad7dbfcf72c","resolution":{"observed_at":"2026-08-10T17:30:47.879911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.522669Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":"5434aaa9-e243-40e9-8205-c3ae77710393","year":null},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.883877Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:0330d86f2c71993054098b7c8eaa2a52ee1649ffc66a83399be5d381787c9f38","observation_id":"94595758-8b25-4f86-8660-f8c8f87ae733","resolution":{"observed_at":"2026-08-10T17:30:48.527010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.510113Z","title":"Image synthesis from layout with locality- aware mask adaption","venue":null,"work_id":"84bb0ac6-365a-499a-8ac5-ebb3a269c4db","year":2021},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.889188Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:6f3666b46a238cd9ed4b68d433d3cab794b084c21d57f50dbd44817d0ea1db67","observation_id":"71814155-4120-4460-bfe9-62f5873f8a01","resolution":{"observed_at":"2026-08-10T17:30:48.514255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-10T17:30:47.894131Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.894131Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:31d99aba7debfe033e391eaee127dad2164666ce6caa14f61a9e4239f6410905","observation_id":"d292a7d4-5b9c-433c-ab03-2970a6ca3eb8","resolution":{"observed_at":"2026-08-10T17:30:47.894131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.496838Z","title":"Dress code: High- resolution multi-category virtual try-on, 2022","venue":null,"work_id":"70d74a45-79d0-4265-a994-3032d68a5c12","year":2022},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.901085Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:c676465ce52bc2a4496d60ff367663a68308894d41b441b35b3c14db53f50f49","observation_id":"1438a259-7aa5-4b42-8dcb-6d800e6bf84b","resolution":{"observed_at":"2026-08-10T17:30:48.501571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05195","last_updated":"2024-04-09T22:14:37Z","snapshot_observed_at":"2026-08-07T14:37:15.434465Z","submitted_at":"2024-02-07T19:07:10Z","title":"$\\lambda$-ECLIPSE: Multi-Concept Personalized Text-to-Image Diffusion Models by Leveraging CLIP Latent Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05195","snapshot_observed_at":"2026-08-10T17:30:47.906551Z","title":"λ-eclipse: Multi-concept personalized text-to-image diffusion models by leveraging clip latent space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.906551Z"},"links":{"cited_paper":"/paper/2402.05195","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:d860f4c6084e7050c1deb8dfeb0df3cab5238aeb3e1d256f3e72d2e618b3233d","observation_id":"f07dde4c-a53b-47c4-832f-dc8412757e0f","resolution":{"observed_at":"2026-08-10T17:30:47.906551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:47.911049Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.911049Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:18c1b40bf5b540d49ad8d010b35007921bf15dd8cd9d9617a389d47e4e70fbca","observation_id":"6c705960-f287-4452-90e0-032760beeb40","resolution":{"observed_at":"2026-08-10T17:30:47.911049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.475784Z","title":"High-resolution image syn- thesis with latent diffusion models, 2021","venue":null,"work_id":"da972f27-4a2e-42f7-a2f1-d43915d8eff7","year":2021},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.915124Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:138a4b5ca7b235aa3e807697b5ed55d2cf3b2d0badfc6e56529973fcb1a010d3","observation_id":"50d1761e-a282-46e0-bc46-e26e004913e6","resolution":{"observed_at":"2026-08-10T17:30:48.479983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:47.918826Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.918826Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:22870b3b784a281d0ea80ea268c43d8082c9850b29f1148d9cfbfbdcb7fba133","observation_id":"f680884f-6307-44e3-80dc-cb74615c614b","resolution":{"observed_at":"2026-08-10T17:30:47.918826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.454503Z","title":"Humangan: A generative model of hu- man images","venue":null,"work_id":"3378a3f0-e9c2-4d62-963f-bb79313150c9","year":2021},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.924213Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:d782f323c897e5731b7965fbb85af4738eb00a5d8a5e76c137ae4f75693f1feb","observation_id":"30885056-b095-4de1-8e94-778a40c7062f","resolution":{"observed_at":"2026-08-10T17:30:48.459736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:47.928078Z","title":"pytorch-fid: FID Score for PyTorch","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.928078Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:9186a1b601c96b322ffd1f721dd5e86cb0246f7a2059bff9bbdf6846659add34","observation_id":"f95a8c05-5756-442a-8ad7-55e739b573ce","resolution":{"observed_at":"2026-08-10T17:30:47.928078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.434081Z","title":"In- stantbooth: Personalized text-to-image generation without test-time finetuning","venue":null,"work_id":"c269ac71-1a23-40e0-aec4-d7853f085e8d","year":2024},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.932515Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:dfa38b9a1c485c7714e56752197fe2e4a0141a3e12db3df088ebee94f48a3368","observation_id":"1f523453-f07d-4eea-bfd7-c5e5ae280c68","resolution":{"observed_at":"2026-08-10T17:30:48.438335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.421119Z","title":"Image synthesis from reconfig- urable layout and style","venue":null,"work_id":"d19f607e-708d-457e-951f-0d3efb3267e0","year":2019},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.936451Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:5194c9373f02d2804e81e1a55eb334f44bab2f38693800f6fcfa48ec2f0b57d0","observation_id":"cc25dca7-73fc-4be4-82c6-f8d7fcdf2ad4","resolution":{"observed_at":"2026-08-10T17:30:48.425427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.407946Z","title":"Object-centric image genera- tion from layouts","venue":null,"work_id":"b9f09336-b747-4d0f-8b53-9779103338d2","year":2021},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.940545Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:9ae542593ca091e921870380511cfad99c24c12826854edce9cbea3134d082e8","observation_id":"df2be0fc-bf8b-4631-9efb-cdf5184e4130","resolution":{"observed_at":"2026-08-10T17:30:48.412497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.394374Z","title":"Interactive image synthesis with panoptic layout generation","venue":null,"work_id":"c3532ad9-a7f8-4fd2-9103-27bb04fe193c","year":2022},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.944723Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:1ae25117cd5c3e0334cbed2ba5b8a305338ce0f60ca334bb183ba7e3389c4a10","observation_id":"236f6967-d908-4754-a255-3195ece747eb","resolution":{"observed_at":"2026-08-10T17:30:48.398448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07519","last_updated":"2024-02-02T16:15:22Z","snapshot_observed_at":"2026-08-06T23:08:20.817133Z","submitted_at":"2024-01-15T07:50:18Z","title":"InstantID: Zero-shot Identity-Preserving Generation in Seconds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07519","snapshot_observed_at":"2026-08-10T17:30:47.949730Z","title":"Instantid: Zero-shot identity-preserving generation in seconds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.949730Z"},"links":{"cited_paper":"/paper/2401.07519","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:ea38be05f5fe18fe2a5e41a4ea54c44c83a260ab9764ae83619689a6db246555","observation_id":"99752318-c0cb-4658-902b-360198564b6e","resolution":{"observed_at":"2026-08-10T17:30:47.949730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.381296Z","title":"Instancediffusion: Instance-level control for image generation, 2024","venue":null,"work_id":"bfac5067-35f3-4f4d-91f2-aa78d6f06c90","year":2024},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.954162Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:246cc2fdeae8f89e7f7172ac88858f3fa4dea7c13cb9f8d55fece787fce18b8c","observation_id":"485acd33-d9bb-4334-87ce-05158caaa609","resolution":{"observed_at":"2026-08-10T17:30:48.385731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.368005Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":"d4624018-8838-48f0-9b66-99afa1349ebe","year":2004},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.958179Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:5ac6de1bbeb11945d4594e9cf44c7b9bb4dc6625bb15fcc136e726e0a384ed3b","observation_id":"a2f20f46-d721-4072-aa23-3776efa3ea22","resolution":{"observed_at":"2026-08-10T17:30:48.372765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13848","last_updated":"2023-08-18T17:12:13Z","snapshot_observed_at":"2026-08-04T02:07:54.822320Z","submitted_at":"2023-02-27T14:49:53Z","title":"ELITE: Encoding Visual Concepts into Textual Embeddings for Customized Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13848","snapshot_observed_at":"2026-08-10T17:30:47.961855Z","title":"Elite: Encoding visual con- cepts into textual embeddings for customized text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.961855Z"},"links":{"cited_paper":"/paper/2302.13848","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:79c45dcee55a27be480b9fb8de3fb76cccc02f873a39fd4906962811f0238ccd","observation_id":"43066a6f-3058-4fa9-8fab-dc8d4c3bc853","resolution":{"observed_at":"2026-08-10T17:30:47.961855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.355082Z","title":"Fastcomposer: Tuning-free multi- subject image generation with localized attention","venue":null,"work_id":"20230ddb-6322-42d0-8f8d-e3d497485ac3","year":2024},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.966274Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:003551be4a9b256f526b1016051b2517b325ae80578f83456c06f6bf7cacb3eb","observation_id":"414dc079-dcff-402a-b380-7eb015485c60","resolution":{"observed_at":"2026-08-10T17:30:48.359668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08872","last_updated":"2023-11-27T08:42:07Z","snapshot_observed_at":"2026-08-10T17:15:29.537271Z","submitted_at":"2023-10-13T05:48:42Z","title":"R&B: Region and Boundary Aware Zero-shot Grounded Text-to-image Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08872","snapshot_observed_at":"2026-08-10T17:30:47.970015Z","title":"R&b: Region and boundary aware zero- shot grounded text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.970015Z"},"links":{"cited_paper":"/paper/2310.08872","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:3ef33691d8dd484cb82a322c496dd58a799b2a9b078f041f106e02925ffd9538","observation_id":"04342a8f-1d53-4922-b7e2-4683bc520249","resolution":{"observed_at":"2026-08-10T17:30:47.970015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.342198Z","title":"Boxdiff: Text-to-image synthesis with training-free box-constrained diffusion","venue":null,"work_id":"b57cf92b-ec6a-4e39-ba56-16d181d6dfbf","year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.974418Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:50ccfe5bf03f22d3f9226a5ddfb34931a63b4c756e24ddace382e63f4fc41db6","observation_id":"46f84a73-4883-4025-8cd0-92a06168b2fc","resolution":{"observed_at":"2026-08-10T17:30:48.346658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:47.978379Z","title":"Reco: Region-controlled text-to-image genera- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.978379Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:cf374ec0adc60e53701766e87715580e98c3db84cc0095249035235baeb7a997","observation_id":"78a9c7b3-b863-49bf-9550-172e70599253","resolution":{"observed_at":"2026-08-10T17:30:47.978379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-10T17:30:47.982276Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.982276Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:7bbd807fda370886f5e63cceca3ae443796615345df3a0028ff5a365324994a0","observation_id":"038fce44-f971-4687-a31e-755c0091c412","resolution":{"observed_at":"2026-08-10T17:30:47.982276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.321594Z","title":"Customnet: Zero-shot object customization with variable-viewpoints in text-to-image dif- fusion models, 2023","venue":null,"work_id":"42b93d8b-5a75-43ab-bb85-0df75332ac2d","year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.986643Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:15a7cc1a51845ff823af9c121c37df1b31a54b332ae89923500b6184228424a1","observation_id":"e5f886bb-68c3-462f-b0e4-f26e54b30344","resolution":{"observed_at":"2026-08-10T17:30:48.326113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.06235","last_updated":"2022-11-11T14:30:34Z","snapshot_observed_at":"2026-08-08T01:30:58.013671Z","submitted_at":"2022-11-11T14:30:34Z","title":"HumanDiffusion: a Coarse-to-Fine Alignment Diffusion Framework for Controllable Text-Driven Person Image Generation","version":1},"cited_work":{"arxiv_id":"2211.06235","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.06235","snapshot_observed_at":"2026-08-10T17:30:48.042332Z","title":"HumanDiffusion: a Coarse-to-Fine Alignment Diffusion Framework for Controllable Text-Driven Person Image Generation","venue":"cs.CV","work_id":"f93a2ede-79be-47e0-8bb1-8096e61f510c","year":2022},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.991487Z"},"links":{"cited_paper":"/paper/2211.06235","citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:08b5d2dec093723400073ca926a174c7b383cb3d4678c593decdb9ad1953ea9c","observation_id":"ba63e5ea-e2e2-4041-96e5-31f3b0664d9b","resolution":{"observed_at":"2026-08-10T17:30:48.049415Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:47.995603Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.995603Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:0469228a1650d22543af773bba79859eaaded08c9848b3ad283304580fadd6b4","observation_id":"784dc3f6-544e-41cb-874d-bae8c2f5aef7","resolution":{"observed_at":"2026-08-10T17:30:47.995603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.301560Z","title":"Layoutdiffusion: Controllable diffu- sion model for layout-to-image generation","venue":null,"work_id":"52546b01-faf4-490d-b8f5-0c7965bcbccd","year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:47.999705Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:44a488bc507802b0af66218df7d7e6d9e921b708caafd8bb4be9ee82272f77e4","observation_id":"544697bd-b9d8-430b-a76c-8fa90abb9735","resolution":{"observed_at":"2026-08-10T17:30:48.305842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.288505Z","title":"clip-score: CLIP Score for Py- Torch","venue":null,"work_id":"f299700a-66b2-4f70-9f1a-2888d8e7ad15","year":2023},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:48.003474Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:62d5bf0c7d2b66ed5aed0709eb084f147d6f73cd9f2c10523f4838f507d611de","observation_id":"70dcb08b-9447-4c06-9930-be3b2f0b5f9b","resolution":{"observed_at":"2026-08-10T17:30:48.292780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:30:48.275737Z","title":"Migc: Multi-instance generation controller for text-to-image synthesis, 2024","venue":null,"work_id":"d6dadbd3-0d30-48d1-99c6-814a3e843cf2","year":2024},"citing_paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T17:30:48.007551Z"},"links":{"citing_paper":"/paper/2501.12173"},"observation_digest":"sha256:c9427ff7ffe7191e80704e9efc1502efd1f065b62fb33660d12ec9daad97fb7d","observation_id":"f573d113-9743-4574-a9d8-2b343db30785","resolution":{"observed_at":"2026-08-10T17:30:48.280060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.12173","last_updated":"2025-01-21T14:32:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T21:41:25.454034Z","submitted_at":"2025-01-21T14:32:47Z","title":"ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":27},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2501.12173."}