{"as_of":"2026-08-19T15:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8747f98d1b746a913ed2e1ed23320fbdf39085450c647d1f277ed8d665141096","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:51:46.102727Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:47:47.426448Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T07:51:29.272825Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08486","snapshot_observed_at":"2026-08-15T16:47:47.426448Z","title":"Learning flow fields in attention for controllable person image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20586","last_updated":"2025-08-28T09:25:52Z","snapshot_observed_at":"2026-08-17T07:28:38.311709Z","submitted_at":"2025-08-28T09:25:52Z","title":"FastFit: Accelerating Multi-Reference Virtual Try-On via Cacheable Diffusion Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T16:47:47.426448Z"},"links":{"cited_paper":"/paper/2412.08486","citing_paper":"/paper/2508.20586"},"observation_digest":"sha256:54b5521760e52582a51fd4f14098f66d56c1774a378c5b9df687c93a770abd6c","observation_id":"40b86662-d54f-4b89-8f18-fbfc263bdfe1","resolution":{"observed_at":"2026-08-15T16:47:47.426448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"cited_work":{"arxiv_id":"2412.08486","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08486","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning flow fields in attention for controllable person image generation","venue":null,"work_id":"35be512e-06fd-4531-872d-3f89f0a77858","year":null},"citing_paper":{"arxiv_id":"2604.19748","last_updated":"2026-05-10T17:50:28Z","snapshot_observed_at":"2026-08-14T01:58:26.045828Z","submitted_at":"2026-04-21T17:59:49Z","title":"Tstars-Tryon 1.0: Robust and Realistic Virtual Try-On for Diverse Fashion Items","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T03:36:03.906391Z"},"links":{"cited_paper":"/paper/2412.08486","citing_paper":"/paper/2604.19748"},"observation_digest":"sha256:1bc6fbde57a237ee4e7c4db98bb110e95e5323e0e079dc28e7b6caf2fcd8fafa","observation_id":"801c7aff-95f1-492b-ac4e-72c829bdddb0","resolution":{"observed_at":"2026-05-11T12:26:11.543360Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"cited_work":{"arxiv_id":"2412.08486","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08486","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning flow fields in attention for controllable person image generation","venue":null,"work_id":"35be512e-06fd-4531-872d-3f89f0a77858","year":null},"citing_paper":{"arxiv_id":"2604.19748","last_updated":"2026-05-10T17:50:28Z","snapshot_observed_at":"2026-08-14T01:58:26.045828Z","submitted_at":"2026-04-21T17:59:49Z","title":"Tstars-Tryon 1.0: Robust and Realistic Virtual Try-On for Diverse Fashion Items","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T01:51:23.775478Z"},"links":{"cited_paper":"/paper/2412.08486","citing_paper":"/paper/2604.19748"},"observation_digest":"sha256:b7abe5243ce1e7b44e758e508629a25ec238e898c6c286999ff7acd76194a138","observation_id":"3753012d-95f0-4d98-b09f-b45a78540238","resolution":{"observed_at":"2026-05-12T07:51:29.279632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08486","snapshot_observed_at":"2026-08-01T11:22:44.157732Z","title":"arXiv preprint arXiv:2412.08486 (2024) 4, 10, 11, 12","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19923","last_updated":"2026-07-22T08:55:52Z","snapshot_observed_at":"2026-08-15T18:58:57.636160Z","submitted_at":"2026-07-22T08:55:52Z","title":"WearWow: Native 2K Multi-Garment Virtual Try-On via Adaptive Token Packing and Preference Alignment","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:44.157732Z"},"links":{"cited_paper":"/paper/2412.08486","citing_paper":"/paper/2607.19923"},"observation_digest":"sha256:8ffd847538096766dc773d0201c73280eeb7057133791bfeaa201f4658ba12f8","observation_id":"3732c706-06b4-48de-bc50-d6bcd44d37b1","resolution":{"observed_at":"2026-08-01T11:22:44.157732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08486","snapshot_observed_at":"2026-08-01T07:07:13.806326Z","title":"Learning flow fields in attention for controllable person image generation.arXiv preprint arXiv:2412.08486, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21694","last_updated":"2026-07-23T17:45:56Z","snapshot_observed_at":"2026-08-19T10:11:52.963816Z","submitted_at":"2026-07-23T17:45:56Z","title":"Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T07:07:13.806326Z"},"links":{"cited_paper":"/paper/2412.08486","citing_paper":"/paper/2607.21694"},"observation_digest":"sha256:1527af41e28622a3aadc352e99f51c9a3051bc46f79f6dc0b0ba86d26ab9aea6","observation_id":"3a758785-f5d2-4a0e-b77f-959efb304498","resolution":{"observed_at":"2026-08-01T07:07:13.806326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.08486/citation-record","integrity":"/paper/2412.08486/integrity","json":"/paper/2412.08486/citation-record.json","paper":"/paper/2412.08486"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:45.692734Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.692734Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:7882bdd8e24b79088a0b1d36c3e4431063ee1935db3245ca2e7e4c8ee9690fdd","observation_id":"40a7888b-e5d6-47c3-a782-1ba869cdeb7a","resolution":{"observed_at":"2026-08-11T17:51:45.692734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:45.705325Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.705325Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:554c67e49cd8d6363d549013e97553e23cb6e2372edc5cb8ab98bb2efd738a5a","observation_id":"177a68e5-6f8c-4918-9afc-ada51c544502","resolution":{"observed_at":"2026-08-11T17:51:45.705325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:47.388567Z","title":"Pose with style: Detail-preserving pose-guided image synthesis with conditional stylegan","venue":null,"work_id":"0fc7c6d0-ac6c-4926-907a-15fc0f29a024","year":2021},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.712221Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:914b103396fd71a2aa39c0cd3948fc2637d44091868c2fe9c56e051f5e17f214","observation_id":"9e7f4272-5164-466a-9bbe-4c69777f0d3c","resolution":{"observed_at":"2026-08-11T17:51:47.395291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:47.369480Z","title":"Person image synthesis via denoising diffusion model","venue":null,"work_id":"1eac2f05-68ad-43c9-bfc2-b58a29f48cfd","year":2023},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.719494Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:571e72752151f88a9ebda70153ad97bceb0b8bfbd93d387b95f3193e481ee22d","observation_id":"a2b4ddb0-3b17-459f-95f8-f3bf84f4f99e","resolution":{"observed_at":"2026-08-11T17:51:47.374675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:45.726950Z","title":"Demystifying mmd gans","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.726950Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:8cb48a51c7bce7335b14cdbbb9df067e282a87e50ce55c799ebdf1a9c8e9eaf5","observation_id":"abc13210-801e-45a2-8111-94f43df68998","resolution":{"observed_at":"2026-08-11T17:51:45.726950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:45.732117Z","title":"Masactrl: Tuning-free mutual self-attention control for consistent image synthesis and editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.732117Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:52343d404252d8fd5df65455f1294c1e28bd51ab83b276158156d8bb490f3e5c","observation_id":"de230ad7-d180-486d-bcce-2385f45af77e","resolution":{"observed_at":"2026-08-11T17:51:45.732117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:47.326612Z","title":"Attend-and-excite: Attention-based semantic guidance for text-to-image diffusion models","venue":null,"work_id":"992ce6c3-3f83-45a6-8fd2-977f9d683204","year":2023},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.737519Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:9acb16cdfc5282c70caa19d526b0861e555555135506f918b93d77cb5eb42324","observation_id":"7507c3f1-b6cd-4160-88a4-1a5036644ac2","resolution":{"observed_at":"2026-08-11T17:51:47.332069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:45.743021Z","title":"Viton-hd: High-resolution virtual try-on via misalignment-aware normalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.743021Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:b7f20f730712b5d4f669fb4e1c5a962e920d580bc33215e81329632d541e6e63","observation_id":"ebf96bc8-6b29-4b4e-9b2a-c3583f1dacc7","resolution":{"observed_at":"2026-08-11T17:51:45.743021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:45.750312Z","title":"Improving diffusion models for authentic virtual try-on in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.750312Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:950a9d3fe49e559f62755a8137655259166ad4efb6f73a05258307ed857085e1","observation_id":"6d17d570-f932-457d-8e47-50c93e526e7c","resolution":{"observed_at":"2026-08-11T17:51:45.750312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15886","last_updated":"2025-02-16T03:41:41Z","snapshot_observed_at":"2026-08-16T13:32:23.242134Z","submitted_at":"2024-07-21T11:58:53Z","title":"CatVTON: Concatenation Is All You Need for Virtual Try-On with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15886","snapshot_observed_at":"2026-08-11T17:51:45.755406Z","title":"Catvton: Concatenation is all you need for virtual try-on with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.755406Z"},"links":{"cited_paper":"/paper/2407.15886","citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:3be43a39e4b5bcf06469f69b64948bf4f9a27f3e062832f3ea34a8c8e965f779","observation_id":"5252d2e1-b55c-4fe1-be58-561fbd8993be","resolution":{"observed_at":"2026-08-11T17:51:45.755406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17688","last_updated":"2023-03-30T20:02:29Z","snapshot_observed_at":"2026-08-16T15:43:56.592546Z","submitted_at":"2023-03-30T20:02:29Z","title":"Learning Garment DensePose for Robust Warping in Virtual Try-On","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17688","snapshot_observed_at":"2026-08-11T17:51:45.760736Z","title":"Learning garment densepose for robust warping in virtual try-on","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.760736Z"},"links":{"cited_paper":"/paper/2303.17688","citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:be77962175bf33d18dfe30c5a62d19a94496898b631ffcf01eb6b9cb9ca27f40","observation_id":"14a3a875-5ba1-44e8-92ba-80ac4ae55d95","resolution":{"observed_at":"2026-08-11T17:51:45.760736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:47.278681Z","title":"Street tryon: Learning in-the-wild virtual try-on from unpaired person images","venue":null,"work_id":"ae14deac-75ae-4041-981a-3422cf3b7023","year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.766529Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:63e7059c9745d0deaa69c36acfa620f29e7ac25dc3c3e0765ee6dc24f766c522","observation_id":"430c14fc-5379-49a9-87d6-8f7d5d7629ad","resolution":{"observed_at":"2026-08-11T17:51:47.285555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:45.770943Z","title":"Vision transformers need registers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.770943Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:199034f3b4d5ccca1ff35f4416543673d8fb5859f8c08395b44acf02ced09eef","observation_id":"1b31bc5f-c917-4a8f-9852-1a543f3bd5aa","resolution":{"observed_at":"2026-08-11T17:51:45.770943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:45.775225Z","title":"Masked diffusion transformer is a strong image synthesizer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.775225Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:77455d3693d205525e363c8e6b775e65575e6abc62d108dce3bb2622014f05de","observation_id":"4839b6c7-2a12-48ca-8d44-aa3e513a3b81","resolution":{"observed_at":"2026-08-11T17:51:45.775225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:47.231575Z","title":"Disentangled cycle consistency for highly-realistic virtual try-on","venue":null,"work_id":"96e32b18-71eb-4eb7-99b1-45e3dca4ffd3","year":2021},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.779658Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:2bd57943068954685f6ed7471a0be8a6e90f5de32803414b6e12efdb4940ce93","observation_id":"3999639e-a9a5-4bc4-b7c5-51aeb956290e","resolution":{"observed_at":"2026-08-11T17:51:47.236574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:47.214887Z","title":"Parser-free virtual try-on via distilling appearance flows","venue":null,"work_id":"bb468dd9-e430-403a-8fd1-2dc19c3e2181","year":2021},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.785434Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:e7b401b1f5376b0de567b255df54c7ddfacc7c710f8ec36a60c3ea3e05680165","observation_id":"3cdaaf3c-8307-4fb3-a14e-632d6901b4d8","resolution":{"observed_at":"2026-08-11T17:51:47.220323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:45.790405Z","title":"Taming the power of diffusion models for high-quality virtual try-on with appearance flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.790405Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:65cc1e1e9538d87c13c8f59f5a8e29dfb2e310bb57317586d44a587dd5022b11","observation_id":"9c74b3de-c65d-467c-a9c8-501497b83aa4","resolution":{"observed_at":"2026-08-11T17:51:45.790405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:47.184367Z","title":"Densepose: Dense human pose estimation in the wild","venue":null,"work_id":"eface365-491d-4002-aef9-3c9a2b31b496","year":2018},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.795172Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:4b27e8098ea469bb5be29b336352f1318dc528bcd30024be576455e95a50e9a7","observation_id":"897ed3c1-0d98-442f-a0ae-9f5ebadad665","resolution":{"observed_at":"2026-08-11T17:51:47.190540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:47.158105Z","title":"Focus on your instruction: Fine-grained and multi-instruction image editing by attention modulation","venue":null,"work_id":"bab96512-9aea-456a-94b4-86a7b47cf9b5","year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.799993Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:038e38b187f35a545d78fbbe97868ffacd0ed8d83cafcdb5260ad3648f65807e","observation_id":"126674bd-cf8c-4c90-9eb5-4abfd00a9201","resolution":{"observed_at":"2026-08-11T17:51:47.163415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:47.137272Z","title":"Controllable person image synthesis with pose-constrained latent diffusion","venue":null,"work_id":"800974b3-0ebe-43db-9ba9-e5ba6dd24767","year":2023},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.804880Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:6c00202c0aa6261760a8805832cf0f709f78b674f19eeb1c082bf4c85f87848c","observation_id":"77cf9193-4c31-46f9-8002-a228edd5a938","resolution":{"observed_at":"2026-08-11T17:51:47.143096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:45.811165Z","title":"Style-based global appearance flow for virtual try-on","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.811165Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:7dfca58c3470c5072b9af712869c85b5942d2841197860a48bc48e655eff1c0f","observation_id":"610c7e2b-4c95-4bc6-9404-ee0070ffeb65","resolution":{"observed_at":"2026-08-11T17:51:45.811165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:47.106566Z","title":"Prompt-to-prompt image editing with cross-attention control","venue":null,"work_id":"63d363ab-d02d-42cc-9c5f-190195a1fc92","year":2023},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.816164Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:a0664bdc7bb6f77898a1112e7e0a1eaf8b417b45a630473633510ee363874550","observation_id":"647f6e61-7fbd-48a7-b302-26478b4d162e","resolution":{"observed_at":"2026-08-11T17:51:47.112064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:45.821773Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.821773Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:ed07e0e4ce2c7a9d94b91f674976c26cd50bc8fb4e687158229e486aa43278b0","observation_id":"620aa845-af47-4719-8de8-3596a16bd92b","resolution":{"observed_at":"2026-08-11T17:51:45.821773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:45.828468Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.828468Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:edb6899a9d7d6c1c1fb4097c07b63ac96fb7123ed02ad2f68e476852e01c7757","observation_id":"4ae16f0e-88d9-43bc-b04f-bca5acf28919","resolution":{"observed_at":"2026-08-11T17:51:45.828468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:45.833709Z","title":"Stableviton: Learning semantic correspondence with latent diffusion model for virtual try-on","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.833709Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:4cae267accaa243664d34c77ea20d1df7752a20829cc0439b99fcdc6a2e11b27","observation_id":"5228dbed-0735-441b-a07a-1bf8fbb98f38","resolution":{"observed_at":"2026-08-11T17:51:45.833709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-11T17:51:45.839782Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.839782Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:7ba1fa8c734f3ad4fd6215fc27a781e0193ef970fb25d36ffae08c948bf22da0","observation_id":"19e853dd-3b5c-464e-804f-88b8db636697","resolution":{"observed_at":"2026-08-11T17:51:45.839782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06026","last_updated":"2023-02-14T12:45:31Z","snapshot_observed_at":"2026-08-16T17:15:17.549261Z","submitted_at":"2022-03-11T15:50:06Z","title":"The Role of ImageNet Classes in Fr\\'echet Inception Distance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.06026","snapshot_observed_at":"2026-08-11T17:51:45.845434Z","title":"The role of imagenet classes in fr 'echet inception distance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.845434Z"},"links":{"cited_paper":"/paper/2203.06026","citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:d89f67929d9afe8bbd4c1301c817a97a02d0c0ff3b8c3ff3a18f50e0141a81c7","observation_id":"866832fb-835b-4899-9312-e0fd292b4672","resolution":{"observed_at":"2026-08-11T17:51:45.845434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:45.851856Z","title":"High-resolution virtual try-on with misalignment and occlusion-handled conditions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.851856Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:85eca8ada5b12e4f21263229569cb14c08b56ec64c205a24b27d93a1b8248ea2","observation_id":"e2f468e8-f46d-4239-a000-a9cd708cd9f5","resolution":{"observed_at":"2026-08-11T17:51:45.851856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:47.039541Z","title":"Dense intrinsic appearance flow for human pose transfer","venue":null,"work_id":"4318fcfe-05f9-4cca-acf4-1fa3c56b9d5b","year":2019},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.857912Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:4e2989883015bc4d502fdcad7a615fd77ea352e73c1c398d3d9c17abdc1636b0","observation_id":"00979b8f-31f1-49d1-902a-997e52412967","resolution":{"observed_at":"2026-08-11T17:51:47.045281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:47.016248Z","title":"Faster diffusion via temporal attention decomposition","venue":null,"work_id":"26998304-1866-48f2-b086-e803137274b9","year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.863550Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:94c5792ed809e80b4e78a4bd64d3eb37fc03a12332cc26f2b545ea547650fa15","observation_id":"0538c251-10b0-414d-b533-74f53a9dce2f","resolution":{"observed_at":"2026-08-11T17:51:47.026959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.991151Z","title":"Deepfashion: Powering robust clothes recognition and retrieval with rich annotations","venue":null,"work_id":"4683a6b6-5e12-429f-b5c4-ee3f12b684da","year":2016},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.870432Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:e476a3beffcaf3ffad9aae160365cc92b3e0e8d4ca38fd5d86efb16963d30b29","observation_id":"e7443e56-e4e6-4fef-ad1c-c5f77e22bfa3","resolution":{"observed_at":"2026-08-11T17:51:46.999399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-11T17:51:45.877476Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.877476Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:3ad2f1de848d16fe17c92cdc52497d64b38fb921965f041e66c5d9b4fd6396d2","observation_id":"239acd58-8249-4d2a-8160-a02758f869ad","resolution":{"observed_at":"2026-08-11T17:51:45.877476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.965537Z","title":"Coarse-to-fine latent diffusion for pose-guided person image synthesis","venue":null,"work_id":"e2bf5da9-6958-4065-876b-db5de1ce9d63","year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.883757Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:7c3a5bb13da4472ca608120c3657a6e766b1128a9ee1db8941c2b5e73fb9060b","observation_id":"1b012506-21c4-4017-86f1-f8d784edb3eb","resolution":{"observed_at":"2026-08-11T17:51:46.971287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.938614Z","title":"Pose guided person image generation","venue":null,"work_id":"4badbc20-691d-4aca-9929-37df0870b53f","year":2017},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.890763Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:ac6acc605abc4c6eae20abcaf368150eae5c0cd7efda5211ecf4d3aa39595844","observation_id":"4998e4c7-b6bc-4ba1-9bd5-66dba861eae5","resolution":{"observed_at":"2026-08-11T17:51:46.944142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.922153Z","title":"Controllable person image synthesis with attribute-decomposed gan","venue":null,"work_id":"02b9934e-a06e-4122-b344-752b609ebea5","year":2020},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.896453Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:0265310b326450b8c0d1f4e084fab72c1c834692699e958a5a31e25c4eed3580","observation_id":"aeefb403-fdeb-4b27-a10e-66260c76adf9","resolution":{"observed_at":"2026-08-11T17:51:46.926659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:45.901831Z","title":"Dress code: High-resolution multi-category virtual try-on","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.901831Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:f27dd2f3ea7693edf8c0fd1420047f77515972fef065719bbb6e412601116a45","observation_id":"d70917ba-8eb6-4335-9c96-42d2766e87ab","resolution":{"observed_at":"2026-08-11T17:51:45.901831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:45.906610Z","title":"Ladi-vton: Latent diffusion textual-inversion enhanced virtual try-on","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.906610Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:b39649f6e8cd686d4046f069b527338dc5c78e893fea908469000e8e0ca30591","observation_id":"47593a8f-5305-4598-8bbe-20f5ebeb1a23","resolution":{"observed_at":"2026-08-11T17:51:45.906610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.884388Z","title":"Picture: Photorealistic virtual try-on from unconstrained designs","venue":null,"work_id":"b377cbb3-befd-41f8-bd9a-90614e955ea2","year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.911281Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:094cd841970d8f0484412e1a9e2bde09f9f13ce30b74c8c8f6c5f08c94816ff0","observation_id":"5a401801-e912-474a-9994-f5e978259389","resolution":{"observed_at":"2026-08-11T17:51:46.889536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.867480Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":"c39c2937-53d8-45f2-aae9-feebf03548f5","year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.916719Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:7a93ebdb4879cd84f5267f27eb26551ca5f38b03461ff48d314d46999a0bbec2","observation_id":"6216f900-0664-4577-90c2-f290182824c8","resolution":{"observed_at":"2026-08-11T17:51:46.873338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:45.921877Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.921877Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:e4e88ecdd2b79a7fd2dc7c709aadb50fa02b8c2beb2b087bb3e3d9ecaf31572a","observation_id":"963de2b3-e501-4e1c-bb03-a891f7954f36","resolution":{"observed_at":"2026-08-11T17:51:45.921877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.840164Z","title":"Cross-view masked diffusion transformers for person image synthesis","venue":null,"work_id":"46e0ba27-559d-4955-a2d6-f8380a946d8d","year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.927026Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:6edee3460cca775d73e5eeaaa5a723c157365babaa35eb3cb86c30d46403ef47","observation_id":"7ee20165-923d-4f22-926a-a211dcbc17d8","resolution":{"observed_at":"2026-08-11T17:51:46.845281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.822740Z","title":"Grounded text-to-image synthesis with attention refocusing","venue":null,"work_id":"d060b90b-984b-49e8-a87d-ceecb08122c4","year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.931973Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:3500529128ffa9a55fc7b7248142cddd51b47a64aa626fe67a04a52d90ef113f","observation_id":"2101a60b-ecc7-4977-b63d-434f26bc8e26","resolution":{"observed_at":"2026-08-11T17:51:46.828704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.797771Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"25c491c1-b75d-482f-bd0c-b7a22d05ceea","year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.936893Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:3cee0f0e4d94854768a2d0fbb0f9a6b09e985b927b71527625cb43df0ed065d3","observation_id":"5950ee4c-3a86-4702-a3fa-7215106aab8a","resolution":{"observed_at":"2026-08-11T17:51:46.805524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:45.942540Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.942540Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:004244987abd5398ea1d8b03ab60d7ca0d3438d9952292ad28ea9dda8861ab57","observation_id":"feef517f-9d21-4fd9-afe2-a90054f62f95","resolution":{"observed_at":"2026-08-11T17:51:45.942540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:45.946840Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.946840Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:cfb567abc62259681abd7c3e09a3380b488df77463be8080d0d47ebd4c5a1183","observation_id":"a75a3d2b-7268-4e07-b195-261297e4eb61","resolution":{"observed_at":"2026-08-11T17:51:45.946840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.753376Z","title":"Deep image spatial transformation for person image generation","venue":null,"work_id":"6f2f825b-9476-47d6-9c49-078734a63801","year":2020},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.951225Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:ff3c8e3ce99019b84d94217bb0aac02a8edac051cde5ab1860b698e8ba8debfe","observation_id":"b2031f09-13a3-491e-ab56-9480880c702a","resolution":{"observed_at":"2026-08-11T17:51:46.760195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.736174Z","title":"Neural texture extraction and distribution for controllable person image synthesis","venue":null,"work_id":"15dc2c53-3d73-48da-b139-cec3b575d270","year":2022},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.955392Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:af6df47dc8344426c928b17560ad17c7064909c56b34cd1214fd62fe33b35d90","observation_id":"e8a23c6e-8c6d-4ec2-9a05-485b1c240589","resolution":{"observed_at":"2026-08-11T17:51:46.741391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:45.959561Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.959561Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:73c451b7c08eff584abd09b44c9308271cc57001872977439ab032ce5b816453","observation_id":"a94addcd-4164-4dfb-be76-46bf74d6bc40","resolution":{"observed_at":"2026-08-11T17:51:45.959561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:45.963899Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.963899Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:571b6ee1d868045866fde4551787e151114f177359908065366f399ddba27e3e","observation_id":"18db0133-301b-4b75-b054-733d1de8b5ca","resolution":{"observed_at":"2026-08-11T17:51:45.963899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.697032Z","title":"Learning realistic human reposing using cyclic self-supervision with 3d shape, pose, and appearance consistency","venue":null,"work_id":"5a6c86e6-fbb5-41e5-819a-9e5e4d707fa3","year":2021},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.968709Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:1c267c89717d120d212f17aeda8af3448785f3caddf79a4ff4514ad182a85689","observation_id":"d4bc11f2-cb7d-42f8-819f-2e1a0adf2c8a","resolution":{"observed_at":"2026-08-11T17:51:46.702438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.677715Z","title":"Towards squeezing-averse virtual try-on via sequential deformation","venue":null,"work_id":"d6931f7d-3034-44fc-9da6-be5b81236861","year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.973069Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:b12f94215b3d5be56df7659f02a743a3ffaffa3c0125f985b24d0fd400f56f4b","observation_id":"8d362974-30af-4146-935f-c3a214ba6b32","resolution":{"observed_at":"2026-08-11T17:51:46.683479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.654754Z","title":"Deformable gans for pose-based human image generation","venue":null,"work_id":"09c1386b-2aed-48ed-8ce3-c992cbac1454","year":2018},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.977992Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:990f3dc9e822dbdaa4dcdebdbdc56660a430326b5422aa4ec3b050ac7985de01","observation_id":"c62091ca-c080-4fa3-ad8c-c8eddd40c3e4","resolution":{"observed_at":"2026-08-11T17:51:46.659873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.11521","last_updated":"2022-02-28T09:31:42Z","snapshot_observed_at":"2026-08-19T14:07:58.101842Z","submitted_at":"2021-03-21T23:59:19Z","title":"Conditional Frechet Inception Distance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.11521","snapshot_observed_at":"2026-08-11T17:51:45.981989Z","title":"Conditional frechet inception distance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.981989Z"},"links":{"cited_paper":"/paper/2103.11521","citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:e02129464b5b131cb20db4b8d98270674e9147212619a576a479db9c6b52635f","observation_id":"e2385068-6968-464b-a2ad-e220509ce99c","resolution":{"observed_at":"2026-08-11T17:51:45.981989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16224","last_updated":"2024-07-23T07:04:42Z","snapshot_observed_at":"2026-08-16T22:48:48.428961Z","submitted_at":"2024-07-23T07:04:42Z","title":"OutfitAnyone: Ultra-high Quality Virtual Try-On for Any Clothing and Any Person","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16224","snapshot_observed_at":"2026-08-11T17:51:45.987146Z","title":"Outfitanyone: Ultra-high quality virtual try-on for any clothing and any person","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.987146Z"},"links":{"cited_paper":"/paper/2407.16224","citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:720ae5ae3346e05359387367f1e88047236909c9422e5871e16b81765ea4fff1","observation_id":"46306cd8-9f4c-4e47-a2ce-d8272b6b0c82","resolution":{"observed_at":"2026-08-11T17:51:45.987146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.637078Z","title":"Xinggan for person image generation","venue":null,"work_id":"0abe9ae4-1d79-4cdc-9f07-23d7fdfee929","year":2020},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.992695Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:795f67f45ffa1a6f1e6b74967d2d6727304f980e1f468e7089d3871a6f9ff6ad","observation_id":"bdd22b20-1c7a-400c-ad96-31cde8198776","resolution":{"observed_at":"2026-08-11T17:51:46.642906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:45.997884Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:45.997884Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:67d8c3fa06b176bcbe0413acf6d0a314a1d220a39e4a41eb810fb04307ef98e8","observation_id":"9c5cada7-c5c3-4b58-9f4a-9f539e967d0f","resolution":{"observed_at":"2026-08-11T17:51:45.997884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.003432Z","title":"Improving virtual try-on with garment-focused diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:46.003432Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:1de08cb37d2f45a8884bb4f3ad64d4bbcaab8f54e33b07c96fec430199a2e652","observation_id":"ef3f956b-3e4a-47a6-8aec-f0e9d21e61f2","resolution":{"observed_at":"2026-08-11T17:51:46.003432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.008798Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:46.008798Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:7a5757e2b7d0dec714e58d257402b224d427e80ff0ad16229b9957e0b5dffcc9","observation_id":"cc64e7e3-769d-498f-825b-4ce6928f9f49","resolution":{"observed_at":"2026-08-11T17:51:46.008798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.584976Z","title":"Fastcomposer: Tuning-free multi-subject image generation with localized attention","venue":null,"work_id":"721af986-ca7e-4dee-8639-7262beb83394","year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:46.014091Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:3f1a13cce8461810e96872d8e7ee5e0246f746a7079e34aac651650756513a90","observation_id":"3e829d52-b3c6-4a35-8d4d-0ba571d646cb","resolution":{"observed_at":"2026-08-11T17:51:46.592259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.566795Z","title":"Boxdiff: Text-to-image synthesis with training-free box-constrained diffusion","venue":null,"work_id":"3ad8eef7-cfc2-447f-80db-54cca2087582","year":2023},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:46.020697Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:2514697daa364651afc7d6d1e6746efaf7198cc530f73378889632e0c23d0d00","observation_id":"a0dc2eeb-6519-4219-a667-3bc2f3d62e11","resolution":{"observed_at":"2026-08-11T17:51:46.572242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.547263Z","title":"Gp-vton: Towards general purpose virtual try-on via collaborative local-flow global-parsing learning","venue":null,"work_id":"a82dde72-0768-423a-8a18-7069eab4b62f","year":2023},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:46.025685Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:5102ade3181cbb1276b12d72210fe190ee697e13990ce127f075932919d1b98d","observation_id":"ca8c1d17-19e5-4c0c-bb8c-6daf66473f1b","resolution":{"observed_at":"2026-08-11T17:51:46.554444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01779","last_updated":"2024-03-07T06:35:35Z","snapshot_observed_at":"2026-08-16T14:13:13.042989Z","submitted_at":"2024-03-04T07:17:44Z","title":"OOTDiffusion: Outfitting Fusion based Latent Diffusion for Controllable Virtual Try-on","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01779","snapshot_observed_at":"2026-08-11T17:51:46.030803Z","title":"Ootdiffusion: Outfitting fusion based latent diffusion for controllable virtual try-on","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:46.030803Z"},"links":{"cited_paper":"/paper/2403.01779","citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:f86120886806767539dc9dfe3adfa41bbabafb15aa0b5b344a2ebcadd4023bd9","observation_id":"52ede68e-4fe4-444d-8876-d2a08c16d25a","resolution":{"observed_at":"2026-08-11T17:51:46.030803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.527873Z","title":"Towards photo-realistic virtual try-on by adaptively generating-preserving image content","venue":null,"work_id":"4b5d81f4-d1e2-40f5-8799-e228607dce45","year":2020},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:46.035765Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:0a3f98baf0846704b58034d09c761f0d50ddce2ab56b4f75b93d2100139512ed","observation_id":"1f3ca33e-fc69-453e-b029-1b8081d128ef","resolution":{"observed_at":"2026-08-11T17:51:46.534747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.506536Z","title":"Texture-preserving diffusion models for high-fidelity virtual try-on","venue":null,"work_id":"badaf05d-5ede-4209-9f75-607ede99d2e9","year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:46.040269Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:58244ce5097920eaa706ab1f5e0ef5afe5690be4ed8bc66e1f1f32af28ceeff5","observation_id":"80bdf8c1-d303-498c-9ac4-e95eed8486e7","resolution":{"observed_at":"2026-08-11T17:51:46.512382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.486250Z","title":"D4-vton: Dynamic semantics disentangling for differential diffusion based virtual try-on","venue":null,"work_id":"472a7e3d-ae47-47d0-aecc-f55e67ed08f9","year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:46.044910Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:881c9976f531858bf85c876e0fc5b912b90484f2cb6ae28c909fa48edcc7409c","observation_id":"8d740281-7f62-4ebc-9e0b-e8702edac479","resolution":{"observed_at":"2026-08-11T17:51:46.492374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.457642Z","title":"Cat-dm: Controllable accelerated virtual try-on with diffusion model","venue":null,"work_id":"1a437d1b-0ee1-40cd-8b25-0de4c552c091","year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:46.050326Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:d2dbfab417731c86cf46812dd5cbb03e88159496edb3b1ee56afd4fcdef625cf","observation_id":"1d5926e1-fb0a-47a4-9f22-d165064ec120","resolution":{"observed_at":"2026-08-11T17:51:46.463818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.435285Z","title":"Pise: Person image synthesis and editing with decoupled gan","venue":null,"work_id":"54aefbb7-265e-43c1-83f0-2dfb45ccc497","year":2021},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:46.055242Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:0ff834fda84d1dc8e733aee404b0805274c2e2a0d25d08f7781aacd2c2b85e20","observation_id":"7b3ec165-817c-4f6e-8f9f-460b18480ef6","resolution":{"observed_at":"2026-08-11T17:51:46.442949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.061407Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:46.061407Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:b522419a394fd8ab81fe880d5468d041113bbbb4f5e74fc6f6bf39bb10a92d17","observation_id":"ae6552c7-89fc-4fec-9b4d-ca603b56207e","resolution":{"observed_at":"2026-08-11T17:51:46.061407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.408619Z","title":"Exploring dual-task correlation for pose guided person image generation","venue":null,"work_id":"046c96e9-8980-4ac5-8ee7-844e075bcfaf","year":2022},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:46.066446Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:e6f3fbdb23294fd14e698fc4a30bcc6fb30b145473b4b317058d9d13794869bc","observation_id":"72b2273b-6c12-4a04-8938-9813e8deb6a1","resolution":{"observed_at":"2026-08-11T17:51:46.413847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.071891Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:46.071891Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:c024ccb0c8e36e8e35c95c71973d15ce6c731d13b0b6a5e6c2034456250886b8","observation_id":"a7336b5e-0b2b-4ae1-841e-d3547df9f2bb","resolution":{"observed_at":"2026-08-11T17:51:46.071891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.372633Z","title":"Dream: Diffusion rectification and estimation-adaptive models","venue":null,"work_id":"28afacff-75b2-4ad7-b4d4-a9601e4d8b12","year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:46.076973Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:2949f3ae12737c53df3f91633b9417c1fcb7afd5b9a514603d67aeaf826d622d","observation_id":"c6ed1657-b5f9-4766-b298-b8d07f6c5959","resolution":{"observed_at":"2026-08-11T17:51:46.381216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.354863Z","title":"Cocosnet v2: Full-resolution correspondence learning for image translation","venue":null,"work_id":"e20cf06f-272c-4483-8bd5-9b3b5280a1a7","year":2021},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:46.082230Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:838721d360ee71276330a8d7e78f48425a48765bcdfd49b35227f0317cc23540","observation_id":"95067787-e141-4c90-856a-c5d42aa3859e","resolution":{"observed_at":"2026-08-11T17:51:46.359644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.339473Z","title":"Cross attention based style distribution for controllable person image synthesis","venue":null,"work_id":"12dae023-24e0-498b-82e3-1a49dcf12e76","year":2022},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:46.087540Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:0ee1ed421c2bc1156e3a0dd96bd474ad6a33900e3c9ce1a3b92aad3e9b7aabe7","observation_id":"eac5ee2b-9a65-4ff3-b454-02c91c964aa0","resolution":{"observed_at":"2026-08-11T17:51:46.343912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.092889Z","title":"Tryondiffusion: A tale of two unets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:46.092889Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:16f6dc7168ee929fa0487cd210278640ac5efead733463a573ef196d5cd92414","observation_id":"07a4ed3a-b82d-448c-854c-bdc23f1ae201","resolution":{"observed_at":"2026-08-11T17:51:46.092889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.310261Z","title":"M&m vto: Multi-garment virtual try-on and editing","venue":null,"work_id":"7ba55230-d3ad-4ace-9c82-4d3ab592768d","year":2024},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:46.097572Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:3cc65ebc56a97b3c4823d2e0e247b852ee4c5fb31dbd6bb1c4f3d9bb3e42dfd4","observation_id":"f630138c-6492-409d-8a98-4f033555252e","resolution":{"observed_at":"2026-08-11T17:51:46.316049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:46.285401Z","title":"Progressive pose attention transfer for person image generation","venue":null,"work_id":"0873564f-3686-453c-97d3-895e73320cb7","year":2019},"citing_paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-11T17:51:46.102727Z"},"links":{"citing_paper":"/paper/2412.08486"},"observation_digest":"sha256:ac1a65959c3df91b6a63149be24003f792493613e0f5bd39254ba94d1de59aab","observation_id":"6d377b65-d280-472c-abb7-61a13f26b4a8","resolution":{"observed_at":"2026-08-11T17:51:46.293870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.08486","last_updated":"2024-12-12T18:43:39Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T13:59:23.331093Z","submitted_at":"2024-12-11T15:51:14Z","title":"Learning Flow Fields in Attention for Controllable Person Image Generation"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":41},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 5 inbound Pith citation observations for arXiv:2412.08486."}