{"as_of":"2026-08-08T14:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f7a1118cb7bffc60655ebdbe2bd67f0901eb62d03af7fa00db47d8841d5f6b2e","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:40:23.917814Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.20983/citation-record","integrity":"/paper/2506.20983/integrity","json":"/paper/2506.20983/citation-record.json","paper":"/paper/2506.20983"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:32.708065Z","title":"Spatext: Spatio-textual representation for con- trollable image generation","venue":null,"work_id":"3c7829fb-9578-479e-900c-0ba919b468be","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:18.387547Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:5ef2540d321704ea4a7b5706c523e484a43a83b8b05aefd2ec3737d03126ea12","observation_id":"833bc21f-dc56-4240-95b8-ce59b7836de8","resolution":{"observed_at":"2026-08-06T22:40:32.798550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T22:40:18.447091Z","title":"Ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:18.447091Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:ab3bfad8df17c5fb9ba8e3e1b44b190189561433edcfe22bd99047d0c1a9b655","observation_id":"45547b5a-3975-438f-8a80-e554d2d9599b","resolution":{"observed_at":"2026-08-06T22:40:18.447091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12288","last_updated":"2023-02-23T19:13:10Z","snapshot_observed_at":"2026-07-06T14:55:15.719380Z","submitted_at":"2023-02-23T19:13:10Z","title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12288","snapshot_observed_at":"2026-08-06T22:40:18.534281Z","title":"Zoedepth: Zero-shot trans- fer by combining relative and metric depth","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:18.534281Z"},"links":{"cited_paper":"/paper/2302.12288","citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:e1c31c68720cc6e52cd604b62a6af39c66c0b5304ddd5d2d85db426680c932d5","observation_id":"44218b58-17a2-47d5-b3f3-1ea80d3510a3","resolution":{"observed_at":"2026-08-06T22:40:18.534281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:32.521941Z","title":"Person image synthesis via de- noising diffusion model","venue":null,"work_id":"c2cbc880-6621-4c0a-966a-2966bf6722b2","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:18.624771Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:2c10239e96f660f28c49fd83d872c23a21131237386b6ff9bfdf2c2f7d6f22ea","observation_id":"5628c2ab-30af-4872-888c-e7383a3d72a1","resolution":{"observed_at":"2026-08-06T22:40:32.639476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:32.331049Z","title":"Openpose: Realtime multi-person 2d pose estimation using part affinity fields","venue":null,"work_id":"32fcc1b3-eea1-4e7c-9e5f-f7b4e2b3a28c","year":null},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:18.685457Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:0faeb4a976e9a888e1d1912ea6517bfc45a894900d9d4ad9a006f31cbefd4fcd","observation_id":"5ab2491b-4378-4387-9606-075d955b3969","resolution":{"observed_at":"2026-08-06T22:40:32.444330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:32.150651Z","title":"Magicpose: Realistic human poses and facial expressions retargeting with identity-aware diffu- sion","venue":null,"work_id":"170b81c1-ce95-406f-b645-3a2efd148a0d","year":null},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:18.778458Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:c83027370fe3ab4bd652cff1107b161e4f47c856544b815d5c9e655204907ada","observation_id":"f0ee8c9b-2a7e-4cf6-9751-6724cb5b10a3","resolution":{"observed_at":"2026-08-06T22:40:32.248922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:31.965830Z","title":"Up- gpt: Universal diffusion model for person image generation, editing and pose transfer","venue":null,"work_id":"2c46939d-a2d0-400a-8696-bb69b30f920b","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:18.884292Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:cce12c80d187b242b90e3eef1c3480418999ca14ddc868a9df1bd11be6e9094e","observation_id":"607853e3-52f3-44ea-b3c7-8e5ac184cf04","resolution":{"observed_at":"2026-08-06T22:40:32.064430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:31.729952Z","title":"Openmmlab pose estimation tool- box and benchmark","venue":null,"work_id":"075c471f-4fd1-4829-afd8-5282ac05d0f5","year":2020},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:18.965482Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:ac09456a03bd1088593c3eb5cb0d65d62fce69c586c9e6b6ee12c654c81aeea3","observation_id":"fe2847af-3a21-4c59-a7b5-e3523d7f771d","resolution":{"observed_at":"2026-08-06T22:40:31.812432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:19.108485Z","title":"Make-a-scene: Scene- based text-to-image generation with human priors","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:19.108485Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:a2224961abd8093211e8cea94601e3384c09774abd74b07d14d7b81baab55a8e","observation_id":"c22768ff-8cb5-466d-a26d-0bd141b8e2cd","resolution":{"observed_at":"2026-08-06T22:40:19.108485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-06T22:40:19.223666Z","title":"An image is worth one word: Personalizing text-to- image generation using textual inversion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:19.223666Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:9bb46f48bf7f5bc15551d0621c126452f07160090fcb0fe3d70154c1c3c997c4","observation_id":"2c05867f-a099-4f8a-9a47-ee4101208c0a","resolution":{"observed_at":"2026-08-06T22:40:19.223666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:31.494037Z","title":"Controllable person image synthesis with pose-constrained latent diffusion","venue":null,"work_id":"28c7cd4f-8bdb-4510-8583-9e1305976610","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:19.334652Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:f0069ab56fc03c9c987b4314c3db656d9dedb7ddedcfa77d64d70294de1aea51","observation_id":"acac9e1e-f3f4-4ff5-b258-00547f502898","resolution":{"observed_at":"2026-08-06T22:40:31.564562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:31.252100Z","title":"Prompt-to-prompt image editing with cross-attention control","venue":null,"work_id":"1224daf1-d0ab-447c-8200-a07c2899aac1","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:19.479717Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:1b9806d6df09ae0bc58f9af474f405f7f73da086e6a019ccfe4e631a1e73d5e3","observation_id":"7d530aa7-e0e8-4bda-bc64-6701f675d284","resolution":{"observed_at":"2026-08-06T22:40:31.391334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:19.644611Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:19.644611Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:e9ec615e31353cc23ef60a03a2e366b03ca6619115fc6f37b5429279c92edc6c","observation_id":"e5d999f1-1c13-4f02-9527-39893fc807d6","resolution":{"observed_at":"2026-08-06T22:40:19.644611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:31.051301Z","title":"Animate anyone: Consistent and controllable image- to-video synthesis for character animation","venue":null,"work_id":"92ce6bcc-83d4-4724-b53d-57d9d400d061","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:19.795100Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:6c5187ec8ec9fca3ab2604ca442487a5bc1eb4f2bf4263b45f9465c7f374f1e7","observation_id":"a01b8f56-54a9-47fb-8b03-71f48e7721fc","resolution":{"observed_at":"2026-08-06T22:40:31.130883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:30.829500Z","title":"Composer: Creative and controllable im- age synthesis with composable conditions","venue":null,"work_id":"a4fc1e5a-e38b-42cf-a365-fd0599c316cb","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:19.888999Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:1b19699961eb729857d90bab88e596c20d8b4ee1a4d40631ea1ed7f472a59fd1","observation_id":"6a1bccc9-3dc9-4d47-93f4-1a8cb391bf44","resolution":{"observed_at":"2026-08-06T22:40:30.925992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:30.579675Z","title":"Stable-pose: Leveraging transformers for pose-guided text-to-image generation","venue":null,"work_id":"485cba37-b9d6-43a5-af40-f20e27618fe9","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:19.965654Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:b3e26b6211a04985c19255c75f2c0b5e22ba6a950a310bd556238ed6eb944887","observation_id":"f941104b-625f-4ac8-ac21-f92395e651d6","resolution":{"observed_at":"2026-08-06T22:40:30.703108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17845","last_updated":"2023-05-31T11:09:40Z","snapshot_observed_at":"2026-08-05T18:03:02.550574Z","submitted_at":"2023-05-29T01:56:42Z","title":"SPAC-Net: Synthetic Pose-aware Animal ControlNet for Enhanced Pose Estimation","version":2},"cited_work":{"arxiv_id":"2305.17845","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.17845","snapshot_observed_at":"2026-08-06T22:40:24.396720Z","title":"SPAC-Net: Synthetic Pose-aware Animal ControlNet for Enhanced Pose Estimation","venue":"cs.CV","work_id":"9b07574a-33dc-473f-b922-d9abb72e3771","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:20.049697Z"},"links":{"cited_paper":"/paper/2305.17845","citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:b9757f29770ec975a8e04a17bbfea94080b4d7d0269da125c8b51704f0bd761d","observation_id":"3cf98ae1-f372-48e2-b8d6-6706dcd805a4","resolution":{"observed_at":"2026-08-06T22:40:24.462808Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02653","last_updated":"2024-09-04T12:28:44Z","snapshot_observed_at":"2026-08-04T18:00:18.095442Z","submitted_at":"2024-09-04T12:28:44Z","title":"Skip-and-Play: Depth-Driven Pose-Preserved Image Generation for Any Objects","version":1},"cited_work":{"arxiv_id":"2409.02653","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02653","snapshot_observed_at":"2026-08-06T22:40:24.210757Z","title":"Skip-and-Play: Depth-Driven Pose-Preserved Image Generation for Any Objects","venue":"cs.CV","work_id":"d1deeff2-1fa8-46d1-905e-f6d2b701b5c1","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:20.131528Z"},"links":{"cited_paper":"/paper/2409.02653","citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:4cff750172f6dc62daa60e4a90519cba0a334ced9ebd19ecbe9a763da8f8e27e","observation_id":"af2d24ef-0310-4618-a707-be84a04873cf","resolution":{"observed_at":"2026-08-06T22:40:24.274129Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:30.361465Z","title":"Human-art: A versatile human-centric dataset bridg- ing natural and artificial scenes","venue":null,"work_id":"8021aa8e-89e9-4d45-a2ba-7b60950b665d","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:20.219216Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:72f4dde691c0ec6ff5046fa68bb906635ff2753669ca5b3c00c693f8a8d3b969","observation_id":"e090c3f2-84a6-4ede-b58e-7564d8eada9c","resolution":{"observed_at":"2026-08-06T22:40:30.449937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:30.175618Z","title":"Humansd: A native skeleton-guided diffusion model for human image generation","venue":null,"work_id":"13d0c888-9837-473f-8049-32551a6b02a8","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:20.293266Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:7f15bad492fe62cb549f5d074c37f397c2ebbc0a7d94db9e77ac3cc95432a335","observation_id":"2d79e33b-121f-47f2-94b5-b25e00a34248","resolution":{"observed_at":"2026-08-06T22:40:30.256036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:30.051026Z","title":"Dreampose: Fashion image-to-video synthesis via stable diffusion","venue":null,"work_id":"29b817f6-db58-40c0-9d84-c6a883e9d1b5","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:20.396502Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:68622f27cb563074a1e2aeb3c28e55b920cc5eb3f988421ffdfbb1958bbaa763","observation_id":"25cb4b2a-f888-4c65-8186-54b21222ff5c","resolution":{"observed_at":"2026-08-06T22:40:30.116455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:29.889682Z","title":"Segment anything in high quality","venue":null,"work_id":"eb5439c3-feef-4858-ba3a-ec915f98f6f4","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:20.512885Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:bc3c77a2157d0509f4223d2191f90d3f9abb1db166337c470ac345f740a47700","observation_id":"7184493b-22ca-44a7-b19d-82dd367fcff4","resolution":{"observed_at":"2026-08-06T22:40:29.972257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:29.721828Z","title":"Dense text-to-image generation with attention modulation","venue":null,"work_id":"2d4f23f3-e029-4b34-aebd-785df01b6692","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:20.595026Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:f68f4d39bd2eecc383cd8f6592d69d6213dd5f8521c90a70b0c7becfe6e0ae34","observation_id":"1ec9def2-159a-4df0-891f-0413aa5e4cb8","resolution":{"observed_at":"2026-08-06T22:40:29.804186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09349","last_updated":"2025-02-25T02:55:40Z","snapshot_observed_at":"2026-07-06T20:06:00.411620Z","submitted_at":"2024-12-12T15:15:59Z","title":"DisPose: Disentangling Pose Guidance for Controllable Human Image Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09349","snapshot_observed_at":"2026-08-06T22:40:20.708669Z","title":"Dispose: Disen- tangling pose guidance for controllable human image anima- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:20.708669Z"},"links":{"cited_paper":"/paper/2412.09349","citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:7a13549c6d92ba4c8890fbeb301a354dedaeca160a8fd5d9f7dbcdadd357e286","observation_id":"607a66ca-c9bd-42e4-9e61-6732cd769cce","resolution":{"observed_at":"2026-08-06T22:40:20.708669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:29.596967Z","title":"Controlnet++: Improving conditional controls with efficient consistency feedback","venue":null,"work_id":"5435a215-1ccb-49bf-b2a7-a740d3c7479b","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:20.793234Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:e6dd91da6db4e78115f82848d65ea42a4c8772f82d71db0f8c9c3ea8b7c7c1c3","observation_id":"783e2f72-2b44-4d2e-a2bd-49810a47c9c5","resolution":{"observed_at":"2026-08-06T22:40:29.666948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18417","last_updated":"2024-03-27T10:09:38Z","snapshot_observed_at":"2026-07-06T17:51:48.378864Z","submitted_at":"2024-03-27T10:09:38Z","title":"ECNet: Effective Controllable Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18417","snapshot_observed_at":"2026-08-06T22:40:20.850877Z","title":"Ecnet: Effective controllable text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:20.850877Z"},"links":{"cited_paper":"/paper/2403.18417","citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:039419cd9ac662b8868dbecf2995f8565b1ccc2bdcd374b72f3de118f5b95552","observation_id":"f69f1314-6a64-4010-a217-9626108da35b","resolution":{"observed_at":"2026-08-06T22:40:20.850877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:20.931244Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:20.931244Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:0d27be09d1885eeaba863354e146bd3f93d31d6fd8308970383386eff5e3213f","observation_id":"52b2b2fb-567d-4835-a095-42c980c5b3f2","resolution":{"observed_at":"2026-08-06T22:40:20.931244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:29.441287Z","title":"Controllable text-to-3d generation via surface-aligned gaus- sian splatting","venue":null,"work_id":"d0a811d3-b097-4fb4-a3af-9b3f47b28d15","year":null},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:21.050057Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:9f161f5d868d75ad3bf8184d71665876c89f75185462013e53a17bff7d4d7435","observation_id":"119d5b4a-1c81-4081-b23b-e238c38c97ce","resolution":{"observed_at":"2026-08-06T22:40:29.491203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:29.281185Z","title":"Ctrl-x: Controlling structure and appear- ance for text-to-image generation without guidance","venue":null,"work_id":"083b6b99-03bd-4832-b3ae-5e48d6d2193f","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:21.171516Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:3395b7b1cd1039866c994ac3f10e4b3f9c752fb498063e9054a864b62aff9f22","observation_id":"d38beb51-20af-492f-8711-9b700076ecec","resolution":{"observed_at":"2026-08-06T22:40:29.354096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:21.255648Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:21.255648Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:f26e2e646f5ba4da3dc434d0ca73c2a690e7dbf71f946bd5334c73f7a46b3051","observation_id":"ee0095ed-0ed8-43f5-9242-aec745325c01","resolution":{"observed_at":"2026-08-06T22:40:21.255648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:29.093194Z","title":"Hyperhuman: Hyper-realistic human generation with latent structural diffusion","venue":null,"work_id":"1fbba74e-3e45-4445-a9e8-656200ae11ae","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:21.369782Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:87f2bc814889e8d6d262109bfb8e47fb4f1c45a2d0228d9f9ea5cb01ffcd03a2","observation_id":"13543dd2-06d3-4ca0-92a3-4747a533ad52","resolution":{"observed_at":"2026-08-06T22:40:29.191061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:28.930279Z","title":"Smartcontrol: Enhancing controlnet for handling rough visual conditions","venue":null,"work_id":"9e368cdf-aae0-4ded-bf5e-61fa42078abe","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:21.456151Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:d9c0b505040d5acf4d9ca25820a644db1641f105f1b95f400c7a8458508f679f","observation_id":"f1dd4690-39e6-4a9c-9caa-9cf447c62710","resolution":{"observed_at":"2026-08-06T22:40:29.015061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:28.767101Z","title":"Controllable person image synthesis with attribute-decomposed gan","venue":null,"work_id":"64a51959-354d-4b9a-9ca3-d025d8b3e9d5","year":null},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:21.568663Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:59502810a2ff9fc9fb8f2ea335ca55d616a6e9dcb1a1c5f8c519d62c20c415b2","observation_id":"993a21a4-7d32-43e1-a379-0d171d8b410b","resolution":{"observed_at":"2026-08-06T22:40:28.843139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:28.590970Z","title":"Freecontrol: Training-free spatial control of any text-to-image diffusion model with any condition","venue":null,"work_id":"904e2ae2-524a-4234-8baf-b185ff9b0931","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:21.644746Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:4a9df1a4e29f9316b8e0010a98563d7be779ff168bed75711579885b54d61060","observation_id":"91adaafd-c272-4938-8cf1-6dde34bff1de","resolution":{"observed_at":"2026-08-06T22:40:28.645243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:28.409378Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":"efa8563e-6ca5-40cb-b818-6a7779e137cf","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:21.732972Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:cc085584867838b0407b398ba828fbc52ac8f15c3aa7e2bd4f3eb9274ca8f010","observation_id":"808ad8c8-ba86-4a9d-a047-274bd831b626","resolution":{"observed_at":"2026-08-06T22:40:28.506372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:28.231149Z","title":"Consolidating attention features for multi-view image editing","venue":null,"work_id":"51602aa8-64b5-45d0-be20-ced1077b86fa","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:21.818579Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:633b42ffc97d4ae7df234534334fd12f52340b1ab66cbab902cc35dccfc401c6","observation_id":"1d451bb1-a1f3-4a38-bf7f-618b1ac63fa6","resolution":{"observed_at":"2026-08-06T22:40:28.334312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06070","last_updated":"2025-03-08T08:43:03Z","snapshot_observed_at":"2026-07-06T18:59:34.520274Z","submitted_at":"2024-08-12T11:41:18Z","title":"ControlNeXt: Powerful and Efficient Control for Image and Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06070","snapshot_observed_at":"2026-08-06T22:40:21.916192Z","title":"Controlnext: Powerful and effi- cient control for image and video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:21.916192Z"},"links":{"cited_paper":"/paper/2408.06070","citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:b4af3319197e4ac08267ea2929363c14a16fbcfc889199f11467e332e36bfa3f","observation_id":"9c39c07c-2e35-41cf-86bd-dd14baf73fc2","resolution":{"observed_at":"2026-08-06T22:40:21.916192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:28.024215Z","title":"Learn, imagine and create: Text-to-image generation from prior knowledge","venue":null,"work_id":"12f467ce-6b5f-45c2-b0c0-0ad9f80d308c","year":2019},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:22.006626Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:4904855d45649ec6b200dcdd1fe0bec5b64460bb80ed1d3c9afac2d8b4765c87","observation_id":"0d88ba47-61e9-41bd-b7e9-1e56f189f0c0","resolution":{"observed_at":"2026-08-06T22:40:28.132901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:27.828546Z","title":"Mirrorgan: Learning text-to-image generation by re- description","venue":null,"work_id":"c8bfc38b-b729-4d85-9bab-8732c93c7875","year":null},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:22.076431Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:6d058d030f3948e912429db27ec1e06d5f0902318b096cb9ae937b1d9054061e","observation_id":"05a64b06-8e81-48fc-85a5-3ca9b9b271ad","resolution":{"observed_at":"2026-08-06T22:40:27.933999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:27.653882Z","title":"Unicontrol: A unified diffu- sion model for controllable visual generation in the wild","venue":null,"work_id":"fb4780ce-325d-42ea-ba0a-28d3168038b3","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:22.160510Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:30c406e40426d6c13001325447c5d1a99cffedabc450f97c3a4e189d83f004ee","observation_id":"72703871-4aa1-4f6a-8c2f-94d34b17d84a","resolution":{"observed_at":"2026-08-06T22:40:27.738273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:27.471462Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"2d5c6dea-3554-4649-9c90-e839d8125b20","year":2022},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:22.267932Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:e6edd837c78d8979575f862e073e52347ce016ccd08e362010875b03eb3f0217","observation_id":"1a0eead5-185a-4469-b772-310b5493210b","resolution":{"observed_at":"2026-08-06T22:40:27.558803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:27.266200Z","title":"Benchmarking and error diagnosis in multi-instance pose estimation","venue":null,"work_id":"589a1a99-6009-4e68-aed4-cf6f20be4397","year":2017},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:22.354649Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:dbd909fcd8e5c3d37cbaf69e7bf499b51c6fee6bca419e9c9f374a7aa7fce766","observation_id":"83d0645b-7bff-4c3e-9d2a-5eccb02dc216","resolution":{"observed_at":"2026-08-06T22:40:27.374856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:27.032396Z","title":"Stable Diffusion v1-5, 2022","venue":null,"work_id":"84b33077-970d-4ead-ab53-8cfb47763120","year":2022},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:22.437441Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:8547e9a61d95cc391f8c622130141d41330892c02679c28c509ac9efe9c4c0fd","observation_id":"c87315b9-434f-461f-8cff-34b5f42a6f15","resolution":{"observed_at":"2026-08-06T22:40:27.151560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:26.816558Z","title":"Advancing pose-guided image synthesis with pro- gressive conditional diffusion models","venue":null,"work_id":"2c37e3d5-3797-4031-86a6-b338ba77d935","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:22.559546Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:41457f61ec6cb84ffac1db8e27166d6848915ae63018337fa6732f2359b5fb28","observation_id":"86d5a380-274a-47dd-9cef-f2acde020253","resolution":{"observed_at":"2026-08-06T22:40:26.932845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:26.594689Z","title":"Deep high-resolution representation learning for human pose es- timation","venue":null,"work_id":"0908ba38-e750-472b-bc08-67fc96b9918f","year":2019},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:22.670807Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:363e8f6fbf4a6ad98d8cdd029a551bbeab27b763c68a51058ad862808a91cb43","observation_id":"1445cae7-bdb8-4e1e-b56d-87fe324abe08","resolution":{"observed_at":"2026-08-06T22:40:26.729070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:26.368351Z","title":"What the DAAM: Interpreting stable diffu- sion using cross attention","venue":null,"work_id":"0d1baea1-23e4-4e05-8a46-ea7e9b2e4475","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:22.795614Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:a24a9ff01c64cd701f13b3cdd591bfdcfa32000c1ac3732df79833a175a65665","observation_id":"272e4a01-41a1-4d12-b231-ca0ffe1d8095","resolution":{"observed_at":"2026-08-06T22:40:26.481776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:26.205840Z","title":"Visualizing data using t-sne","venue":null,"work_id":"aed91197-a108-4dfb-a152-2d40186d50cc","year":2008},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:22.889767Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:cb409d3c22f4f1045b508717bca9467e44cc402a0ee3d6703c750d5def882384","observation_id":"3af9e700-3e09-4412-bd5e-0140522cdec1","resolution":{"observed_at":"2026-08-06T22:40:26.260908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04946","last_updated":"2024-04-07T12:57:41Z","snapshot_observed_at":"2026-08-04T04:52:44.490954Z","submitted_at":"2024-04-07T12:57:41Z","title":"AnimateZoo: Zero-shot Video Generation of Cross-Species Animation via Subject Alignment","version":1},"cited_work":{"arxiv_id":"2404.04946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.04946","snapshot_observed_at":"2026-08-06T22:40:24.041723Z","title":"AnimateZoo: Zero-shot Video Generation of Cross-Species Animation via Subject Alignment","venue":"cs.CV","work_id":"cdc93e08-aed0-4e3f-a142-631b7716bcb8","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:22.979387Z"},"links":{"cited_paper":"/paper/2404.04946","citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:8eca1a60b516f4b6c362b1c2f88fb91528ed2f53670fca13659e4043c092543b","observation_id":"b36ee586-7416-44ad-a2bf-8227b61bd322","resolution":{"observed_at":"2026-08-06T22:40:24.089793Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:26.073813Z","title":"Vit- pose++: Vision transformer for generic body pose estima- tion","venue":null,"work_id":"7af24e25-a9fd-4a50-9f02-adedbb39047d","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:23.064502Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:149ebaf932ef5869ee2fd62955b774b2b7a0b2fb78d4eabfb64cf3a7438c8d57","observation_id":"8fcca519-5e3b-4860-9e55-37269ad6398a","resolution":{"observed_at":"2026-08-06T22:40:26.127713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:23.153655Z","title":"Magicanimate: Temporally consistent human im- age animation using diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:23.153655Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:d1dc5fd9e8e4c48ea2fe8866fe9e17af3af052a1941a76b0611680f38c1e1253","observation_id":"34235a47-1d52-499f-9d9d-7f07ea86d56b","resolution":{"observed_at":"2026-08-06T22:40:23.153655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:25.877732Z","title":"When controlnet meets inexplicit masks: A case study of controlnet on its contour- following ability","venue":null,"work_id":"58f69531-3835-4fb6-9dcf-6e6bcf582672","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:23.205566Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:b936c9dbc9027cd1b9c4fd7590db1720b2d522328aa04535518cd3e8265eb30f","observation_id":"6358fd66-da64-4fd1-876c-ee32e3ac8255","resolution":{"observed_at":"2026-08-06T22:40:25.958791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:25.713158Z","title":"Grpose: Learning graph relations for human image generation with pose priors","venue":null,"work_id":"4fa16416-b117-4b4c-a7f4-e6e091ba446c","year":2025},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:23.282647Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:9fa5a26f6f82e13547dff9a683984721497c2fdbb6ccd133abb0fdf63504e192","observation_id":"a06cd6da-07c0-4043-bfaf-f54265992b12","resolution":{"observed_at":"2026-08-06T22:40:25.776788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:25.549999Z","title":"Ap-10k: A benchmark for animal pose estima- tion in the wild","venue":null,"work_id":"19418237-2015-4a80-b9fe-2c3fa6ae9e14","year":2021},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:23.382631Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:1028c2a872354979533b954f7ff33c6fd08a5c049503f76543c965d7779e78c3","observation_id":"1ac9b915-db30-4958-8005-df02b151b425","resolution":{"observed_at":"2026-08-06T22:40:25.616665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:25.392497Z","title":"Pise: Person image synthesis and editing with decoupled gan","venue":null,"work_id":"49626c20-6f0b-4901-8179-d5405d5f96bb","year":2021},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:23.483847Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:32b2b0ae49a8d7eddf36ce5c122109242af0bc9dfb63d6bc5e2d45c4a746f836","observation_id":"9207dcfd-c897-4005-b695-294835838505","resolution":{"observed_at":"2026-08-06T22:40:25.458888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:25.183361Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"de4648cd-d903-4234-b914-f09e35d46e48","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:23.564585Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:bbf8b4c87540d71e0dfef47b51b0d6920fe6855da73ad4a4247008357875a6db","observation_id":"1ccaa88c-f7b5-463c-9e73-d35c2edba244","resolution":{"observed_at":"2026-08-06T22:40:25.283427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:25.042043Z","title":"Uni-controlnet: All-in-one control to text-to-image diffusion models","venue":null,"work_id":"04e448dc-b318-4670-ab7a-0575fd9157f7","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:23.662160Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:8980669e4bb71aa2409f35421162010ab31581192f6aef2030998605be9a3d5e","observation_id":"9d89d071-f55c-404f-828f-2ad97bd5aa08","resolution":{"observed_at":"2026-08-06T22:40:25.105082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:24.860454Z","title":"Unipc: A unified predictor-corrector framework for fast sampling of diffusion models","venue":null,"work_id":"096de093-a7f1-4363-89c9-a11c08cc0438","year":2023},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:23.776671Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:929d953d6a8bfa836bd6521bb9ca47a4537e096d4e36f94542dfa4c1af6d3955","observation_id":"5208c7f9-7def-4072-8b94-6218f2966c44","resolution":{"observed_at":"2026-08-06T22:40:24.924657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:24.712066Z","title":"Cross attention based style distribution for controllable person image synthesis","venue":null,"work_id":"c7a36685-6e70-43fa-bacc-0b32822b8f7d","year":2022},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:23.848578Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:b892396f88629b6eb570c6e9017a091f63118e67246446f9057561203ef71d3a","observation_id":"647fed9d-f1d4-4794-ab9e-ee636f9fe1ea","resolution":{"observed_at":"2026-08-06T22:40:24.769862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:24.566178Z","title":"Champ: Controllable and consistent human image an- imation with 3d parametric guidance","venue":null,"work_id":"de333a1f-c71f-44f7-a01d-8e8904f51197","year":2024},"citing_paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:23.917814Z"},"links":{"citing_paper":"/paper/2506.20983"},"observation_digest":"sha256:b83e2eefc4495e60b0038097edbf4855e9b01b9cca0d68a4e06965982be1aa6f","observation_id":"9475ba99-a852-441d-a906-d2c102ee2fdb","resolution":{"observed_at":"2026-08-06T22:40:24.624338Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.20983","last_updated":"2025-06-26T03:57:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T22:34:11.857808Z","submitted_at":"2025-06-26T03:57:44Z","title":"Rethink Sparse Signals for Pose-guided Text-to-image Generation"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":3,"verified_fuzzy":44},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2506.20983."}