{"as_of":"2026-08-07T07:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5598c0bca036f70e08509d68bdc64f94e164d18fa55b7d24d622eff4c767fe3e","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:35:54.220222Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T10:47:22.111357Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T02:36:27.320514Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"cited_work":{"arxiv_id":"2507.02321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02321","snapshot_observed_at":"2026-07-02T02:36:27.320514Z","title":"Heeding the inner voice: Aligning controlnet training via intermediate features feedback.arXiv preprint arXiv:2507.02321, 2025","venue":null,"work_id":"1da80e8f-e359-46a5-a7a6-9a5762a088d5","year":2025},"citing_paper":{"arxiv_id":"2606.04107","last_updated":"2026-06-02T18:11:20Z","snapshot_observed_at":"2026-07-06T23:44:14.261541Z","submitted_at":"2026-06-02T18:11:20Z","title":"Reflection Separation from a Single Image via Joint Latent Diffusion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T10:47:22.111357Z"},"links":{"cited_paper":"/paper/2507.02321","citing_paper":"/paper/2606.04107"},"observation_digest":"sha256:f424d95fadc5568b022ab5f9b66ca096253e1d3943c3c22a1e8d368ed2a060b0","observation_id":"b68a331c-fa61-4122-9cf5-aa4253609438","resolution":{"observed_at":"2026-07-02T02:36:27.322218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02321/citation-record","integrity":"/paper/2507.02321/integrity","json":"/paper/2507.02321/citation-record.json","paper":"/paper/2507.02321"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:58.737199Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":"adb7d0f9-3419-4ac9-bab6-b55e5c7eeba0","year":2024},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:49.477443Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:1de6ad46323cb4ac2ff9ac9d381f01c8aa5b0d5c0130800becb35d718b933a23","observation_id":"36a3d54b-6f99-4e8c-b0f2-0c7b77895d91","resolution":{"observed_at":"2026-08-06T20:35:58.842070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:49.524548Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:49.524548Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:8f1b0b2344277556ad5f024446de48cf4061c76779dc2ddae9337cbe93b5622b","observation_id":"6b4632af-188b-4b6f-b8d6-efe4715ade8f","resolution":{"observed_at":"2026-08-06T20:35:49.524548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-06T20:35:49.586081Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:49.586081Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:a92cd476e85919096d4a1e5ecbe093497e5b2b78829f59df9a144d1bc7208f61","observation_id":"e0a103da-e02b-400c-ba1c-708af90c3546","resolution":{"observed_at":"2026-08-06T20:35:49.586081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:58.527443Z","title":"ControlNet++: Improving Conditional Controls with Efficient Consistency Feedback: Project Page: liming-ai","venue":null,"work_id":"cc6ac0b2-828d-496b-8c5a-298b2dcf35b9","year":2024},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:49.652254Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:a73897d614af7de8b1ac9f12fea8b97114d0a0690cb7762b8e100b3e4e48e85b","observation_id":"4c81f357-ae0e-49e4-a19f-be14bea1fbeb","resolution":{"observed_at":"2026-08-06T20:35:58.619017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11236","last_updated":"2025-03-19T14:41:25Z","snapshot_observed_at":"2026-07-06T19:33:34.819837Z","submitted_at":"2024-10-15T03:43:51Z","title":"Ctrl-U: Robust Conditional Image Generation via Uncertainty-aware Reward Modeling","version":3},"cited_work":{"arxiv_id":"2410.11236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11236","snapshot_observed_at":"2026-08-06T20:35:54.839506Z","title":"Ctrl-U: Robust Conditional Image Generation via Uncertainty-aware Reward Modeling","venue":"cs.CV","work_id":"e8233f1f-2c33-4ae9-ab10-b372a9a252ad","year":2024},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:49.706128Z"},"links":{"cited_paper":"/paper/2410.11236","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:daddb7682e9faa0e960d383f5b516083008ce05dad5c059134ce932174675cae","observation_id":"343056b2-3b41-451d-8cbe-ae0710410cc6","resolution":{"observed_at":"2026-08-06T20:35:54.913613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:49.790142Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:49.790142Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:c0825974ec354c70a40d2de56a4b9e382fd82abc84e14d1d6474e2130d4e6c53","observation_id":"af2b2fa6-d007-47b9-a69e-66ffdac07626","resolution":{"observed_at":"2026-08-06T20:35:49.790142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T20:35:49.863663Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:49.863663Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:343e69c50eac0c1ad443b4683d0a81666eb2a50b47624a97d8a2c077ffb5fa73","observation_id":"5971fe87-45e3-4af1-bc62-fa56c7f15b22","resolution":{"observed_at":"2026-08-06T20:35:49.863663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:49.935106Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:49.935106Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:5390568d0be2d6031d6ab6b467bb9ea07423a523a0f758d8ff2e1ab5b5bf2d24","observation_id":"7c13a7d1-7fab-4a90-9b76-7ca08dfe365e","resolution":{"observed_at":"2026-08-06T20:35:49.935106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:58.328486Z","title":"Deep unsuper- vised learning using nonequilibrium thermodynamics","venue":null,"work_id":"3a762d7d-e30a-4163-a825-f8a3d015b823","year":2015},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:50.076470Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:506311fa9cfa8da77903ac1a15d9f4312947bbc28c685da8500deb0b72544424","observation_id":"fa84931d-d19a-432b-990e-8b9f831d1107","resolution":{"observed_at":"2026-08-06T20:35:58.409609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-02T18:14:47.498475Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-06T20:35:50.202595Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:50.202595Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:97dcb11c5dcaa4871978f454de9ff3b81d49fc49fface74813df8f6df55d613e","observation_id":"5a81e00c-8471-42b8-b936-7ef4c26b2f01","resolution":{"observed_at":"2026-08-06T20:35:50.202595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:58.115790Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"d64b943e-8794-4eaf-873a-fc7b667588d6","year":2021},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:50.305528Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:82eccd6229d850a51ea2f7d2248424359d7243a9fbfbdd4873ca1a3a5d576652","observation_id":"b918a55e-1b70-4f23-acc5-b278d5d8856e","resolution":{"observed_at":"2026-08-06T20:35:58.207271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:50.417376Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:50.417376Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:efb0c39a962761fe4b85c53839ef72a0071ed6d8bfba7c17aa4710652605101d","observation_id":"6fa6221d-33d1-4be7-8655-ef56f987d737","resolution":{"observed_at":"2026-08-06T20:35:50.417376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:57.948175Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"ffbb122a-b3d8-44fe-b73d-6243b82f57cb","year":2022},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:50.552056Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:47b1857e325190904f8d9f3c3d1de5748a4900a43b84c94ad8650fdefc191d0c","observation_id":"54958643-4533-43aa-aa33-179d7f9fd828","resolution":{"observed_at":"2026-08-06T20:35:58.002866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T20:35:50.644902Z","title":"ediff-i: Text-to-image diffusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:50.644902Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:361190c97f2db803cbcf326e796abac8a8c323d3c8d46a08da5205b8f76ef6e0","observation_id":"b08804e5-8ff5-4084-b159-68d3b0b1c927","resolution":{"observed_at":"2026-08-06T20:35:50.644902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T20:35:50.758018Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:50.758018Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:a06116a9fc52ad82cdcbb653591deb1562428a540127c68f6f2fa2e89be0bcd7","observation_id":"18b9f45e-8175-4f4a-b3e3-4a13efa3c54d","resolution":{"observed_at":"2026-08-06T20:35:50.758018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:57.752714Z","title":"Cocktail: Mixing multi-modality control for text-conditional image generation","venue":null,"work_id":"7bd91d11-40bd-47f0-860c-f75a9c3a23e7","year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:50.877805Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:0fb504e996e715a672bb1cf7358d1ffb5a0b080e8be86d076a364ece0ca94239","observation_id":"51876550-2700-4d03-8a44-ba567216a1d6","resolution":{"observed_at":"2026-08-06T20:35:57.831530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09778","last_updated":"2023-02-22T02:14:55Z","snapshot_observed_at":"2026-08-06T12:21:57.779550Z","submitted_at":"2023-02-20T05:48:41Z","title":"Composer: Creative and Controllable Image Synthesis with Composable Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09778","snapshot_observed_at":"2026-08-06T20:35:50.956752Z","title":"Com- poser: Creative and controllable image synthesis with composable conditions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:50.956752Z"},"links":{"cited_paper":"/paper/2302.09778","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:63fa5ea1c4c1b3f746e2b88c271d79735c7158fd02bfcb27d05711159df3a9e0","observation_id":"493b943d-5f7d-4e00-b84f-b779852fd43d","resolution":{"observed_at":"2026-08-06T20:35:50.956752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:57.571713Z","title":"ControlNet-XS: Rethinking the Control of Text-to-Image Diffusion Models as Feedback-Control Systems","venue":null,"work_id":"623040c8-8a66-4f44-8375-fd9f4aceb505","year":2024},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:51.053687Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:a14e197de6b2b11093549b01ffad5f9379bfc7d3c3c4cb696c4a293cf1dc70b2","observation_id":"6817ac18-a19f-4c93-aef8-dabb0e74b87d","resolution":{"observed_at":"2026-08-06T20:35:57.663335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:51.164157Z","title":"Relactrl: Relevance-guided efficient control for diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:51.164157Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:21f04b85a6e231d67bbbc0c86217d85383d68307f44c3ee432649b44051ce86a","observation_id":"d29f8acf-1c65-4a8b-94c2-3eba77a736cc","resolution":{"observed_at":"2026-08-06T20:35:51.164157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:57.389659Z","title":"Uni-controlnet: All-in-one control to text-to-image diffusion models","venue":null,"work_id":"c56ad431-7e9f-43c0-a187-9499b02471f6","year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:51.315400Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:dcdee9fdf0abf7c4e8fb7a24d28f14f346cb7ec5d606ed52b42d7f7d3119e1bb","observation_id":"0254e3da-9d39-4408-876e-b64a853291e0","resolution":{"observed_at":"2026-08-06T20:35:57.496019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11147","last_updated":"2023-11-02T17:59:06Z","snapshot_observed_at":"2026-08-06T14:12:33.767391Z","submitted_at":"2023-05-18T17:41:34Z","title":"UniControl: A Unified Diffusion Model for Controllable Visual Generation In the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11147","snapshot_observed_at":"2026-08-06T20:35:51.439611Z","title":"Unicontrol: A unified diffusion model for controllable visual generation in the wild","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:51.439611Z"},"links":{"cited_paper":"/paper/2305.11147","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:40d773306c3f301eee96a65a89d1cce002ecddac302f57fbfe31bb32c3dfdec1","observation_id":"244f393a-58ff-4d2c-8f13-d54703c61389","resolution":{"observed_at":"2026-08-06T20:35:51.439611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05720","last_updated":"2023-11-04T19:22:35Z","snapshot_observed_at":"2026-08-02T13:34:52.246639Z","submitted_at":"2023-06-09T07:34:34Z","title":"Beyond Surface Statistics: Scene Representations in a Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05720","snapshot_observed_at":"2026-08-06T20:35:51.541078Z","title":"Beyond surface statistics: Scene repre- sentations in a latent diffusion model, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:51.541078Z"},"links":{"cited_paper":"/paper/2306.05720","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:60a7f160e29338ba1d4bf214dccef3b006cd287cdbeaad19b524ecba97ed3e98","observation_id":"00051692-5970-4a13-aaa0-090f4d048241","resolution":{"observed_at":"2026-08-06T20:35:51.541078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03126","last_updated":"2022-03-16T01:35:49Z","snapshot_observed_at":"2026-07-06T12:15:47.711366Z","submitted_at":"2021-12-06T15:55:30Z","title":"Label-Efficient Semantic Segmentation with Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.03126","snapshot_observed_at":"2026-08-06T20:35:51.657841Z","title":"Label-efficient semantic segmentation with diffusion models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:51.657841Z"},"links":{"cited_paper":"/paper/2112.03126","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:b72dfb74a8932379dceb8315d09d06e763508d5d74c251ac96b776f1f20a8aae","observation_id":"1a33835f-19c3-4a6d-b1dc-6dfd2f29a28e","resolution":{"observed_at":"2026-08-06T20:35:51.657841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:57.194503Z","title":"Unsupervised semantic correspondence using stable diffusion.Advances in Neural Information Processing Systems, 36:8266–8279, 2023","venue":null,"work_id":"cd1faaf2-3b80-42f1-8545-29f98df38952","year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:51.784491Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:4eb5e6d89e08dfb276589c94409a7c3d91586bc30b048a9d523bff48c60524f4","observation_id":"36b10831-eb2b-4b82-b2b1-97acb59f3dcb","resolution":{"observed_at":"2026-08-06T20:35:57.299473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:57.021286Z","title":"Text-to-image diffusion models are zero shot classifiers","venue":null,"work_id":"1c1d4218-9a62-42a3-be22-641b952913a2","year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:51.910081Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:a2407c75ecf42240061a0d20e1643adc5d81de3926971b47a00e0f5f36f00931","observation_id":"89e1f53c-5f7d-4ac5-8f55-92c05ff80f58","resolution":{"observed_at":"2026-08-06T20:35:57.108219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:52.029528Z","title":"Diffusion model as representation learner","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:52.029528Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:d0c2c0d42b3cd5227a6de3cf2702c3acc5183dd838fbe004cf357fdbc5a3c09c","observation_id":"9c4e2dac-5861-42d8-997c-587a4266f995","resolution":{"observed_at":"2026-08-06T20:35:52.029528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:56.846525Z","title":"Denoising diffusion autoencoders are unified self-supervised learners","venue":null,"work_id":"9a4d8d34-ead5-4de9-b161-9dcedb64b7f8","year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:52.125636Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:2d71eca1e334356b5997399c559f18b71e76fb874f5cff9c77f0359bd8634651","observation_id":"a90af4f5-6b70-4224-99f0-e9025975a2df","resolution":{"observed_at":"2026-08-06T20:35:56.914753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:56.646629Z","title":"Emer- gent correspondence from image diffusion","venue":null,"work_id":"ab51ca20-4445-4b68-b1eb-8ce35c66807e","year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:52.237269Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:214948fe0edeb26cedd7bfcdd014ef29cc1f3df127a5a34adfd73a34992a873f","observation_id":"ef68fce8-dcc5-4be5-ba3c-c8e514ffd416","resolution":{"observed_at":"2026-08-06T20:35:56.716377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.03439","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:54.497285Z","title":"Clean- DIFT: Diffusion Features without Noise","venue":null,"work_id":"6bbe334d-94ca-44f1-8ade-26ea9f0ec892","year":2024},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:52.371377Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:12afac52e130cce524d218c064cd10411ccb732228495cee213d2452a3b74fd6","observation_id":"d0699aa1-f24e-4543-b26f-b4d04a6e09c3","resolution":{"observed_at":"2026-08-06T20:35:54.529052Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11739","last_updated":"2024-01-22T07:34:06Z","snapshot_observed_at":"2026-08-05T19:36:32.752147Z","submitted_at":"2024-01-22T07:34:06Z","title":"EmerDiff: Emerging Pixel-level Semantic Knowledge in Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11739","snapshot_observed_at":"2026-08-06T20:35:52.518144Z","title":"Emerdiff: Emerg- ing pixel-level semantic knowledge in diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:52.518144Z"},"links":{"cited_paper":"/paper/2401.11739","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:da341aac9ecdc978896a89e983a5b707faabf31332a21423109060f262afe711","observation_id":"ef7cd397-221e-46ab-bc58-3da91cf42e11","resolution":{"observed_at":"2026-08-06T20:35:52.518144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04885","last_updated":"2022-12-08T18:38:46Z","snapshot_observed_at":"2026-08-03T15:47:47.841099Z","submitted_at":"2022-10-10T17:55:41Z","title":"What the DAAM: Interpreting Stable Diffusion Using Cross Attention","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.04885","snapshot_observed_at":"2026-08-06T20:35:52.667595Z","title":"What the daam: Interpreting stable diffusion using cross attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:52.667595Z"},"links":{"cited_paper":"/paper/2210.04885","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:9ac7d2c7ec966270ae91bc4c1db657a5b4e3e45cb13bc0805aa401a43c771cfe","observation_id":"8f161918-5091-4ebb-b847-f32c59fa174c","resolution":{"observed_at":"2026-08-06T20:35:52.667595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:52.769170Z","title":"Your diffusion model is secretly a zero-shot classifier","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:52.769170Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:da881d341f3bcac7b702beeae0c25ce0660434e9e14596594c588a738b2531d0","observation_id":"470a2e14-431c-45b1-91fa-66608f9ded23","resolution":{"observed_at":"2026-08-06T20:35:52.769170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:56.395363Z","title":"Diffusiondet: Diffusion model for object detection","venue":null,"work_id":"e6e6e36b-f6c2-4af2-9ebe-be0dcad59f60","year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:52.872598Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:440c3eb5e3240a7dfa7f3f9567900c90ef667f811144248d26f6ad9557b74e9a","observation_id":"8d1b51de-11a9-42b1-afbd-6b8f53c9c2bb","resolution":{"observed_at":"2026-08-06T20:35:56.522188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:56.236238Z","title":"Readout guidance: Learning control from diffusion features","venue":null,"work_id":"37a418db-0cd4-402e-95e7-d65e280f18d7","year":2024},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:52.975086Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:dc1c3fa99d04bd7d8ccdd1b6b70e570af00c78b5114f5fef18b014f2291cb248","observation_id":"660801c3-b60b-4d54-871a-aeed6e9857b7","resolution":{"observed_at":"2026-08-06T20:35:56.319310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:56.062481Z","title":"Diffusion hyperfeatures: Searching through time and space for semantic correspondence","venue":null,"work_id":"e0b21647-5740-4e4e-8e73-0e128c34fa2c","year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:53.098606Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:05cf4ece794b090097c9a347ca05d668ccec5b34938884bb4d2cfa3f26d763b4","observation_id":"bb614008-3af6-426d-87ec-9152aa2875e9","resolution":{"observed_at":"2026-08-06T20:35:56.135626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:55.891639Z","title":"Distillation of diffusion features for semantic correspondence","venue":null,"work_id":"d0c3002a-9eef-4718-986f-94b004452875","year":2025},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:53.228751Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:8694b49c225be41ed379f809ffefa33bed57d88cfe0c18da933eac1e820edc0f","observation_id":"c2240105-1dcb-4fbb-be11-0800b15491af","resolution":{"observed_at":"2026-08-06T20:35:55.952768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09400","last_updated":"2025-03-03T12:33:49Z","snapshot_observed_at":"2026-07-06T19:32:15.226489Z","submitted_at":"2024-10-12T07:04:32Z","title":"CtrLoRA: An Extensible and Efficient Framework for Controllable Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09400","snapshot_observed_at":"2026-08-06T20:35:53.348887Z","title":"CtrLoRA: An Extensible and Efficient Framework for Controllable Image Generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:53.348887Z"},"links":{"cited_paper":"/paper/2410.09400","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:4e031b9ff3fbc8e83832069fbf696c96e38268689970d91a84d22eaa3aed38a2","observation_id":"ab039658-8d40-4ea9-be9b-00236b98d801","resolution":{"observed_at":"2026-08-06T20:35:53.348887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:55.736362Z","title":"X-adapter: Adding universal compatibility of plugins for upgraded diffusion model","venue":null,"work_id":"368ef165-f2b9-41fc-8550-7e30b4ce5523","year":2024},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:53.442872Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:d76468c3d770633d39e36e435ca385e213802d7522a0632e07934ffeb0cc6636","observation_id":"b4bb6863-4f77-4ba0-aa00-7063037e838a","resolution":{"observed_at":"2026-08-06T20:35:55.803955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09967","last_updated":"2024-05-24T16:29:38Z","snapshot_observed_at":"2026-08-03T19:03:47.269374Z","submitted_at":"2024-04-15T17:45:36Z","title":"Ctrl-Adapter: An Efficient and Versatile Framework for Adapting Diverse Controls to Any Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09967","snapshot_observed_at":"2026-08-06T20:35:53.542608Z","title":"Ctrl-adapter: An efficient and versatile framework for adapting diverse controls to any diffusion model.arXiv preprint arXiv:2404.09967, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:53.542608Z"},"links":{"cited_paper":"/paper/2404.09967","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:07cb713f2afbf43fb4c135861a628752ad290e8f28014a1bbc4b3594f4f79904","observation_id":"22be1095-d574-4829-91ac-756597ef4fbe","resolution":{"observed_at":"2026-08-06T20:35:53.542608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:55.573700Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":"5628ba98-5bf2-48a7-9314-3f1f02a6d3e6","year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:53.639869Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:4eda2a32cdf7e058a99f9f48e091d27d4a562ccb44f01fd97a500f7bdf8c0b26","observation_id":"7fec33fc-7041-455c-8ef4-505b94ee08a0","resolution":{"observed_at":"2026-08-06T20:35:55.660542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T20:35:53.779487Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:53.779487Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:90dba856163b98e429e60e75c1d1b54d13865ff4fbdec63cc7a0d7bdb8be06bc","observation_id":"e7a4a8f5-3196-4144-a030-2a1b9c8f69b7","resolution":{"observed_at":"2026-08-06T20:35:53.779487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:55.404438Z","title":"Vision transformers for dense prediction","venue":null,"work_id":"1580d7a5-daad-4b38-8e01-1c240c63bc37","year":2021},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:53.872465Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:c041ccecc954c04a5a9567be5662991db52048e60784baa427cb270a9426a462","observation_id":"e5abe342-03dc-469b-93c5-04ee955b03dd","resolution":{"observed_at":"2026-08-06T20:35:55.467397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:54.012648Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:54.012648Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:b708955047fb01f7b841ecaba195872130617fcdc5670191d9167d9b6f346cb2","observation_id":"7634f2c2-fc5c-46a9-bbd7-2e61477a013f","resolution":{"observed_at":"2026-08-06T20:35:54.012648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:55.172226Z","title":"Diffusers: State-of-the-art diffusion models","venue":null,"work_id":"89173363-0db5-443a-b370-ce2e1081bdf8","year":2022},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:54.092802Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:8134b2c2ef5360310b31f6e27c5fb003ba0f6f412556043c5143a0713680daad","observation_id":"0b0ae502-40eb-4ee8-8cc0-368f9b7345b0","resolution":{"observed_at":"2026-08-06T20:35:55.293274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:55.002746Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"bd7711fc-3e66-4330-a876-2412601bb8e7","year":2016},"citing_paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:54.220222Z"},"links":{"citing_paper":"/paper/2507.02321"},"observation_digest":"sha256:93b8d6363aa785beb0f485c2047758faff7cabbd39b9883e9be53026e5b9abca","observation_id":"38e96513-a6ba-4463-b95f-78eaba3dd035","resolution":{"observed_at":"2026-08-06T20:35:55.060581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02321","last_updated":"2025-07-03T05:25:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T20:29:55.056541Z","submitted_at":"2025-07-03T05:25:53Z","title":"Heeding the Inner Voice: Aligning ControlNet Training via Intermediate Features Feedback"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":2,"verified_fuzzy":21},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2507.02321."}