{"as_of":"2026-08-14T14:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2e32a5f44fce07cf3b74b716b5ad46fef9016f884b37a1b4f503ee47224cac59","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:02:21.669313Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.11947/citation-record","integrity":"/paper/2507.11947/integrity","json":"/paper/2507.11947/citation-record.json","paper":"/paper/2507.11947"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:23.044674Z","title":"Zero-shot text-to-image generation,","venue":null,"work_id":"81a093fd-9159-4008-9dd5-dfc1d2aae3a6","year":2021},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:19.396648Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:dc0ffe6456d01554cb801d021e50a0ccce6c516f3550f8adf1f00af5ac06c9b6","observation_id":"e8cd0e2f-e5e8-4ae6-ac06-326c2552b491","resolution":{"observed_at":"2026-08-06T17:02:23.052135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:19.441110Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:19.441110Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:72af3a5f75f4ada16efac1ee6805eb87135e78e157493341935a25cf3f8f36b6","observation_id":"ebd759aa-d38f-45f8-8acc-8cd757e2f6c0","resolution":{"observed_at":"2026-08-06T17:02:19.441110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:23.002085Z","title":"Photorealistic text-to-image diffusion models with deep language understanding,","venue":null,"work_id":"e26f6329-540a-41cb-ac4b-e098cb85c384","year":2022},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:19.497585Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:8800d039671e488a97971dd714a3be6308ddb0bfb998b778ea6ffc45a9678771","observation_id":"617fa589-727b-422e-8fc5-0fcb665f58f4","resolution":{"observed_at":"2026-08-06T17:02:23.010067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:22.979944Z","title":"ReCo: Region-controlled text-to-image generation,","venue":null,"work_id":"95c1eba6-c16e-491d-98bf-28381d1377b5","year":2023},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:19.632727Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:3f9d308f007a43c978404dbd8ac4954bb93931b575032e0857d05d9c0a6908da","observation_id":"ac03b7d8-8046-4bea-b64c-7c6054af2bf2","resolution":{"observed_at":"2026-08-06T17:02:22.987829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:22.957637Z","title":"Text extraction in MPEG compressed video for content-based indexing,","venue":null,"work_id":"0094ef04-2226-4f56-9431-56c774ad5820","year":2000},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:19.732361Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:eb24865593eb964e1d2727a67c20b1cc8ef050a7fe387b7f0df08c4d60b347c7","observation_id":"92fc14ed-e04f-452c-a751-a7c7095409a6","resolution":{"observed_at":"2026-08-06T17:02:22.963871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09781","last_updated":"2023-07-19T06:56:07Z","snapshot_observed_at":"2026-08-13T10:52:51.284774Z","submitted_at":"2023-07-19T06:56:07Z","title":"Text2Layer: Layered Image Generation using Latent Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09781","snapshot_observed_at":"2026-08-06T17:02:19.795567Z","title":"Text2Layer: Lay- ered image generation using latent diffusion model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:19.795567Z"},"links":{"cited_paper":"/paper/2307.09781","citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:05d93d69e21f1f85b75adb61df73bf792b2c6c09fb82d051317bb05997128753","observation_id":"bad75319-72c8-4c59-8414-ae8c01fc2d0e","resolution":{"observed_at":"2026-08-06T17:02:19.795567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:22.940702Z","title":"Unleashing text- to-image diffusion models for visual perception,","venue":null,"work_id":"e700d74e-8560-4a17-94d9-0a40c50fee00","year":2023},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:19.849026Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:7760675eb676df42d77ee480a93daf3f96e22aca36b78bd6c3f79b43867547eb","observation_id":"0b421d1d-dc02-443d-82e1-4c4ed20625b3","resolution":{"observed_at":"2026-08-06T17:02:22.945975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:22.918558Z","title":"Deep reinforcement learning in continuous action spaces: a case study in the game of simulated curling,","venue":null,"work_id":"caad6206-23a6-4294-8788-f42157d21027","year":2018},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:19.952105Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:42a21a655165f7ec61552f5a14e2cffce8eeb82c7c9d5bdf855d61356820d603","observation_id":"3a097fe7-6c6d-41a4-a697-9d6ecfc3e258","resolution":{"observed_at":"2026-08-06T17:02:22.925110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:22.899898Z","title":"MirrorGAN: Learning text-to- image generation by redescription,","venue":null,"work_id":"bea55465-42fe-46d0-ac60-671ea39ab15f","year":2019},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:19.999504Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:869c5bda927eb49722cbfff7f49fba086f0476602a53bfd9d19b3da1b0a12e66","observation_id":"cecc1f82-223c-4f6e-af22-91c00ba3226c","resolution":{"observed_at":"2026-08-06T17:02:22.907003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:22.882256Z","title":"Composi- tional visual generation with composable diffusion models,","venue":null,"work_id":"01b3b69a-da30-4fa5-97c9-1084c0c74ef0","year":2022},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:20.109802Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:ba1cbfefc6490a9b997de1756290246ed8c790d7217bef9cd5c7341c0140b5be","observation_id":"8bec4f5d-4423-4e67-9e29-5a20760e2ea9","resolution":{"observed_at":"2026-08-06T17:02:22.887263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:22.862818Z","title":"MIGC: Multi-instance generation controller for text-to-image synthesis,","venue":null,"work_id":"2c0dbccf-2dfa-406f-b282-f480993c3acc","year":2024},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:20.255931Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:54a3f094dd81bc9eda496ede891da60f2898f68ae677a04da37668666102702e","observation_id":"63e4106b-aad1-4867-9720-9758ab73a227","resolution":{"observed_at":"2026-08-06T17:02:22.868701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:22.845399Z","title":"Interactdiffu- sion: Interaction control in text-to-image diffusion models,","venue":null,"work_id":"d0397bb9-4167-4cca-b048-b3ffc9175a68","year":2024},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:20.336413Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:db3a27cacc20e1597ba54a5f11cb526d0b53dfa17d37e15c189b78b532c985a6","observation_id":"9562377e-46ce-4b1d-bbd2-e6c01be30321","resolution":{"observed_at":"2026-08-06T17:02:22.850641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:22.828941Z","title":"NeuroGrasp: Real-time EEG classification of high-level motor imagery tasks using a dual-stage deep learning framework,","venue":null,"work_id":"f652db08-00d2-4f49-9533-4f4ebcd04a41","year":2021},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:20.428206Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:f649e3358abb2ec4582bb976711105d261677ffb4b2902b2c02912c5e3015785","observation_id":"aa021ec7-6ecf-4d6a-b4e5-7125cc39fd18","resolution":{"observed_at":"2026-08-06T17:02:22.834209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:22.811482Z","title":"Auto-encoding variational bayes,","venue":null,"work_id":"f891b8f1-e8fd-42aa-adc3-36c1acce35ad","year":2014},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:20.499258Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:7edcbfc3e4314d4db172157da37e2bbf51846e20af9939e12d1b6999e4c76ff5","observation_id":"9b9a5df2-f4c5-4fef-9ccd-87fcdc302234","resolution":{"observed_at":"2026-08-06T17:02:22.817302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:22.792022Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"48e39842-a466-4e78-8348-a170db20278f","year":2021},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:20.591542Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:8353f6a96d1ebe005deb7e8cbcdbbabec247589af036709e6ced041e644c7bf3","observation_id":"01738336-0341-4292-b0b6-adbf6166af8e","resolution":{"observed_at":"2026-08-06T17:02:22.798988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:22.772564Z","title":"Reconstruction of 3D human body pose from stereo image sequences based on top-down learning,","venue":null,"work_id":"afd840ab-1c80-4a0b-94da-7b1a229a1c05","year":2007},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:20.702413Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:8047534d127662621330c84ddaa8947bd5c70689e177b880c1c0c7daac592131","observation_id":"c15e64b9-e7f1-42d8-8a82-e4b0ac20523a","resolution":{"observed_at":"2026-08-06T17:02:22.778444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:20.864674Z","title":"Integrated segmentation and recognition of handwritten numerals with cascade neural network,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:20.864674Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:60340ed57a3eaff164298098707e509894bc38c4bfaa01df1a16ef418215f777","observation_id":"700b008c-dc64-4a39-86e3-29d7a6683e60","resolution":{"observed_at":"2026-08-06T17:02:20.864674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:22.734782Z","title":"GLIGEN: Open-set grounded text-to-image generation,","venue":null,"work_id":"388fe03e-796f-4da0-8cae-8506920ab143","year":2023},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:20.925350Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:fd9c9693244a2aa9f2d284eb90affe6e80fba92b24bb834f0ce518549b8d3f72","observation_id":"3f01f950-c148-456b-aad2-535fe1657f82","resolution":{"observed_at":"2026-08-06T17:02:22.740922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:22.714908Z","title":"BoxDiff: Text-to-image synthesis with training-free box- constrained diffusion,","venue":null,"work_id":"7efcd8e3-189d-4d5d-85c8-946805be5d3e","year":2023},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:20.965769Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:312d75125ad60757ed0697533dc902b74da74e236dd6a455edd87f4a775659f8","observation_id":"8316e3cf-ebd4-4e05-8ae6-d1ea1b42b834","resolution":{"observed_at":"2026-08-06T17:02:22.721086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:22.693545Z","title":"LayoutDiffusion: Controllable diffusion model for layout-to-image generation,","venue":null,"work_id":"2ad5ce1b-364c-4f25-ac3f-1bd0cfa5487b","year":2023},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:21.044472Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:c14209bf7a757b0fb5dcb2dd49c214b8053ae82db1d670063d3d8a1b0d2c47b3","observation_id":"d310203f-2466-4cb4-bc12-0049f7201940","resolution":{"observed_at":"2026-08-06T17:02:22.702721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:22.668311Z","title":"Training-free layout control with cross-attention guidance,","venue":null,"work_id":"76791663-d3b1-4569-8880-4ff5fa408ff5","year":2024},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:21.167083Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:7319a6c60cfa040f3c6e582990d0ca891b266a016ad2a5157e03614290ebe202","observation_id":"78f30647-734d-4325-ad19-b5b6240d7fd2","resolution":{"observed_at":"2026-08-06T17:02:22.675096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:22.647912Z","title":"MultiDiffusion: Fusing diffusion paths for controlled image generation,","venue":null,"work_id":"8ca80056-4381-43b4-b417-57af26b80b50","year":2023},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:21.277249Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:d9dcb741653c046914b2bb0a87bec0ea08eb4310be2d428dfd4749b883ea4226","observation_id":"f22d51a3-192c-4aa3-ba1b-91bf1ff53573","resolution":{"observed_at":"2026-08-06T17:02:22.655099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:22.566771Z","title":"Microsoft COCO: Common objects in context,","venue":null,"work_id":"e7f8bb1e-49fa-4748-8cad-3af6bd555d89","year":2014},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:21.424173Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:ab3ad13d559a2ce7c9cd7b8e1c64eca281028cd32c948c96a2510fafb9ff65e0","observation_id":"e4b8459f-f1da-46f0-9857-4d2eb37ef3fc","resolution":{"observed_at":"2026-08-06T17:02:22.632231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:22.391841Z","title":"U-Net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":"b402a125-1ca9-4396-8524-36daf42da997","year":2015},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:21.460481Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:2ea76bcb5aa5f60f54246a40b9dbb79122698b6d72d012752fcd999bdabef999","observation_id":"7f20f49b-bd3f-4bc7-b324-8471653b9878","resolution":{"observed_at":"2026-08-06T17:02:22.497992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:22.243103Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":"1b121caa-03bd-4fc4-90b7-2cddb05e7d0f","year":2019},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:21.540021Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:9bda30f7a68141af8b258722ac9e8c10c03c94322ffbe85e92eba93ac333c5ae","observation_id":"99d8ec02-70eb-4dd7-8c20-4ba4be00dc16","resolution":{"observed_at":"2026-08-06T17:02:22.324862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:22.059762Z","title":"Grounding DINO: Marrying dino with grounded pre- training for open-set object detection,","venue":null,"work_id":"b4089ac0-5d4b-4671-82e7-ade3ff21cdaa","year":2024},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:21.634792Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:bff2f243d5f105051ebee05448ed877ede67a2a21f39b8ed3bc597f4c6e05c32","observation_id":"602ceb84-6b0a-453d-b5b4-f2b34b8c83df","resolution":{"observed_at":"2026-08-06T17:02:22.143074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:21.825340Z","title":"GANs trained by a two time-scale update rule converge to a local nash equilibrium,","venue":null,"work_id":"a7d0a3b7-9031-4890-b687-dcd37132aee4","year":2017},"citing_paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:21.669313Z"},"links":{"citing_paper":"/paper/2507.11947"},"observation_digest":"sha256:c3cdc4fdd6f81c8d569fd87a0e01a75d9923744ce0035f6dcb3d0c61646b9f5d","observation_id":"45c62be8-36d8-469b-b5f0-f7da3f785761","resolution":{"observed_at":"2026-08-06T17:02:21.937211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.11947","last_updated":"2025-07-16T06:28:20Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T01:56:19.643473Z","submitted_at":"2025-07-16T06:28:20Z","title":"RaDL: Relation-aware Disentangled Learning for Multi-Instance Text-to-Image Generation"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2507.11947."}