{"as_of":"2026-08-13T04:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:486c73cf6206a40c97757934974602d6d46970b71ea05af6cd925012a0660975","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:38:08.796809Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:55:03.579238Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T08:16:48.480071Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01097","snapshot_observed_at":"2026-08-06T19:55:03.579238Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04451","last_updated":"2025-07-06T16:17:32Z","snapshot_observed_at":"2026-08-09T23:14:43.081218Z","submitted_at":"2025-07-06T16:17:32Z","title":"CoT-lized Diffusion: Let's Reinforce T2I Generation Step-by-step","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.579238Z"},"links":{"cited_paper":"/paper/2501.01097","citing_paper":"/paper/2507.04451"},"observation_digest":"sha256:a0adf049fabd026d739b22f6754553664ef90e9971903bee267db0a9582ed3f6","observation_id":"eeeaac15-8634-4f58-92de-f7201b31668e","resolution":{"observed_at":"2026-08-06T19:55:03.579238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"cited_work":{"arxiv_id":"2501.01097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01097","snapshot_observed_at":"2026-07-02T08:16:48.480071Z","title":"arXiv preprint arXiv:2501.01097 (2025)","venue":null,"work_id":"c11b4806-7419-414b-83dd-aab7fc8cd41a","year":2025},"citing_paper":{"arxiv_id":"2604.06870","last_updated":"2026-04-08T09:32:15Z","snapshot_observed_at":"2026-07-06T22:55:15.791334Z","submitted_at":"2026-04-08T09:32:15Z","title":"RefineAnything: Multimodal Region-Specific Refinement for Perfect Local Details","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T19:11:43.172296Z"},"links":{"cited_paper":"/paper/2501.01097","citing_paper":"/paper/2604.06870"},"observation_digest":"sha256:f28608ea0be24e2431c7af536fd2abf8211eb7a13a849036ca3fa46bcd129f8c","observation_id":"f502d698-26c5-4ded-89df-d98dea8f06c1","resolution":{"observed_at":"2026-05-10T23:20:53.873507Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"cited_work":{"arxiv_id":"2501.01097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01097","snapshot_observed_at":"2026-07-02T08:16:48.480071Z","title":"arXiv preprint arXiv:2501.01097 (2025)","venue":null,"work_id":"c11b4806-7419-414b-83dd-aab7fc8cd41a","year":2025},"citing_paper":{"arxiv_id":"2604.14062","last_updated":"2026-04-15T16:37:36Z","snapshot_observed_at":"2026-08-11T06:28:13.134172Z","submitted_at":"2026-04-15T16:37:36Z","title":"OneHOI: Unifying Human-Object Interaction Generation and Editing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T14:22:30.898080Z"},"links":{"cited_paper":"/paper/2501.01097","citing_paper":"/paper/2604.14062"},"observation_digest":"sha256:21c287917e90a35a3bd867992319a3bceb31e837406f6cb4c28e88dfeb8acca1","observation_id":"218b3b44-83e7-4777-8f44-ed3adfd63cd9","resolution":{"observed_at":"2026-05-10T14:25:29.959224Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"cited_work":{"arxiv_id":"2501.01097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01097","snapshot_observed_at":"2026-07-02T08:16:48.480071Z","title":"arXiv preprint arXiv:2501.01097 (2025)","venue":null,"work_id":"c11b4806-7419-414b-83dd-aab7fc8cd41a","year":2025},"citing_paper":{"arxiv_id":"2605.04609","last_updated":"2026-05-06T07:56:16Z","snapshot_observed_at":"2026-08-03T01:43:19.583154Z","submitted_at":"2026-05-06T07:56:16Z","title":"Advancing Aesthetic Image Generation via Composition Transfer","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T18:23:12.827094Z"},"links":{"cited_paper":"/paper/2501.01097","citing_paper":"/paper/2605.04609"},"observation_digest":"sha256:a28b4471c84a79d4de6290f01c928a8091942a59412549e628a8c05562937b42","observation_id":"3c11992e-fa72-4d41-b16f-b7860bf1d6a0","resolution":{"observed_at":"2026-05-09T06:30:44.322037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"cited_work":{"arxiv_id":"2501.01097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01097","snapshot_observed_at":"2026-07-02T08:16:48.480071Z","title":"arXiv preprint arXiv:2501.01097 (2025)","venue":null,"work_id":"c11b4806-7419-414b-83dd-aab7fc8cd41a","year":2025},"citing_paper":{"arxiv_id":"2606.05031","last_updated":"2026-06-03T15:58:56Z","snapshot_observed_at":"2026-07-06T23:45:02.342193Z","submitted_at":"2026-06-03T15:58:56Z","title":"MetaPoint: Unlocking Precise Spatial Control in Agentic Visual Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T06:07:06.056441Z"},"links":{"cited_paper":"/paper/2501.01097","citing_paper":"/paper/2606.05031"},"observation_digest":"sha256:7926f141d2e6b94740849be130fb2106cfa0627b4ced926887a5783f553cba0f","observation_id":"865bc7ed-5995-407f-9c96-85809f8bd855","resolution":{"observed_at":"2026-07-02T08:16:48.481537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01097","snapshot_observed_at":"2026-08-01T12:45:20.944604Z","title":"arXiv preprint arXiv:2501.01097 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19344","last_updated":"2026-07-21T17:59:12Z","snapshot_observed_at":"2026-08-07T03:53:37.076179Z","submitted_at":"2026-07-21T17:59:12Z","title":"Appearance Pointers -- Multimodal Region Control of Diffusion Transformers","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T12:45:20.944604Z"},"links":{"cited_paper":"/paper/2501.01097","citing_paper":"/paper/2607.19344"},"observation_digest":"sha256:337a6fd6354e57ca0eb546ffd1153dfa2ba478fbaf50fc3d888db51ed8f5b225","observation_id":"c690b184-8562-4fcc-85c0-20756f9e1408","resolution":{"observed_at":"2026-08-01T12:45:20.944604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.01097/citation-record","integrity":"/paper/2501.01097/integrity","json":"/paper/2501.01097/citation-record.json","paper":"/paper/2501.01097"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.317104Z","title":"Multidiffusion: Fusing diffusion paths for controlled image generation","venue":null,"work_id":"94d391d7-910e-42a9-8799-b027645dce31","year":2023},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.613917Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:38bbe4700c370322aa35cd43d827f90f66669efc06dec017312a46509ce0a2fd","observation_id":"d5a79a7e-5ea1-4a8c-ac45-a223d3e64e30","resolution":{"observed_at":"2026-08-10T22:38:09.321463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-08-13T01:47:21.043519Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-10T22:38:08.627180Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.627180Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:6b64ee9f5dc6ddd2bc2f9ffcdabe1e49b367d503296fcaae97e8eaa298770697","observation_id":"be90677b-0bc9-426e-9c16-1ec9735c9290","resolution":{"observed_at":"2026-08-10T22:38:08.627180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-12T19:28:23.372660Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-10T22:38:08.631506Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.631506Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:1e7b4e9b7bb21cc1387dc6f89dabf8dc244e246b3e45e18f7946e2b6e395e4dc","observation_id":"8dac1ee8-704d-4aaa-a420-c2dc4ed2b52e","resolution":{"observed_at":"2026-08-10T22:38:08.631506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T22:38:08.645351Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.645351Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:ba820a0c9e808734e2d5bce484c72add36d76d6882753c8feceb3a110505aac5","observation_id":"49598589-de54-430b-888b-cdd0bc87211e","resolution":{"observed_at":"2026-08-10T22:38:08.645351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23775","last_updated":"2024-11-05T06:41:27Z","snapshot_observed_at":"2026-08-13T02:36:51.965083Z","submitted_at":"2024-10-31T09:45:00Z","title":"In-Context LoRA for Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23775","snapshot_observed_at":"2026-08-10T22:38:08.656231Z","title":"In-context lora for dif- fusion transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.656231Z"},"links":{"cited_paper":"/paper/2410.23775","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:46fbe0e25ed6f6c173336e76181bcc0e8ece94a3015d218051780d80904bd0b4","observation_id":"729c17b6-93ff-4943-be79-f53f9ff62540","resolution":{"observed_at":"2026-08-10T22:38:08.656231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.268238Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":"56ac18be-a994-45e5-bf2d-28ce45d8fc97","year":2022},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.660654Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:b85ce509af29ada07cf1893c474f0c0f2cca71ac72c3cb31ee1c831f24189c0c","observation_id":"65951187-75b4-4ace-8da7-c5a2714f9f52","resolution":{"observed_at":"2026-08-10T22:38:09.272557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17725","last_updated":"2024-10-23T09:55:22Z","snapshot_observed_at":"2026-08-13T01:57:27.555320Z","submitted_at":"2024-10-23T09:55:22Z","title":"YOLOv11: An Overview of the Key Architectural Enhancements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17725","snapshot_observed_at":"2026-08-10T22:38:08.665191Z","title":"Yolov11: An overview of the key archi- tectural enhancements","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.665191Z"},"links":{"cited_paper":"/paper/2410.17725","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:2df43554c476d7bcdcc67674cda64065c6e13235a691e2d82c4a5463668e9af2","observation_id":"0e614677-d924-470a-9822-545d08696c9b","resolution":{"observed_at":"2026-08-10T22:38:08.665191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.255532Z","title":"Pick-a-pic: An open dataset of user preferences for text- to-image generation","venue":null,"work_id":"f547f183-6ec4-4f5c-865e-1700cec48a3f","year":2023},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.669582Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:e5bb94ee5551c3bb81e8aefc9138370d08a6317c8a72762c1b20afbcd0a6013a","observation_id":"c879f410-e260-44f2-8dcb-4c7487cc978d","resolution":{"observed_at":"2026-08-10T22:38:09.259552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.243341Z","title":null,"venue":null,"work_id":"bd4bf653-6d84-48f9-9f9d-db4ccbb5e2c1","year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.673448Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:547720f4e4a811be4d05bbaa170a78095f28e6f32d3256b691607081f5bca4b1","observation_id":"f1737201-10ee-4970-bc12-0f184de028a5","resolution":{"observed_at":"2026-08-10T22:38:09.247548Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.229236Z","title":"Laion-aesthetics v2","venue":null,"work_id":"72f472f1-6f52-4b95-8650-2eb0cd2809e3","year":2022},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.677408Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:c25e9d118973cd9dacb45a316874fa869bdd8630e6c7e87186b164891bb0725c","observation_id":"fb3bb521-b8e9-4c3a-8601-d9c864d513a3","resolution":{"observed_at":"2026-08-10T22:38:09.233246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.217472Z","title":"Gligen: Open-set grounded text-to- image generation","venue":null,"work_id":"4f3472d9-103d-4cc1-80ab-eb3f2e498f77","year":2023},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.682085Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:b883d32dc492653df79e85df29937bde2efab0c790130c05e9396a38bd2d63c4","observation_id":"105fde20-2a88-4bb2-a312-176fb4a10dff","resolution":{"observed_at":"2026-08-10T22:38:09.221416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.205491Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion trans- former with fine-grained chinese understanding","venue":null,"work_id":"507fdb44-d0ed-4ebf-b8d5-aaf265c07a09","year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.686060Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:b13912b54fde9d84bb24512a6a44040ed4c5f8e97c90ce5e04885d546a7fd555","observation_id":"a63399d1-d5c4-4fcd-991d-5dcf80ff1b08","resolution":{"observed_at":"2026-08-10T22:38:09.209715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.193021Z","title":"Microsoft coco: Com- mon objects in context","venue":null,"work_id":"e6d294f4-a80e-47f0-b369-645c0730e62a","year":2014},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.690447Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:905ade6eb48174bf674098067ec36af75d30a44d7b2ccb6508b3b0c05cba097b","observation_id":"8736c1f2-aba9-41cd-858c-87b436c065f7","resolution":{"observed_at":"2026-08-10T22:38:09.198083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.180746Z","title":"Directed diffusion: Direct control of object placement through at- tention guidance","venue":null,"work_id":"73d584b2-baff-4b58-9bee-ee43f79a719c","year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.700385Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:0a5ecff922b0ae551537aecb296570483217cdfce8573d795fc188e3f49ad862","observation_id":"2cdf22cd-498a-435b-96f8-6ca9bf8bd54f","resolution":{"observed_at":"2026-08-10T22:38:09.184914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:08.704559Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis.Communications of the ACM, 65(1):99–106,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.704559Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:17a8e6caa0488984a2694474b1cff841d5b14469606b3a11c5cde082a9fb2a0b","observation_id":"f924e519-bc9f-4d4c-9e14-d9d9a7f7873b","resolution":{"observed_at":"2026-08-10T22:38:08.704559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08453","last_updated":"2023-03-20T10:52:26Z","snapshot_observed_at":"2026-07-31T21:11:02.534986Z","submitted_at":"2023-02-16T17:56:08Z","title":"T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08453","snapshot_observed_at":"2026-08-10T22:38:08.708981Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.708981Z"},"links":{"cited_paper":"/paper/2302.08453","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:426a0f13170c223cbf9edd0728d46ab91d82ada7004e124df7529ae2f242ea17","observation_id":"191b8f6b-b8c1-4852-9fa7-8f84caee2718","resolution":{"observed_at":"2026-08-10T22:38:08.708981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-10T22:38:08.713640Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.713640Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:2b3c7cf346903f2e6ccd855ca56509fe22e2410d8e213c94c0c2869d87e27ffe","observation_id":"a5811c39-76b8-4b72-b51e-50d77ce71e7f","resolution":{"observed_at":"2026-08-10T22:38:08.713640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.160088Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"dbffe4bc-783f-44e0-a2c4-ff0adcf42a37","year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.718182Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:41c6da3835b9ddb54218d5a112fe8b9e6c9ac8aa9845b315b32e1e947ec97f5f","observation_id":"12264308-9c77-4e15-9577-16f077273477","resolution":{"observed_at":"2026-08-10T22:38:09.164480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.147036Z","title":"Exploring the lim- its of transfer learning with a unified text-to-text trans- former","venue":null,"work_id":"ff5b7875-c5f7-4c51-adb6-19aa58950ed8","year":2020},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.722259Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:4aac12732dc236eff810b961ba3c851723daba66cfe72ab1c10115fbac2a939f","observation_id":"82129aea-3888-4c87-94ca-c72b9cd55a72","resolution":{"observed_at":"2026-08-10T22:38:09.151089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.134545Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":"04bd3698-d628-4e6d-8c72-985419b77740","year":2020},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.726239Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:7250f730ec0ff99daa3ea20452860d88f2788d1e71ff723a0372ae07ec19444c","observation_id":"d7d77227-8139-41cb-ab3c-24e182a48b0f","resolution":{"observed_at":"2026-08-10T22:38:09.138946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:08.730917Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.730917Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:d5593fc6c99063c782965ac58355af25a607624d6a3fe0dd5b0791f21bdaa91d","observation_id":"c822e9fa-d4aa-4500-8c68-395bd2719bfc","resolution":{"observed_at":"2026-08-10T22:38:08.730917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.112694Z","title":"Instantx flux.1-dev ip-adapter page,","venue":null,"work_id":"cbac814d-f47a-411e-a39a-cc32a0b84c74","year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.741146Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:51127b8bb7c8270544c61b1691d684f1c683339ce594feba6546e20b8b59492d","observation_id":"661b8e76-0951-4378-b02d-a6ac425cfaab","resolution":{"observed_at":"2026-08-10T22:38:09.116982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14896","last_updated":"2023-07-06T11:53:19Z","snapshot_observed_at":"2026-08-12T08:44:02.835406Z","submitted_at":"2022-10-26T17:54:20Z","title":"DiffusionDB: A Large-scale Prompt Gallery Dataset for Text-to-Image Generative Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14896","snapshot_observed_at":"2026-08-10T22:38:08.745345Z","title":"Wang, Evan Montoya, David Munechika, Haoyang Yang, Benjamin Hoover, and Duen Horng Chau","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.745345Z"},"links":{"cited_paper":"/paper/2210.14896","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:899783bb235c5c0f4b00d12ac0bb189602d50ae79dee582b42532d99e2b05254","observation_id":"1ef87f4f-a882-4156-a97f-2557562bb6dd","resolution":{"observed_at":"2026-08-10T22:38:08.745345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-10T22:38:08.750078Z","title":"Qwen2-vl: Enhanc- ing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.750078Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:0f3718db490da488ee284eb35c43690232884d92501d91f235589aa2b22ed4e5","observation_id":"caaf9b86-3d58-4073-9405-b09439043244","resolution":{"observed_at":"2026-08-10T22:38:08.750078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08240","last_updated":"2024-11-06T13:03:20Z","snapshot_observed_at":"2026-08-12T22:46:04.683800Z","submitted_at":"2024-09-12T17:39:23Z","title":"IFAdapter: Instance Feature Control for Grounded Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08240","snapshot_observed_at":"2026-08-10T22:38:08.754787Z","title":"Ifadapter: In- stance feature control for grounded text-to-image gener- ation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.754787Z"},"links":{"cited_paper":"/paper/2409.08240","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:f6f031ae9364e6e88f790e8ff7204e2d29ced5d6ac96049965bc1509b0730303","observation_id":"02d7bb37-3de3-4b67-aa1b-23eb152965dd","resolution":{"observed_at":"2026-08-10T22:38:08.754787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-10T22:38:08.760053Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.760053Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:fdb641e075e4525d1edaad1251b17a435f3a91cadbaddbc13ed97843207abba8","observation_id":"71b8fb80-ab8b-487d-a00e-429c92774ec5","resolution":{"observed_at":"2026-08-10T22:38:08.760053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-10T22:38:08.764674Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.764674Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:10b295d205deb9177c6a33a6cfce2c03f6cc9f14672b29e2e0020f48ae1a3c55","observation_id":"1176fe0d-f308-4d3f-983e-c009b12f7f2c","resolution":{"observed_at":"2026-08-10T22:38:08.764674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.099625Z","title":"Adding conditional control to text-to-image dif- fusion models","venue":null,"work_id":"3be7a009-266a-4530-a829-c1518a75a7c9","year":2023},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.768947Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:aeaa695aad232a76a6d2025056ccadc210c7d410e0431970622d83964faf4f59","observation_id":"7fe84694-7bab-4de1-81e9-522f6922f763","resolution":{"observed_at":"2026-08-10T22:38:09.104059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.084820Z","title":"Learning multi-dimensional human preference for text-to-image generation","venue":null,"work_id":"0d85c88d-dbd0-4e17-a0b5-22696729d8ac","year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.773689Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:8602e087052eb5dcaba85a38003dee41c5e17d4c76c459628de208938fa7958d","observation_id":"2db8a89c-00d0-4e9a-8f69-afef18264b8d","resolution":{"observed_at":"2026-08-10T22:38:09.089454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.071100Z","title":"Layoutd- iffusion: Controllable diffusion model for layout-to-image generation","venue":null,"work_id":"2c8879ca-ce66-448a-81c1-dbda15daed60","year":2023},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.779058Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:55b532978161d2c19b76953e97ad55f00082c3fef6fdedbd94b3d81271e3d693","observation_id":"9bc6529c-ba28-421e-8699-e69d8393ec83","resolution":{"observed_at":"2026-08-10T22:38:09.075335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.056241Z","title":"Migc: Multi-instance generation con- troller for text-to-image synthesis","venue":null,"work_id":"1c022c66-94a8-4676-9f9d-80509f30cbbd","year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.784726Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:fc96052b5637b749f3806052f282957b2045fbdedd29fb7458142bec13bfecd3","observation_id":"f765febd-78d5-4cd1-9265-65579d92063a","resolution":{"observed_at":"2026-08-10T22:38:09.061137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.041316Z","title":"Flux Qwen2-VL 72B Global Prompt:A cute orange and white striped kitten sitting on a fluffy white cloud in a blue sky with other clouds around","venue":null,"work_id":"c0a6b092-7d88-42b1-a0eb-c3276b902987","year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.788959Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:76da859dd0d415d80bde44abbf2efd5720248ff264aa12f8bc583dd45bd5e17f","observation_id":"ac460fc8-f463-42b5-a187-7c806ac2f33f","resolution":{"observed_at":"2026-08-10T22:38:09.046664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.027435Z","title":"At each denoising step, the predicted noise from the DiT is fused with the noise derived from the original image","venue":null,"work_id":"c5f6fce0-6dd1-4da4-8da3-b9f60f4c1601","year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.792923Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:8ec8f37a4cbfef00af7946282d4651f940104d03f323e21c4670e61cc1b9677e","observation_id":"0aac2343-edc9-4edf-b93a-66c8cc132b2b","resolution":{"observed_at":"2026-08-10T22:38:09.032112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.011193Z","title":"Moreover, the image distribution within the dataset should closely align with the output distribution of the model itself","venue":null,"work_id":"33ee6302-d69c-4a2a-a0b2-857e62299f01","year":2022},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.796809Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:c33bc898d8953f373283d55afb6d10efbcabba1288ac3119cf838ba553bcd054","observation_id":"02b3fefc-9415-4f4d-b071-55de234082c7","resolution":{"observed_at":"2026-08-10T22:38:09.017765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-10T22:38:08.695381Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detec- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.695381Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:69c3272bbcc97efd1bc6243fb68ae4cc9633aaa9948dbb1b17408dd4400ae0d7","observation_id":"4fa2f574-e723-4bba-a8e7-63aff32e69da","resolution":{"observed_at":"2026-08-10T22:38:08.695381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-10T22:38:08.736672Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.736672Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:db819ca7eebda65ae70e7527c3ac48fe24dfcbc041b30c83deb5b1ca8ac43742","observation_id":"9658cb3f-2565-40d8-b50b-9126d268966f","resolution":{"observed_at":"2026-08-10T22:38:08.736672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-10T22:38:08.640912Z","title":"Cogvlm2: Vi- sual language models for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.640912Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:18457300ef172f5692c3e1d6232d3a63877bff7e677c1d20c2df37210a12fffc","observation_id":"e17633e3-7103-4a5c-b930-5c03bcfedcc7","resolution":{"observed_at":"2026-08-10T22:38:08.640912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.280851Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"700d765e-9035-4d28-afbd-5cce8322f492","year":2020},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.636278Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:2146e75783fa7802cd9688ec478c3053e30a0e55d8e12034bbe5b285971b3d36","observation_id":"0d5656e6-a5cd-491f-b60a-12d605ded63e","resolution":{"observed_at":"2026-08-10T22:38:09.284955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.305305Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual- linguistic tasks","venue":null,"work_id":"add22100-e2d3-4204-a8b1-d4e3654ba19b","year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.618716Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:9784376daa6fd74768d4ce5139a391abcb12308e7357e046afe0f1da85722f6a","observation_id":"89fda64e-c7a6-4b8f-80b3-407bdc6ef76e","resolution":{"observed_at":"2026-08-10T22:38:09.309623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:38:09.293325Z","title":"Flux-controlnet- inpainting","venue":null,"work_id":"eca8692d-4166-4b70-ae18-c7eec9f9e2a1","year":2024},"citing_paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:08.623097Z"},"links":{"citing_paper":"/paper/2501.01097"},"observation_digest":"sha256:c3c56267a93c812ea26d679eda2c9d361b91a06b59017f6fe64f53122888547a","observation_id":"6ef67408-cb49-43a7-b43b-5686fb2a38bb","resolution":{"observed_at":"2026-08-10T22:38:09.297333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.01097","last_updated":"2025-01-30T04:51:26Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T21:40:40.605595Z","submitted_at":"2025-01-02T06:46:13Z","title":"EliGen: Entity-Level Controlled Image Generation with Regional Attention"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 6 inbound Pith citation observations for arXiv:2501.01097."}