{"as_of":"2026-08-07T20:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8808af55c274169f5d618944f3b5d8e24978a31c8bf7c63ba5cedbc3e5bff9e7","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:15:39.125513Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04436/citation-record","integrity":"/paper/2608.04436/integrity","json":"/paper/2608.04436/citation-record.json","paper":"/paper/2608.04436"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2505.18730","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18730","snapshot_observed_at":"2026-08-07T00:15:41.320900Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","venue":"cs.CV","work_id":"71aeb9d3-821b-4452-a5a3-3a4421b74062","year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:37.003251Z"},"links":{"cited_paper":"/paper/2505.18730","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:ba044786ad044b36450c4edfe5f958b6a5994e91ebf6ffbdc8cd624f33d9eef6","observation_id":"f4cced5a-a747-4f11-ab60-922e101f0195","resolution":{"observed_at":"2026-08-07T00:15:41.386031Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-07T00:15:37.175322Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:37.175322Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:6da246c98e453408a86ad37183debb39ad96b9fabd4cd2216b7ef4185e49b322","observation_id":"589322b1-f649-457a-802b-72c2b985e498","resolution":{"observed_at":"2026-08-07T00:15:37.175322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-07T00:15:37.290999Z","title":"Pixart-α: Fast training of diffusion transformer for photorealistic text-to-image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:37.290999Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:16352d38684b015f8cd20b13e7cceb1ec2ac82374e5ae184a0d94e9f457a6a1f","observation_id":"304b4280-e528-4849-a48b-0aab005f9f19","resolution":{"observed_at":"2026-08-07T00:15:37.290999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:37.407731Z","title":"Unify-agent: A unified multimodal agent for world-grounded image synthesis, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:37.407731Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:877ed2b4bce357c9ab969a3dbceaba7cca6cd873e4ed6119a4344bbad9bf2b64","observation_id":"bd365d23-98d6-4c9b-b397-2e92feba0156","resolution":{"observed_at":"2026-08-07T00:15:37.407731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21605","last_updated":"2026-05-22T02:16:59Z","snapshot_observed_at":"2026-07-06T23:32:01.202542Z","submitted_at":"2026-05-20T18:12:29Z","title":"GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21605","snapshot_observed_at":"2026-08-07T00:15:37.549104Z","title":"Genevolve: Self-evolving image generation agents via tool-orchestrated visual experience distillation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:37.549104Z"},"links":{"cited_paper":"/paper/2605.21605","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:27a9cef06e79386ec39301f23bea2ca48ba5adfcfa3eaf2728f3d4ab0cb8664b","observation_id":"653e64f5-e909-4828-89fa-a148fcc84429","resolution":{"observed_at":"2026-08-07T00:15:37.549104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14491","last_updated":"2022-11-22T02:09:38Z","snapshot_observed_at":"2026-08-03T22:24:49.500281Z","submitted_at":"2022-09-29T00:57:28Z","title":"Re-Imagen: Retrieval-Augmented Text-to-Image Generator","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14491","snapshot_observed_at":"2026-08-07T00:15:37.706082Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:37.706082Z"},"links":{"cited_paper":"/paper/2209.14491","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:7a81b5b0e156fa1710d609c8a1cb84541e6a7b68ca63c8193c5b36932aba9022","observation_id":"0cbe4b8d-b2e4-4b47-8431-493a4cf4bce4","resolution":{"observed_at":"2026-08-07T00:15:37.706082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T00:15:37.847345Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:37.847345Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:6d3572bb2f4e724531f2e62f3901ed6f1f7309d257a0b670d63dc873d0f5d074","observation_id":"045cae11-6dd4-45f1-ab2b-70bb179ab2f9","resolution":{"observed_at":"2026-08-07T00:15:37.847345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-07T15:13:13.622286Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-07T00:15:37.958795Z","title":"Emu3.5: Native multimodal models are world learners, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:37.958795Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:b6349bbb04ed138a3938953d8b8aaee6d2cd7f736b2f5a87dc51ed04e3f08f3f","observation_id":"3ae2b93c-2391-4649-8aea-bf48113677a2","resolution":{"observed_at":"2026-08-07T00:15:37.958795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-07T00:15:38.098358Z","title":"Emerging properties in unified multimodal pretraining, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.098358Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:27f01fc2e8a7759c6ef3bfc2a311ff001f53e111ad73224251db05836e8002e5","observation_id":"3081dbd7-c498-4520-b610-47e6b2990731","resolution":{"observed_at":"2026-08-07T00:15:38.098358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.28767","last_updated":"2026-05-22T17:26:49Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:59:56Z","title":"Gen-Searcher: Reinforcing Agentic Search for Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.28767","snapshot_observed_at":"2026-08-07T00:15:38.217313Z","title":"Gen-searcher: Reinforcing agentic search for image generation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.217313Z"},"links":{"cited_paper":"/paper/2603.28767","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:cc7a0cf7974f841ee29ec566cd64c3b55f566ef33cccad5750e8ed867267213f","observation_id":"97a849ac-d1d9-43d2-beea-addf51bf98d6","resolution":{"observed_at":"2026-08-07T00:15:38.217313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07546","last_updated":"2024-08-12T19:33:52Z","snapshot_observed_at":"2026-07-06T18:29:08.586253Z","submitted_at":"2024-06-11T17:59:48Z","title":"Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07546","snapshot_observed_at":"2026-08-07T00:15:38.364743Z","title":"Commonsense-t2i challenge: Can text-to- image generation models understand commonsense?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.364743Z"},"links":{"cited_paper":"/paper/2406.07546","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:b924a6c7883a08242f5d105763c65454ce8466523a02769c0e16b632c8b2a5c9","observation_id":"b8e6eff9-412a-43a9-9940-376db9b11c24","resolution":{"observed_at":"2026-08-07T00:15:38.364743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09595","last_updated":"2025-07-13T11:51:53Z","snapshot_observed_at":"2026-08-06T17:49:37.795167Z","submitted_at":"2025-07-13T11:51:53Z","title":"Demystifying Flux Architecture","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.09595","snapshot_observed_at":"2026-08-07T00:15:38.504110Z","title":"Demystifying flux architecture, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.504110Z"},"links":{"cited_paper":"/paper/2507.09595","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:5e9a1299a5a813add328e03131e21756a49bb32b438b48efcde7c4923921ea75","observation_id":"5da3c431-64e4-40f9-8d53-0f79d2030517","resolution":{"observed_at":"2026-08-07T00:15:38.504110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.622986Z","title":"Beyond words and pixels: A benchmark for implicit world knowledge reasoning in generative models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.622986Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:3f8ecaba5df3058e87242bbf3fd2edb3c2ae7eaea2a6d2b8650f337865c0ca8b","observation_id":"fe808141-0b6a-4c12-9b3f-0087ebacd1b8","resolution":{"observed_at":"2026-08-07T00:15:38.622986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11824","last_updated":"2025-07-28T09:36:29Z","snapshot_observed_at":"2026-07-06T19:34:01.458836Z","submitted_at":"2024-10-15T17:50:37Z","title":"KITTEN: A Knowledge-Intensive Evaluation of Image Generation on Visual Entities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11824","snapshot_observed_at":"2026-08-07T00:15:38.757043Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.757043Z"},"links":{"cited_paper":"/paper/2410.11824","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:d4801018dc1d14ccc2e4a7b0a94510fbbf8ad4a5d577b79dddf95427eb87a4cd","observation_id":"11e6ce3e-d9fb-4fa3-bc0e-51dfd75a9153","resolution":{"observed_at":"2026-08-07T00:15:38.757043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.acl-long.1334","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.151250Z","title":"T2i-factualbench: Benchmarking the factuality of text-to-image models with knowledge-intensive concepts","venue":null,"work_id":"ab0ae51e-69d8-4caf-a23d-3a5ac9329052","year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.850394Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:18770d1db49336c8c4c459663a27e7ff93f059fd44784e1693d3ec899e8d65a0","observation_id":"9dc6bc0e-8888-4669-a835-53b7bd753216","resolution":{"observed_at":"2026-08-07T00:15:39.164239Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.858364Z","title":"Genagent: Scaling text-to-image generation via agentic multimodal reasoning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.858364Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:ab3ed89314383beff8a51392a36c14f9086d7f2c0cd305ee1da8b25104bf9844","observation_id":"891bda99-d29c-4b28-9199-d231d78b09fd","resolution":{"observed_at":"2026-08-07T00:15:38.858364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-07T00:15:38.870713Z","title":"Playground v2.5: Three insights towards enhancing aesthetic quality in text-to-image generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.870713Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:b83fba4d1fd145051ab6872c9e0e1fc573da495632afe731697f34dacb679192","observation_id":"47b277f9-4a99-4dd6-8559-4ad526cc082a","resolution":{"observed_at":"2026-08-07T00:15:38.870713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05579","snapshot_observed_at":"2026-08-07T00:15:38.894887Z","title":"Llms-as-judges: A comprehensive survey on llm-based evaluation methods, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.894887Z"},"links":{"cited_paper":"/paper/2412.05579","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:1ecbc7443768f3d2f5ce2cbf658529062fa31ec950b14dfc7850bb9da7894b34","observation_id":"5ee90300-f5c7-4a68-8bda-cb214e044708","resolution":{"observed_at":"2026-08-07T00:15:38.894887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:42.674739Z","title":"Unigrpo: Unified policy optimization for reasoning-driven visual generation,","venue":null,"work_id":"1f746d27-6498-4b10-ab65-978e0561bbbb","year":null},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.913425Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:f959644fa869b162d0fa0cb3c5e3079b46646188274349e477b88efc54187d73","observation_id":"d4d414c5-45ac-4f32-bad0-65de41975c9c","resolution":{"observed_at":"2026-08-07T00:15:42.834847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.09538","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.883918Z","title":"Towards unified multimodal interleaved generation via group relative policy optimization, 2026","venue":null,"work_id":"071ffb58-cbed-4874-b65b-37fa383354b3","year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.958815Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:0afee0bcfeacf386c2164b8d4eb3ce55d946e955a45905728a99aa2e3a61d6ed","observation_id":"83683b37-4165-45b9-8cf8-5a9dee1287ca","resolution":{"observed_at":"2026-08-07T00:15:40.087957Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-07T17:17:00.060047Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-08-07T00:15:38.962629Z","title":"Wise: A world knowledge-informed semantic evaluation for text-to-image generation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.962629Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:ddc2ec3eb97446487d84a1bbda740deba17e103990505b64eb56e7912d348e70","observation_id":"e96e6f37-f4f3-40cf-a77b-f52cbd65b9d6","resolution":{"observed_at":"2026-08-07T00:15:38.962629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T00:15:38.966639Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.966639Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:9ec0469d23eb9e41f9d65552f64a1413feca68a1ae345603adbb3301601c2668","observation_id":"ef9a1d55-f28e-4a1c-a270-35deafa9adec","resolution":{"observed_at":"2026-08-07T00:15:38.966639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.970501Z","title":"Bermano, and Ohad Fried","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.970501Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:6ed5d1e3bf7eb71bded80bda9454db126e89676a09f3daad495296dd21ea0289","observation_id":"025dd2f3-746e-4a69-ba7d-718778b2484f","resolution":{"observed_at":"2026-08-07T00:15:38.970501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T00:15:38.979572Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.979572Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:2ee815143bc55dfc01518919b2b9661fe968c0260e78dafeac1f73db4c075a5a","observation_id":"30ab19c4-b198-439d-8c3e-29f1c3803536","resolution":{"observed_at":"2026-08-07T00:15:38.979572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17005","last_updated":"2025-05-22T17:58:26Z","snapshot_observed_at":"2026-08-07T14:49:29.125252Z","submitted_at":"2025-05-22T17:58:26Z","title":"R1-Searcher++: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17005","snapshot_observed_at":"2026-08-07T00:15:38.984695Z","title":"R1-searcher++: Incentivizing the dynamic knowledge acquisition of llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.984695Z"},"links":{"cited_paper":"/paper/2505.17005","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:17856cd7c6976766a4cb7fde57eb6d39116efa5af5c9bab7b60afc0f2170de2d","observation_id":"aa9dca68-a0df-46d2-9ece-67f68e64cd7d","resolution":{"observed_at":"2026-08-07T00:15:38.984695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-08-07T00:15:38.987981Z","title":"Longcat-image technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.987981Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:6800b1ccd9929f9210c06fdba087aa31dda27a1b9d501a90cf0e7f08759ecf00","observation_id":"8691bc38-f3cb-4d90-83b1-b31ccbf23de2","resolution":{"observed_at":"2026-08-07T00:15:38.987981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23951","last_updated":"2026-06-26T07:53:46Z","snapshot_observed_at":"2026-08-04T14:42:12.962842Z","submitted_at":"2025-09-28T16:14:10Z","title":"HunyuanImage 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23951","snapshot_observed_at":"2026-08-07T00:15:38.991808Z","title":"Hunyuanimage 3.0 technical report, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.991808Z"},"links":{"cited_paper":"/paper/2509.23951","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:ac12fb461a128680b30a48658e75ca871ec3761c4fabcb103f612414024a21b0","observation_id":"1b9ca539-0aea-46de-8e61-2dd5e3472e48","resolution":{"observed_at":"2026-08-07T00:15:38.991808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05382","last_updated":"2026-07-24T20:32:35Z","snapshot_observed_at":"2026-08-05T09:49:25.195615Z","submitted_at":"2026-07-06T17:56:12Z","title":"Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation","version":4},"cited_work":{"arxiv_id":"2607.05382","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.05382","snapshot_observed_at":"2026-08-07T00:15:39.563813Z","title":"Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation","venue":"cs.CV","work_id":"e13bf881-95ff-4c41-ac6b-0800bab22465","year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.009144Z"},"links":{"cited_paper":"/paper/2607.05382","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:1777546c869818a2c9e959b6557c5a58bd11197ea0970c6e3522c48e30bbbc8f","observation_id":"a687681b-92c3-4b73-b4dd-56e7c1a35950","resolution":{"observed_at":"2026-08-07T00:15:39.574168Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T00:15:39.013329Z","title":"Emu3: Next-token prediction is all you need, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.013329Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:cdf8beb76d8158e07f055101b446c5832eb4b1e9248cfd335e8d461be6af49c0","observation_id":"b5b9e53c-ae7a-464c-b324-a1d7306013f5","resolution":{"observed_at":"2026-08-07T00:15:39.013329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-07T00:15:39.016775Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.016775Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:94f5362227935b192d57235b74d78d9001eaf62064dfaec89f1b4b4b99ed60bd","observation_id":"93e2c5a1-8cc8-4bed-ba3c-0eea7571ef07","resolution":{"observed_at":"2026-08-07T00:15:39.016775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08541","last_updated":"2024-08-14T17:43:25Z","snapshot_observed_at":"2026-08-04T18:22:59.333944Z","submitted_at":"2023-10-12T17:34:20Z","title":"Idea2Img: Iterative Self-Refinement with GPT-4V(ision) for Automatic Image Design and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08541","snapshot_observed_at":"2026-08-07T00:15:39.031010Z","title":"Idea2img: Iterative self-refinement with gpt-4v(ision) for automatic image design and generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.031010Z"},"links":{"cited_paper":"/paper/2310.08541","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:cfbebc4590426a2efce8e91bb6b1f24147fddbdde7454e07595efad4e879428c","observation_id":"0f0591e6-38b2-4b0a-8b80-70f60dc6d1a1","resolution":{"observed_at":"2026-08-07T00:15:39.031010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-07T00:15:39.039044Z","title":"React: Synergizing reasoning and acting in language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.039044Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:56bfdc2cbc5a63f91fe670806572e2378b0a2acb70f6d05074952bf802fa7bc0","observation_id":"d3b98ec3-f4b3-4feb-923e-446f55dac0ec","resolution":{"observed_at":"2026-08-07T00:15:39.039044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30248","last_updated":"2026-05-29T03:57:25Z","snapshot_observed_at":"2026-07-06T23:39:34.232661Z","submitted_at":"2026-05-28T17:13:18Z","title":"GenClaw: Code-Driven Agentic Image Generation","version":2},"cited_work":{"arxiv_id":"2605.30248","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.30248","snapshot_observed_at":"2026-08-07T00:15:39.449689Z","title":"GenClaw: Code-Driven Agentic Image Generation","venue":"cs.CV","work_id":"37384707-ea28-4399-af11-413b3d1e8698","year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.042271Z"},"links":{"cited_paper":"/paper/2605.30248","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:103318a300ccbf1e4c861395276745d4b630e74dd39ab9252456aa19f365e2c7","observation_id":"fcfbedb8-094b-49bf-b0a2-18b471803ab6","resolution":{"observed_at":"2026-08-07T00:15:39.458384Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.053450Z","title":"Genpilot: A multi-agent system for test-time prompt optimization in image generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.053450Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:674d60477eb6c04ffd82225340a3b5e8d9f5c71870d0c1582e3a25fa39270b91","observation_id":"f6985950-4be7-4ee9-b73b-1a47128f7bfc","resolution":{"observed_at":"2026-08-07T00:15:39.053450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01490","last_updated":"2025-05-02T17:59:06Z","snapshot_observed_at":"2026-08-07T15:56:58.971781Z","submitted_at":"2025-05-02T17:59:06Z","title":"WorldGenBench: A World-Knowledge-Integrated Benchmark for Reasoning-Driven Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.01490","snapshot_observed_at":"2026-08-07T00:15:39.056728Z","title":"Worldgenbench: A world-knowledge-integrated benchmark for reasoning-driven text-to-image generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.056728Z"},"links":{"cited_paper":"/paper/2505.01490","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:97048a2842604dea1ba84aaf2e5b466eb8568ecba16b9365bfe30324e0c94a55","observation_id":"ae267b74-6094-4415-a9d5-4277b5df018e","resolution":{"observed_at":"2026-08-07T00:15:39.056728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.26907","last_updated":"2026-06-26T14:10:09Z","snapshot_observed_at":"2026-08-07T03:18:39.904639Z","submitted_at":"2026-06-25T11:40:12Z","title":"Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation","version":2},"cited_work":{"arxiv_id":"2606.26907","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.26907","snapshot_observed_at":"2026-08-07T00:15:39.331735Z","title":"Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation","venue":"cs.CV","work_id":"ed860572-a609-4f12-b4e3-6f75764a4f01","year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.060537Z"},"links":{"cited_paper":"/paper/2606.26907","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:68bcf28169d1066931358d6f5ce565c03dbb7cabc480ab5be2a5d747381e17fa","observation_id":"7aaedbb5-5bfc-4fec-8a90-e714d7e0ea61","resolution":{"observed_at":"2026-08-07T00:15:39.339882Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.074996Z","title":"\"\"You are a","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.074996Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:7899c2cb5a2f9def93981491f6f9f958d251287d9b70ab21efba1de8d4aaebd9","observation_id":"9ee431e9-9018-4bfd-899a-05fac29ca45b","resolution":{"observed_at":"2026-08-07T00:15:39.074996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:42.294000Z","title":null,"venue":null,"work_id":"3342d3a7-bd8b-46d7-917b-fc90663c6a35","year":null},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.080550Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:ba77968e79342ff22fb21601dd91f7cc0f903a34ccbdfdc0ec216867fc689303","observation_id":"a1b30b39-cfc0-49f3-b8f3-a70246623dcb","resolution":{"observed_at":"2026-08-07T00:15:42.490196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:42.075797Z","title":"according to the document","venue":null,"work_id":"042cb7fc-a3d1-436b-8eef-2a8364c57c51","year":null},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.094934Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:3c18281f6c56fb187081977fb1b6f200cd9e665cfe6fc806e33f8028a16a856c","observation_id":"9c5b5567-0bfb-4219-8122-0e2496dba551","resolution":{"observed_at":"2026-08-07T00:15:42.175268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:41.814294Z","title":null,"venue":null,"work_id":"8cc211c4-c660-4c06-9b4e-b309ba45d51e","year":null},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.117117Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:7db0b37e3484fa26f8a04e974ea255a0de1036d2ce733db5768851ceae082813","observation_id":"6fec7dc4-0cd6-4b21-9692-0984b3ba3fbf","resolution":{"observed_at":"2026-08-07T00:15:41.934761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:41.526065Z","title":"Avoid being overly vague","venue":null,"work_id":"eb500530-9974-41f8-876a-951e911d41dd","year":null},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.121702Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:0b6f521f72bc1eb3b284c419816871dad114a9f5ddb5f3a451e560e7e246646d","observation_id":"6a98c200-8729-4518-b91b-59a22722cbd3","resolution":{"observed_at":"2026-08-07T00:15:41.657398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6752.3141","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.237479Z","title":"name\": \"text_search","venue":null,"work_id":"f4b42d95-ec65-4f46-84b1-f672ebea85ad","year":1975},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:39.125513Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:4c8534bbb999e6bc8043930bf6392cca50ac82204300231c5ca3e6cad800fd77","observation_id":"cef43b31-d857-4142-ab78-f47d9a09ada4","resolution":{"observed_at":"2026-08-07T00:15:39.243712Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.947081Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.947081Z"},"links":{"citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:06355667ec27f6d33a03dfd3be549140f035c2253afd3288f55ebca73b246188","observation_id":"07d4a842-96f5-4ece-890f-2afc96a33d97","resolution":{"observed_at":"2026-08-07T00:15:38.947081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T19:19:22.437336Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":33,"verified_exact":6,"verified_fuzzy":3},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2608.04436."}