{"as_of":"2026-08-08T06:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8606a35df6cd637c591fe93c9bd74455281661c2e617ecbd15a33832054f8eb0","coverage":[{"denominator":153,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T06:14:01.543829Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.13125/citation-record","integrity":"/paper/2607.13125/integrity","json":"/paper/2607.13125/citation-record.json","paper":"/paper/2607.13125"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:48.951251Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:48.951251Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:92b4b3b9281ca24804f4412d4570f9a35e5221a279283d0616013bd46fa0c961","observation_id":"f75c1e18-ec9d-4f06-ab7e-dc6961f8df88","resolution":{"observed_at":"2026-08-02T06:13:48.951251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:49.053411Z","title":"Ideogram 4.https://ideogram.ai/blog/ideogram-4.0/, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:49.053411Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:3ff077691bdc063496ca6be93d3ae3f7c4db432ba0416a55b32bd903f77961d9","observation_id":"065d2d06-4f77-4ec1-8a6a-fe423e7d5973","resolution":{"observed_at":"2026-08-02T06:13:49.053411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T06:13:49.165727Z","title":"Qwen3-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:49.165727Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:411e78dce6bf5c46cb8be295b061355d7769a4923be80a819c5891530c980e5e","observation_id":"f66f1c88-641b-4614-804a-da07dbc6fbbd","resolution":{"observed_at":"2026-08-02T06:13:49.165727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-02T06:13:49.323044Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:49.323044Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:5965e36f78062117275cb683c162f4abe6701768d18d0e577197f3f9478b558a","observation_id":"d6279725-3635-44cd-b614-f2ffb0af2c73","resolution":{"observed_at":"2026-08-02T06:13:49.323044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:49.431087Z","title":"Beyond the imitation game: Quantifying and extrapolating the capabilities of language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:49.431087Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:95dec31ee4cecd63fae8bc8642815edd709564b323be2e967a74f59b5eee37c6","observation_id":"ddd8f2fc-b920-4a3b-841b-74fe98cb43bc","resolution":{"observed_at":"2026-08-02T06:13:49.431087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:49.518041Z","title":"Improving image generation with better captions.Computer Science","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:49.518041Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:f415faca3c018866e9ce5f69f8ebec19d940467eccb91e4caaadaac6d45c40ef","observation_id":"3c57dcef-d81b-4db0-a15b-9dde2a0865c7","resolution":{"observed_at":"2026-08-02T06:13:49.518041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:49.618977Z","title":"Announcing Black Forest Labs: Black forest labs’ inaugural model suite, FLUX.1, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:49.618977Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:c63a318deb35479aa0402519eb64481e8a6fa0f559289e944243450b8ae1ffa8","observation_id":"9611a8b6-6332-4c86-beb7-2acd03074d41","resolution":{"observed_at":"2026-08-02T06:13:49.618977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:49.698480Z","title":"FLUX.2: Analyzing and enhancing the latent space of FLUX – representation comparison, 11","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:49.698480Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:33e9decd1abfb1c8956ef0f9982df02f711fbd04391a98a988f7908cfbb91cb4","observation_id":"61d5e663-1719-497a-814f-f647ae23e963","resolution":{"observed_at":"2026-08-02T06:13:49.698480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:49.859041Z","title":"Flux.2: Production-grade ai image generation and editing model with 4mp photorealistic output and multi-reference control.https://bfl.ai/models/flux-2, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:49.859041Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:62651169e242d6fda494383cd1be7b6837ccc78bc8142448ded1ed53dcec920f","observation_id":"03749cc6-d98c-453d-9b5a-f950fe6a3ed2","resolution":{"observed_at":"2026-08-02T06:13:49.859041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:49.926505Z","title":"Large scale GAN training for high fidelity natural image synthesis","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:49.926505Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:c9a4e7310556d30932be9d52b7b2a0e52ad8beca39306129a644561cf5be469a","observation_id":"c12ec047-d7e2-400a-91c8-460d904a884a","resolution":{"observed_at":"2026-08-02T06:13:49.926505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:50.032564Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:50.032564Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:4e7935694c24a1e3af4f53d3dcdf7f2a78b9cf2e08d816f28506c40c8688f40f","observation_id":"259a7151-5308-4b2f-a9b8-a1119afb0c65","resolution":{"observed_at":"2026-08-02T06:13:50.032564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:50.177109Z","title":"Video generation models as world simulators.OpenAI Blog, 1(8):1, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:50.177109Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:631e66b40de0f6334146e478c977b54da0f59514d8bfda871bf4ac71bf876a6f","observation_id":"e0a0416a-cfc7-4528-9f55-5356a84cde8e","resolution":{"observed_at":"2026-08-02T06:13:50.177109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:50.262977Z","title":"Coyo-700m: Image-text pair dataset.https://github.com/kakaobrain/coyo-dataset, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:50.262977Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:2427681464c0568ab2129fd29f50aa757195ccb4f3d0c50a28f2c043abfb8fb0","observation_id":"99c4ee04-a9e4-4be9-8fb1-85f47340b849","resolution":{"observed_at":"2026-08-02T06:13:50.262977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:50.411080Z","title":"Seedream 4.5.https://seed.bytedance.com/en/seedream4_5, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:50.411080Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:14b44d7646714b64bd6e490ad2cfa2ea8d92f1275bd9582419ca0d88a91c08ef","observation_id":"6f85faa0-662d-440b-a022-9a3e63747382","resolution":{"observed_at":"2026-08-02T06:13:50.411080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:50.563602Z","title":"Seedream 5.0 lite","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:50.563602Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:88dfec97cea96b69e264bc402b832a7962449f847c600cf4fd99f5183bcad98e","observation_id":"ed3d5552-d504-4b08-a4da-8bbc71c5212c","resolution":{"observed_at":"2026-08-02T06:13:50.563602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00698","last_updated":"2025-06-04T16:20:49Z","snapshot_observed_at":"2026-08-02T08:38:17.217627Z","submitted_at":"2025-02-02T07:12:03Z","title":"MM-IQ: Benchmarking Human-Like Abstraction and Reasoning in Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00698","snapshot_observed_at":"2026-08-02T06:13:50.663556Z","title":"Mm-iq: Benchmarking human-like abstraction and reasoning in multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:50.663556Z"},"links":{"cited_paper":"/paper/2502.00698","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:36b0d62dedd65c5779b626009d04e95c7ddd70e13e088dfb44c98eb6b0225986","observation_id":"cefddff5-b290-4d9e-8837-d75c549dc05b","resolution":{"observed_at":"2026-08-02T06:13:50.663556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11061","snapshot_observed_at":"2026-08-02T06:13:50.834073Z","title":"Hidream-o1-image: A natively unified image generative foundation model with pixel-level unified transformer.arXiv preprint arXiv:2605.11061, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:50.834073Z"},"links":{"cited_paper":"/paper/2605.11061","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:48b1960a1eca32a99a957d4e9c69ba40d0c39b23085787f7db263de6d1454d2f","observation_id":"7c448b51-6336-4511-b2b3-f0c670e2ca42","resolution":{"observed_at":"2026-08-02T06:13:50.834073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:50.940004Z","title":"Rwku: Benchmarking real-world knowledge unlearning for large language models.Advances in Neural Information Processing Systems, 37:98213–98263, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:50.940004Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:00a88308bde07be7ff84772a7f23388229ced2468076a4e59cd97eaf19186c93","observation_id":"a42ccb62-a100-4276-961d-6d0d03c56213","resolution":{"observed_at":"2026-08-02T06:13:50.940004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23951","last_updated":"2026-06-26T07:53:46Z","snapshot_observed_at":"2026-08-04T14:42:12.962842Z","submitted_at":"2025-09-28T16:14:10Z","title":"HunyuanImage 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23951","snapshot_observed_at":"2026-08-02T06:13:51.058230Z","title":"Hunyuanimage 3.0 technical report.arXiv preprint arXiv:2509.23951, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:51.058230Z"},"links":{"cited_paper":"/paper/2509.23951","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:365e2b30b8dc07b6fcb85f1c2f278dfe5da9bdc54558b892cf15b5a4ebbc6b3f","observation_id":"5aee7ec5-5670-4a14-b0a5-a9fcb9744b44","resolution":{"observed_at":"2026-08-02T06:13:51.058230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:51.132578Z","title":"Extracting training data from diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:51.132578Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:3a9075248857817e484ab3dfeb39f8de822cb14c99a3f59b2a3e1374f1bc2d2f","observation_id":"a2a6725d-6fd7-401e-916e-f6262fe876d3","resolution":{"observed_at":"2026-08-02T06:13:51.132578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07977","last_updated":"2025-06-26T15:47:09Z","snapshot_observed_at":"2026-08-07T05:18:51.807244Z","submitted_at":"2025-06-09T17:50:21Z","title":"OneIG-Bench: Omni-dimensional Nuanced Evaluation for Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07977","snapshot_observed_at":"2026-08-02T06:13:51.220875Z","title":"Oneig-bench: Omni-dimensional nuanced evaluation for image generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:51.220875Z"},"links":{"cited_paper":"/paper/2506.07977","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:2416199f0a35700854a8085c8646953f65ace171747b1ca4056e84de29bd770d","observation_id":"3bf47c79-a902-40c7-92ea-b1dd3384aabc","resolution":{"observed_at":"2026-08-02T06:13:51.220875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21573","last_updated":"2026-05-20T17:59:58Z","snapshot_observed_at":"2026-08-02T08:45:09.575827Z","submitted_at":"2026-05-20T17:59:58Z","title":"Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21573","snapshot_observed_at":"2026-08-02T06:13:51.290384Z","title":"Lens: Rethinking training efficiency for foundational text-to-image models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:51.290384Z"},"links":{"cited_paper":"/paper/2605.21573","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:ec252552d5d8f2e0741bb4853f4d1f0041bd12afe846cec56d2d4e222cfc543f","observation_id":"d4191802-51cd-4ca5-ac6c-34fa639ee628","resolution":{"observed_at":"2026-08-02T06:13:51.290384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:51.430170Z","title":"Blip3o-next: Next frontier of native image generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:51.430170Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:2041e5d78673369deab2bc187e2bf03f9eb9531d5702987a4ab7d1db23db7b89","observation_id":"4b36701e-60ab-408f-a654-6e94ec38b917","resolution":{"observed_at":"2026-08-02T06:13:51.430170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:51.480021Z","title":"Pixart-α: Fast training of diffusion transformer for photorealistic text-to-image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:51.480021Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:39fe6a149b393d22717e7928d4d6faaaeed47c6ba9624d610cdf4c5c31d5fccc","observation_id":"d49977c3-4e02-4670-b68d-364df23ed756","resolution":{"observed_at":"2026-08-02T06:13:51.480021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05176","last_updated":"2023-05-09T05:11:02Z","snapshot_observed_at":"2026-07-31T18:33:34.529799Z","submitted_at":"2023-05-09T05:11:02Z","title":"FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05176","snapshot_observed_at":"2026-08-02T06:13:51.546469Z","title":"Frugalgpt: How to use large language models while reducing cost and improving performance, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:51.546469Z"},"links":{"cited_paper":"/paper/2305.05176","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:d373e26126847c122c2497c84993185c10e89847db2ed72046726aedcc84e48c","observation_id":"c59c1604-3f3b-48b8-bef3-ab44679c43ce","resolution":{"observed_at":"2026-08-02T06:13:51.546469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:51.648323Z","title":"Reproducible vision-language models meet concepts out of pre-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:51.648323Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:b1babb51f32032798cced38ecaa6c32cfbbb0422283810c93bf53ee22e5ac50f","observation_id":"952dcbcc-11d6-43be-9c07-e2150bda43a4","resolution":{"observed_at":"2026-08-02T06:13:51.648323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:51.786523Z","title":"Goodhart’s law: its origins, meaning and implications for monetary policy","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:51.786523Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:341e863d0c69279b352cc7a5c8ecc48b278dd452735f115f2e0ba549808ce8b7","observation_id":"dd3526ca-0a1e-4eee-b8d0-58b95ee8ab21","resolution":{"observed_at":"2026-08-02T06:13:51.786523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:51.856953Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:51.856953Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:fdb2d1a6eff1911db90371b38affaffa0d6d2d1279abfa244986c38835992c57","observation_id":"8b276d22-9aae-4f4b-be51-1e40b1709dbc","resolution":{"observed_at":"2026-08-02T06:13:51.856953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:52.012638Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:52.012638Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:82dd6b2c23d093783f1a1cd08b290b1385c16da2867bcb7660e576755a89109d","observation_id":"e4f25783-9c20-43f0-a952-ea8be02f38a1","resolution":{"observed_at":"2026-08-02T06:13:52.012638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:52.077864Z","title":"Hybrid llm: Cost-efficient and quality-aware query routing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:52.077864Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:64f629d5c37caafef44bb4f4a82d373cfb52f997e73894d9798dc8b8b4e6663a","observation_id":"9668749d-7893-4550-80df-9e71c46e7be8","resolution":{"observed_at":"2026-08-02T06:13:52.077864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:52.185978Z","title":"Cogview: Mastering text-to-image generation via transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:52.185978Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:a73e71cafea5c44d4ebd902b4379b162df52fc5aba242d38fb9c6022683ebc21","observation_id":"f1c75388-1fe6-4243-a469-feb3e14a3d2a","resolution":{"observed_at":"2026-08-02T06:13:52.185978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:52.395448Z","title":"Documenting large webtext corpora: A case study on the colossal clean crawled corpus","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:52.395448Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:cd0f3a2ae14abde57767732a81212a257074d7cc38cadb25504763294d1423be","observation_id":"a81afdfe-8446-4173-a854-b51bb36ae8c9","resolution":{"observed_at":"2026-08-02T06:13:52.395448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:52.549079Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:52.549079Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:64d4d7c872c53bf03d601d4722369f56e64fdb8c9422202cd6000ce9c5702767","observation_id":"a1e1ba21-7528-4e4b-8fa3-7c14c9e620a0","resolution":{"observed_at":"2026-08-02T06:13:52.549079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:52.717401Z","title":"Textcrafter: Accurately rendering multiple texts in complex visual scenes.arXiv e-prints, pp","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:52.717401Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:0d98e4b00dfac90c1349857f9eb78838476da09c5752d7bfbfd651fa993bd46f","observation_id":"9606e237-a814-4b09-8a07-698dee244933","resolution":{"observed_at":"2026-08-02T06:13:52.717401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:52.935384Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:52.935384Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:3c81ca0e471dc92d6173786c4cecf48b06061b7c5345f08607fd5f0f8c29404f","observation_id":"eb3ac4d6-4572-4aad-9c0d-d31a18d29836","resolution":{"observed_at":"2026-08-02T06:13:52.935384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:53.093874Z","title":"Datacomp: in search of the next generation of multimodal datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:53.093874Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:d7a68c5975ddafd6a3774b7888b92b1841d3fecb27aac3ab9238c415558e7f14","observation_id":"35f9d990-4c6a-49a0-9f5d-7abb0d80db35","resolution":{"observed_at":"2026-08-02T06:13:53.093874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:53.237730Z","title":"Lumina-t2x: Scalable flow-based large diffusion transformer for flexible resolution generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:53.237730Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:50f43298e769ae16ebab9637e10f6fb6d8de5a11fc1312f2ebb37d7b8e0a98b5","observation_id":"441d8842-abf2-4b2e-b24e-2ceda306f8eb","resolution":{"observed_at":"2026-08-02T06:13:53.237730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11346","last_updated":"2025-06-28T11:46:35Z","snapshot_observed_at":"2026-07-06T21:09:50.780345Z","submitted_at":"2025-04-15T16:19:07Z","title":"Seedream 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11346","snapshot_observed_at":"2026-08-02T06:13:53.357375Z","title":"Seedream 3.0 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:53.357375Z"},"links":{"cited_paper":"/paper/2504.11346","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:e18f62a0aeef3ed98370b027b9ba144afba3252e5be0c08b13a9e90af209cb04","observation_id":"5948e747-8f67-4ebe-a978-db60ae430be2","resolution":{"observed_at":"2026-08-02T06:13:53.357375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-02T06:13:53.538640Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:53.538640Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:85db7d5bd74ba3d92d51c4eaf4d5eb9b71ddec61b5faa75129d319559d925e63","observation_id":"0fd5c2fa-7c15-40e5-ac09-b960fb9dcfdf","resolution":{"observed_at":"2026-08-02T06:13:53.538640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22058","last_updated":"2025-07-29T17:59:04Z","snapshot_observed_at":"2026-08-06T15:57:37.748671Z","submitted_at":"2025-07-29T17:59:04Z","title":"X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22058","snapshot_observed_at":"2026-08-02T06:13:53.626677Z","title":"X-omni: Reinforcement learning makes discrete autoregressive image generative models great again","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:53.626677Z"},"links":{"cited_paper":"/paper/2507.22058","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:4cb181339d30eeeb3d5b5b1dbb30f9a9fd3e0c5dab5f8f419591d03f361723f9","observation_id":"6846bb73-e826-47d3-aef9-238850771d3f","resolution":{"observed_at":"2026-08-02T06:13:53.626677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:53.811494Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:53.811494Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:b3fd4798ee4266dde8ae895ea50f8c45825dcfef648bbdc17ab592a8a89e9c2d","observation_id":"3299e691-b71e-4362-8e9e-05ac4c7afadc","resolution":{"observed_at":"2026-08-02T06:13:53.811494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:53.939798Z","title":"Introducing nano banana pro, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:53.939798Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:05646f0f773812165b498d26a06bb93e1d8d04981d70cba9b5890d888dc3c5e4","observation_id":"037969cb-5179-4c2a-9d3b-4d568d23cc26","resolution":{"observed_at":"2026-08-02T06:13:53.939798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:54.024324Z","title":"Nano banana 2: Combining pro capabilities with lightning-fast speed, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:54.024324Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:c2fbee2e04fd7f8151e81e653856c5685f05d8c7e41fe2843abd0f168f9d934e","observation_id":"86cdf8b5-a645-447e-8f03-9f2d788890bb","resolution":{"observed_at":"2026-08-02T06:13:54.024324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:54.112612Z","title":"Imagen 4.0.https://deepmind.google/models/imagen/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:54.112612Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:523b848c30267c112cc7cb4f3d2a7f67856c9247510290a949b51731ec7a96a7","observation_id":"60074872-590c-4bc9-aa47-475b28202597","resolution":{"observed_at":"2026-08-02T06:13:54.112612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:54.291212Z","title":"Gemini 3.1 pro - model card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:54.291212Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:84957ec806abd7bec994d1a57511473036a35295f7d5d5138a07f464c768fe95","observation_id":"1628e578-8f84-4ed2-8f22-3428b1471b38","resolution":{"observed_at":"2026-08-02T06:13:54.291212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-07-06T05:46:07.424788Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-02T06:13:54.498576Z","title":"Accurate, large minibatch sgd: Training imagenet in 1 hour, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:54.498576Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:bf528575eb7e561814c5f81c8c4f2e956838ec3f1f4a94c0d5c6e1d3c148e9ba","observation_id":"044b0aa2-d269-4c75-847a-50cd569693b9","resolution":{"observed_at":"2026-08-02T06:13:54.498576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:54.607186Z","title":"Accelerate: Training and inference at scale made simple, efficient and adaptable","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:54.607186Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:c33c4f830adc4cd3a610f85e6425c575e97740535d7e9f7b789c23ee964a8b7e","observation_id":"f804d397-80b8-48e9-b3a6-8dafd8081c80","resolution":{"observed_at":"2026-08-02T06:13:54.607186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-07T15:56:40.603452Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-08-02T06:13:54.686646Z","title":"R-bench: Graduate-level multi-disciplinary benchmarks for llm & mllm complex reasoning evaluation.arXiv preprint arXiv:2505.02018, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:54.686646Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:8ed11ce5bffaa1135ca4147e2229022def9b008123601f9319a00cdcaff5565d","observation_id":"96a55390-e8ef-4e21-a9a3-17ef0e834002","resolution":{"observed_at":"2026-08-02T06:13:54.686646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.09568","last_updated":"2018-03-02T00:12:58Z","snapshot_observed_at":"2026-08-08T05:45:32.956312Z","submitted_at":"2018-02-26T19:36:41Z","title":"Shampoo: Preconditioned Stochastic Tensor Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.09568","snapshot_observed_at":"2026-08-02T06:13:54.765813Z","title":"Shampoo: Preconditioned stochastic tensor optimization, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:54.765813Z"},"links":{"cited_paper":"/paper/1802.09568","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:b1981cd405199b5595a1749f36b359a84c5beca05bdbdda878920142417ca080","observation_id":"cca0c50c-a931-40fd-acbb-3d69f9e1bdfb","resolution":{"observed_at":"2026-08-02T06:13:54.765813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:54.856542Z","title":"Optimizing prompts for text-to-image generation.Advances in Neural Information Processing Systems, 36:66923–66939, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:54.856542Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:7187de7c0d68aa71cab4c0826ee74580a00704e07be1846a71282d31106c07b7","observation_id":"2c53b8b0-63c3-4e26-bad0-ef064c19b214","resolution":{"observed_at":"2026-08-02T06:13:54.856542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:55.039132Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:55.039132Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:afed4867f35c4c1d0489283dabffe3eb572cfb544adbd031e190bd1f09434b68","observation_id":"48ca3bed-a8e4-4b39-a739-788928365ec2","resolution":{"observed_at":"2026-08-02T06:13:55.039132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:55.238304Z","title":"Gems: Agent-native multimodal generation with memory and skills.arXiv preprint arXiv:2603.28088, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:55.238304Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:bf9da52425544d208f06fe6bef9fd3b2ec36f42871e0c405689d2d56b30c5b57","observation_id":"c0cc6a4c-b5f7-4fbe-801c-9483c3d66e56","resolution":{"observed_at":"2026-08-02T06:13:55.238304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:55.418812Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:55.418812Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:ba316976ab712259e813b48ad5900f62c72c301eab89ba1aa51ac43d4dc615b7","observation_id":"08dda659-d79e-4775-aec4-b70a117ec82d","resolution":{"observed_at":"2026-08-02T06:13:55.418812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:55.557151Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:55.557151Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:f8e371500018522e95848f5c910880d0d44db246a936faaa191e98683df697a1","observation_id":"a965f2af-4b01-46f9-98f2-6259b803aeab","resolution":{"observed_at":"2026-08-02T06:13:55.557151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:55.707862Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:55.707862Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:fef291c8618631630d95956ba9a23468c48ac8f35c282aa5912fade3e0161118","observation_id":"8c979a0d-60cc-43b2-9825-aab8f399cb30","resolution":{"observed_at":"2026-08-02T06:13:55.707862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-02T06:13:55.904790Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment.arXiv preprint arXiv:2403.05135, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:55.904790Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:0dd496014d343f971201095af56bca311589e710e4f9ceb0fee11c708cfdc78d","observation_id":"ffb03898-789a-4d9f-9f20-c7e65e4697ef","resolution":{"observed_at":"2026-08-02T06:13:55.904790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:56.041830Z","title":"Tifa: Accurate and interpretable text-to-image faithfulness evaluation with question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:56.041830Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:a6a7979e48b78e41c97b38ca111079834df8e364f9bd57a6d66f831c29410532","observation_id":"d4f0c738-1968-4d79-8708-6c0439bec751","resolution":{"observed_at":"2026-08-02T06:13:56.041830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:56.113357Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation.Advancesin Neural Information Processing Systems, 36: 78723–78747, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:56.113357Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:f72ba783a8c6208ed3801af1af50fb2fa13b986a9a5fefebea0fa43d88280aa2","observation_id":"4c94ec62-ab7b-4d5c-9624-4155e452756c","resolution":{"observed_at":"2026-08-02T06:13:56.113357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.00204","last_updated":"2026-05-29T17:59:31Z","snapshot_observed_at":"2026-07-06T23:40:56.510371Z","submitted_at":"2026-05-29T17:59:31Z","title":"APE: Agentic Prompt Enhancer for Image Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.00204","snapshot_observed_at":"2026-08-02T06:13:56.352402Z","title":"Ape: Agentic prompt enhancer for image generation and editing.arXiv preprint arXiv:2606.00204, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:56.352402Z"},"links":{"cited_paper":"/paper/2606.00204","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:dc9a7e2fe5f296a04df57596e58320e703fc05eb0a2b17171df86f3b60017215","observation_id":"ba063118-0aa2-45fd-a584-c75445c3e781","resolution":{"observed_at":"2026-08-02T06:13:56.352402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:56.524762Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:56.524762Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:6b5a9eab0e8ffadbec614471760f498c970af9c6721d5f50ea5ae57e04159d3d","observation_id":"c5011ab0-04f2-4d95-b2f1-0893b765c17f","resolution":{"observed_at":"2026-08-02T06:13:56.524762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:56.724747Z","title":"Geditbench v2: A human-aligned benchmark for general image editing.arXiv preprint arXiv:2603.28547, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:56.724747Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:0b55bee3c41915ff5e9e72dacce52664f3288f42820eae34a2679181620ead56","observation_id":"755a992f-99af-41f4-986e-694b341663e5","resolution":{"observed_at":"2026-08-02T06:13:56.724747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:56.865106Z","title":"Muon: An optimizer for hidden layers in neural networks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:56.865106Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:d41b38549cac660cb9116ee53538ed1b6148b492b5637e8ec40a90ca4ec3eeca","observation_id":"538c7555-23b1-48ab-b710-6830f180844e","resolution":{"observed_at":"2026-08-02T06:13:56.865106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-02T06:13:56.968702Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:56.968702Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:d83f138963cb7e2f5f048de5b171ce714a4c3ff0e29d99b504329351c5253eea","observation_id":"80de5ee0-b980-43fd-9f59-9b376e4b5d6a","resolution":{"observed_at":"2026-08-02T06:13:56.968702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:57.079808Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:57.079808Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:4e83821c37e91e5695ed448d8affd00118166cdbb0298b889f7ee28f9b4cf792","observation_id":"50192b77-a8d2-4206-863e-b0b813aa884f","resolution":{"observed_at":"2026-08-02T06:13:57.079808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02696","last_updated":"2024-03-20T12:58:14Z","snapshot_observed_at":"2026-07-06T16:57:09.664139Z","submitted_at":"2023-12-05T11:55:47Z","title":"Analyzing and Improving the Training Dynamics of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02696","snapshot_observed_at":"2026-08-02T06:13:57.216009Z","title":"Analyzing and improving the training dynamics of diffusion models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:57.216009Z"},"links":{"cited_paper":"/paper/2312.02696","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:8c9c2093621c303343fc8ea29c90cb7b0b6bd66bf6dbf018344a7aa31191c24e","observation_id":"1f9f2373-913a-437e-bfa2-655ada8ef4ab","resolution":{"observed_at":"2026-08-02T06:13:57.216009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-02T06:13:57.438770Z","title":"Auto-encoding variational bayes.arXiv preprint arXiv:1312.6114, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:57.438770Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:2394a02e9965b7abba3ff81ac740dd64a8497501ad07008e402338a708dc5fa6","observation_id":"04a0050a-c1e6-4be8-bed4-0d4e1b45ebbf","resolution":{"observed_at":"2026-08-02T06:13:57.438770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:57.501051Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation.Advancesin neural information processing systems, 36:36652–36663, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:57.501051Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:b2bf82e5f4c4e3701bf738bd4bf0518975fe8765711ce1e0487cc7277b04af12","observation_id":"2267cbb9-8e49-4103-9fa7-62647a3972de","resolution":{"observed_at":"2026-08-02T06:13:57.501051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:57.566848Z","title":"Imagenet classification with deep convolutional neural networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:57.566848Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:6f9539d84bb7b86b5e4ca8aca040b42496a544141f0e7ce9c1904cec548f3f86","observation_id":"50b4faf5-9f72-4782-95a7-a07eeb4edde8","resolution":{"observed_at":"2026-08-02T06:13:57.566848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:57.795681Z","title":"Kling-image-2.1.https://kling.ai/explore/kling_2.1_api, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:57.795681Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:42d4577ebe2de0e4da6a06f0053bf5b45364c86933dd48c9efe06e30b14f7c5f","observation_id":"2530bb18-dd66-4894-9842-686a3f70b91b","resolution":{"observed_at":"2026-08-02T06:13:57.795681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:57.949322Z","title":"Improved precision and recall metric for assessing generative models.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:57.949322Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:c3c6e26824f0fcfcafbe1071378d38aad9a0ab79300a7ddaf3493557c693be20","observation_id":"4ff55b39-e1d7-422c-8704-f9522f870a07","resolution":{"observed_at":"2026-08-02T06:13:57.949322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:58.148903Z","title":"Krea 2.https://www.krea.ai/blog/krea-2-technical-report, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:58.148903Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:1c4e045ef0ebb6801b2f7052d55037087e00d42392fc8e82de1a244425fafebf","observation_id":"48c8b77c-ecca-4584-bea4-b27ad8f95e79","resolution":{"observed_at":"2026-08-02T06:13:58.148903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:58.345604Z","title":"Qwen-image-bench: From generation to creation in text-to-image evaluation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:58.345604Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:c8128fd607f5a53460e19d584aa23e62cd398fca636ca60c14f2bc2b47158f6a","observation_id":"5fbbbe22-1d65-450a-bd7e-799bf4e581b1","resolution":{"observed_at":"2026-08-02T06:13:58.345604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:58.706872Z","title":"Omnicorpus: A unified multimodal corpus of 10 billion-level images interleaved with text","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:58.706872Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:6ba2b5fbe269d45a24c1bfa3fdec44df306750acd0f6c9d1cafc48eb65a4cd92","observation_id":"ab592bfc-a6f0-46ee-898b-263ba1844a83","resolution":{"observed_at":"2026-08-02T06:13:58.706872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:58.913557Z","title":"Reflect-dit: Inference-time scaling for text-to-image diffusion transformers via in-context reflection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:58.913557Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:0d48cc465b1eb3ebf4ce6a88da91a1beb15f7e8e3885ac704c80fd4855d37a17","observation_id":"d106f05c-e611-472e-b178-05939b2ff582","resolution":{"observed_at":"2026-08-02T06:13:58.913557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-02T06:13:59.051742Z","title":"Holistic evaluation of language models.arXiv preprint arXiv:2211.09110, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:59.051742Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:59a169360f958c4ec599285d15b1b4ce5e2197a92cba33f25a1cd5a0cff000d3","observation_id":"3cf9eb3e-3acd-4661-a627-9a159725b674","resolution":{"observed_at":"2026-08-02T06:13:59.051742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:59.249642Z","title":"Scaling laws for diffusion transformers.arXiv preprint arXiv:2410.08184, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:59.249642Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:21f72ec6fb436f96f089eb909b21f9822d3ebbc3c356c02a82aa192897a3a8f7","observation_id":"bba40d7e-840c-4703-b615-17d26829a106","resolution":{"observed_at":"2026-08-02T06:13:59.249642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:59.391516Z","title":"Aegis: Exploring the limit of world knowledge capabilities for unified mulitmodal models.arXiv preprint arXiv:2601.00561, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:59.391516Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:3405635bd448a823f7dd4e8f666e0239359298a17f32994a17fa2fb27e07b11b","observation_id":"83294cd2-6ba9-4983-9caf-3e87b519b8b4","resolution":{"observed_at":"2026-08-02T06:13:59.391516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-02T06:13:59.515766Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:59.515766Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:fb80e80fa6b6cae9121494f688bd9c1a4defea6ea4654c1d5b5933f110974c78","observation_id":"2d35ffb8-c0b4-4ed0-ae88-409ad3f1bd86","resolution":{"observed_at":"2026-08-02T06:13:59.515766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:59.574336Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:59.574336Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:546db2d8235b29f0c2fb911eac076ac586b1c0166c552f5f359a787d2c5a1353","observation_id":"5c858956-67dd-4edf-92b1-c351d1bfc1ca","resolution":{"observed_at":"2026-08-02T06:13:59.574336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.25347","last_updated":"2026-05-25T02:04:10Z","snapshot_observed_at":"2026-07-06T23:35:21.734804Z","submitted_at":"2026-05-25T02:04:10Z","title":"ERNIE-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.25347","snapshot_observed_at":"2026-08-02T06:13:59.666650Z","title":"Ernie-image technical report.arXiv preprint arXiv:2605.25347, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:59.666650Z"},"links":{"cited_paper":"/paper/2605.25347","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:0d9885c08d27ecba58011f8654ea1190e3cff4537b026d6903a6170adbbb0bc8","observation_id":"85f32cd7-747d-45a2-8a92-63a6da5e5d70","resolution":{"observed_at":"2026-08-02T06:13:59.666650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:13:59.767161Z","title":"Flow-grpo: Training flow matching models via online rl, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:59.767161Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:78b08d2681e8bd295587b7fc1170ebc9c1d95f2383308c2b659a9d3e04be6d03","observation_id":"06c03042-f0b2-40e4-b62f-3b2100b9a800","resolution":{"observed_at":"2026-08-02T06:13:59.767161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-08-02T06:13:59.853626Z","title":"Step1x-edit: Apracticalframeworkforgeneralimageediting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:59.853626Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:81b7f5647a8e5b141ef6c9cd2f978a6b00f83fd0940adb27edb16b5f593e3978","observation_id":"69616bd8-0930-4e78-8012-2c89c4e9de56","resolution":{"observed_at":"2026-08-02T06:13:59.853626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-02T06:13:59.940144Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:59.940144Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:35c0855d8f8bbe40996df96eb66ea0b65c72c3b8393a234ad0c7943623046034","observation_id":"62cdb099-cff2-440b-852b-b74a5be0a285","resolution":{"observed_at":"2026-08-02T06:13:59.940144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00927","last_updated":"2022-10-13T12:04:36Z","snapshot_observed_at":"2026-08-03T02:03:48.954468Z","submitted_at":"2022-06-02T08:43:16Z","title":"DPM-Solver: A Fast ODE Solver for Diffusion Probabilistic Model Sampling in Around 10 Steps","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00927","snapshot_observed_at":"2026-08-02T06:14:00.030437Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-02T06:14:00.030437Z"},"links":{"cited_paper":"/paper/2206.00927","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:bbc97af1154be86f1cc36e6cc21b7b3f9401a1f35eb3a113887a31e80a02d2c5","observation_id":"d37fb147-be7c-4c12-803b-49c83bf35939","resolution":{"observed_at":"2026-08-02T06:14:00.030437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:14:00.164612Z","title":"Dpm-solver++: Fast solver for guided sampling of diffusion probabilistic models.Machine Intelligence Research, 22(4):730–751, June 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-02T06:14:00.164612Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:cc191e48c57caa14f1931dd0a8c1da72fdacaf62350a454470a60fe81aedbe65","observation_id":"15bff975-6b88-4b74-8c77-6731e2feb991","resolution":{"observed_at":"2026-08-02T06:14:00.164612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-07T21:47:16.436942Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-02T06:14:00.278259Z","title":"Ovis: Structural embedding alignment for multimodal large language model.arXiv preprint arXiv:2405.20797, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-02T06:14:00.278259Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:0cd00fa1d6ec19f82f4e88f4d60ba57702421f7a51f4db46e3554d7e3b686f84","observation_id":"e7c78af9-1734-4328-8a70-714b749a41ad","resolution":{"observed_at":"2026-08-02T06:14:00.278259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:14:00.383398Z","title":"Murphy.Probabilistic Machine Learning: Advanced Topics","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-02T06:14:00.383398Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:d410e48fd78f323db753e64c27e6d2819a42706670b428ddf1c11a7502ef811d","observation_id":"83a1c502-6ea1-4e04-975d-4b659acf135d","resolution":{"observed_at":"2026-08-02T06:14:00.383398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:14:00.512440Z","title":"Some matrix-inequalities and metrization of matric-space.Tomsk.Univ","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-02T06:14:00.512440Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:6a119b085eb818104a88917d7a805daf8f351ba13c8474df345ee048bf6662f7","observation_id":"932d2aab-c4a1-408a-92bf-f40297455938","resolution":{"observed_at":"2026-08-02T06:14:00.512440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:14:00.761659Z","title":"Improveddenoisingdiffusionprobabilisticmodels","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-02T06:14:00.761659Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:172c74d2d447db24f6dc46fb094eb6f9f06f8930b390a4af6cd8eb73d00cce91","observation_id":"3bfc1697-7297-457d-940f-81c0916db196","resolution":{"observed_at":"2026-08-02T06:14:00.761659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-07T17:17:00.060047Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-08-02T06:14:00.915135Z","title":"Wise: A world knowledge-informed semantic evaluation for text-to-image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-02T06:14:00.915135Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:928919528e523f8c6a02d3bcbe774fb3682fd2f4c500ff107f8ff7f0ab7c1186","observation_id":"4b5eb209-ee01-4f12-94ba-d9a297c6c03a","resolution":{"observed_at":"2026-08-02T06:14:00.915135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18665","last_updated":"2025-02-23T08:50:33Z","snapshot_observed_at":"2026-07-30T15:06:18.011623Z","submitted_at":"2024-06-26T18:10:22Z","title":"RouteLLM: Learning to Route LLMs with Preference Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18665","snapshot_observed_at":"2026-08-02T06:14:01.054277Z","title":"Routellm: Learning to route llms with preference data.arXiv preprint arXiv:2406.18665, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-02T06:14:01.054277Z"},"links":{"cited_paper":"/paper/2406.18665","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:4028aacb7c4760a067d5a64df7f84d6e2aed8cecf0acb541ff81ef3195b7aaeb","observation_id":"c96e4c6d-15f5-43a8-b0b6-02191a0fce95","resolution":{"observed_at":"2026-08-02T06:14:01.054277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:14:01.112173Z","title":"Gpt image 1.https://developers.openai.com/api/docs/models/gpt-image-1, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-02T06:14:01.112173Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:6589f6e966cd95d05982cb7a60cb7610854498ab38a060bfd3ae9fd822d6c0cf","observation_id":"a11cee70-5056-46ee-8127-b20f9bd355c4","resolution":{"observed_at":"2026-08-02T06:14:01.112173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:14:01.157118Z","title":"Introducing chatgpt images 2.0, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-02T06:14:01.157118Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:8fa2a5228987c897d1a2f66d8d8827c4dfd4832afb11dd8e7d55a853d52c939e","observation_id":"6429ecc9-4650-4d1b-acee-f2c6f9d01816","resolution":{"observed_at":"2026-08-02T06:14:01.157118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12425","last_updated":"2024-05-22T16:29:58Z","snapshot_observed_at":"2026-07-06T17:19:08.136109Z","submitted_at":"2024-01-23T01:25:00Z","title":"The Neglected Tails in Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12425","snapshot_observed_at":"2026-08-02T06:14:01.246448Z","title":"The neglected tails in vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-02T06:14:01.246448Z"},"links":{"cited_paper":"/paper/2401.12425","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:9e7bc84c26b284a6676d401cde4d6572e8f3a7de112cdaf8a1625142b875f13d","observation_id":"7c3a3f45-ca7e-41c3-a48b-02775085e3bf","resolution":{"observed_at":"2026-08-02T06:14:01.246448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:14:01.305543Z","title":"On aliased resizing and surprising subtleties in gan evaluation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-02T06:14:01.305543Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:ae20c3c48cd2abf11c30581d3f0b5136654d8fd118192f5039facedd5d4e86a5","observation_id":"5f4faa72-776c-4c8d-9e17-56c2163a7f7d","resolution":{"observed_at":"2026-08-02T06:14:01.305543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-02T06:14:01.347373Z","title":"Scalable diffusion models with transformers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-02T06:14:01.347373Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:3e19152114001adf59462b6450d33b579da720370f657b778b9a392a8b97366b","observation_id":"a08d4a57-272f-4bbe-bbaf-42e63e8049dc","resolution":{"observed_at":"2026-08-02T06:14:01.347373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:14:01.400475Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-02T06:14:01.400475Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:e902840b8f09011bc9a0a3d45b5da5a8195520bab9a0c3fddb166a908852f4e1","observation_id":"0ae2d21b-1cb2-4e24-b130-bdb5f5565789","resolution":{"observed_at":"2026-08-02T06:14:01.400475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:14:01.440759Z","title":"Qwen-image-2512: Finer details, greater realism.https://qwen.ai/blog?id= qwen-image-2512, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-02T06:14:01.440759Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:6e7cd7bd3d37501e4f925fafd92d0f328f9c602ad34b663e96871367cb76e289","observation_id":"9dbde912-babf-48c5-8464-718b6810e908","resolution":{"observed_at":"2026-08-02T06:14:01.440759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:14:01.489522Z","title":"Qwen-image-edit-2509: Multi-image support, improved consistency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-02T06:14:01.489522Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:7c0f451288dc9e23b1cad9bd673e0f2ba564bf903e506cd79e681c66537cd8ae","observation_id":"6dfed77a-d776-4ce5-adf0-c74fbd9b45d6","resolution":{"observed_at":"2026-08-02T06:14:01.489522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:14:01.543829Z","title":"Qwen-image-2511.https://qwen.ai/blog?id=qwen-image-2512, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-02T06:14:01.543829Z"},"links":{"citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:628696ca284090ced92a5c6f989fb5b490c6ba77460b601275c1fa6d654131ed","observation_id":"29045739-ae7c-4be3-9af6-1644e456e694","resolution":{"observed_at":"2026-08-02T06:14:01.543829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":153},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 153 outbound references and 0 inbound Pith citation observations for arXiv:2607.13125."}