{"as_of":"2026-08-07T17:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e949e36738166e326366f2c430383b4707dcb3dbaf6b31367e0e98612b2e6c7c","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T18:48:03.885237Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T04:09:49.613004Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T06:54:20.702391Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"cited_work":{"arxiv_id":"2509.09680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09680","snapshot_observed_at":"2026-06-30T06:54:20.702391Z","title":"Flux-reason-6m & prism-bench: A million-scale text-to-image reasoning dataset and comprehensive benchmark","venue":null,"work_id":"a70f3cb4-6936-439a-aef0-f14fde9a5b95","year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T14:08:36.801359Z"},"links":{"cited_paper":"/paper/2509.09680","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:7f3f2a69fb88ba10e34898596615325f4a389418b6ac7824e7941a722503818f","observation_id":"a2d368cc-6e46-4376-b939-0cb33154a5af","resolution":{"observed_at":"2026-05-11T14:08:37.030219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09680","snapshot_observed_at":"2026-08-03T19:47:31.327318Z","title":"Flux-reason-6m and prism-bench: A million-scale text-to- image reasoning dataset and comprehensive benchmark.arXiv preprint arXiv:2509.09680, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:31.327318Z"},"links":{"cited_paper":"/paper/2509.09680","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:aba704fb018a3301dbd8bb38c5761feacc1e00a89cb4c3c7e88c820070729e76","observation_id":"6b6f9400-4ee2-466a-9de1-97b015cb413c","resolution":{"observed_at":"2026-08-03T19:47:31.327318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09680","snapshot_observed_at":"2026-08-03T12:50:55.743597Z","title":"Flux-reason-6m & prism-bench: A million- scale text-to-image reasoning dataset and comprehensive benchmark.arXiv preprint arXiv:2509.09680, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:55.743597Z"},"links":{"cited_paper":"/paper/2509.09680","citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:8311a1ed39a9cbc1612168a83f5a930eee0a97a3fe2412478bb970c352017ccd","observation_id":"fce86933-3f87-4417-89e9-eac9301d2ba8","resolution":{"observed_at":"2026-08-03T12:50:55.743597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"cited_work":{"arxiv_id":"2509.09680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09680","snapshot_observed_at":"2026-06-30T06:54:20.702391Z","title":"Flux-reason-6m & prism-bench: A million-scale text-to-image reasoning dataset and comprehensive benchmark","venue":null,"work_id":"a70f3cb4-6936-439a-aef0-f14fde9a5b95","year":2025},"citing_paper":{"arxiv_id":"2604.12322","last_updated":"2026-04-14T05:54:33Z","snapshot_observed_at":"2026-07-06T23:00:32.607699Z","submitted_at":"2026-04-14T05:54:33Z","title":"Self-Adversarial One Step Generation via Condition Shifting","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T15:37:36.994169Z"},"links":{"cited_paper":"/paper/2509.09680","citing_paper":"/paper/2604.12322"},"observation_digest":"sha256:65082a521b29232dcf3798bceb6992822fba165bc8ddd76305374ed6d18520fd","observation_id":"3dccef82-3cf6-4e2a-b349-6088b0cc0d1d","resolution":{"observed_at":"2026-05-11T10:11:01.970606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"cited_work":{"arxiv_id":"2509.09680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09680","snapshot_observed_at":"2026-06-30T06:54:20.702391Z","title":"Flux-reason-6m & prism-bench: A million-scale text-to-image reasoning dataset and comprehensive benchmark","venue":null,"work_id":"a70f3cb4-6936-439a-aef0-f14fde9a5b95","year":2025},"citing_paper":{"arxiv_id":"2604.20796","last_updated":"2026-04-22T17:20:42Z","snapshot_observed_at":"2026-07-06T23:07:31.559812Z","submitted_at":"2026-04-22T17:20:42Z","title":"LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T00:49:38.156237Z"},"links":{"cited_paper":"/paper/2509.09680","citing_paper":"/paper/2604.20796"},"observation_digest":"sha256:27251f3bcd34e74ebc1b5ace35193b7c38867d466fba697bcb1f32d750f61ba7","observation_id":"d77b53bb-b502-4f90-a876-656d0aa4aa6a","resolution":{"observed_at":"2026-05-10T00:49:48.344114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"cited_work":{"arxiv_id":"2509.09680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09680","snapshot_observed_at":"2026-06-30T06:54:20.702391Z","title":"Flux-reason-6m & prism-bench: A million-scale text-to-image reasoning dataset and comprehensive benchmark","venue":null,"work_id":"a70f3cb4-6936-439a-aef0-f14fde9a5b95","year":2025},"citing_paper":{"arxiv_id":"2605.14333","last_updated":"2026-05-14T03:57:25Z","snapshot_observed_at":"2026-08-02T04:28:22.039399Z","submitted_at":"2026-05-14T03:57:25Z","title":"InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T02:10:18.004724Z"},"links":{"cited_paper":"/paper/2509.09680","citing_paper":"/paper/2605.14333"},"observation_digest":"sha256:74f0e54400ca0617bd8a59fd1b7c5d997e95165d00f9840ec90d31c7bd7469df","observation_id":"df3ef91b-bdce-4eab-b933-b60bd3102b55","resolution":{"observed_at":"2026-05-15T02:13:30.594327Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"cited_work":{"arxiv_id":"2509.09680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09680","snapshot_observed_at":"2026-06-30T06:54:20.702391Z","title":"Flux-reason-6m & prism-bench: A million-scale text-to-image reasoning dataset and comprehensive benchmark","venue":null,"work_id":"a70f3cb4-6936-439a-aef0-f14fde9a5b95","year":2025},"citing_paper":{"arxiv_id":"2605.14876","last_updated":"2026-05-15T05:10:39Z","snapshot_observed_at":"2026-08-02T23:16:15.609028Z","submitted_at":"2026-05-14T14:22:25Z","title":"Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T16:35:43.166697Z"},"links":{"cited_paper":"/paper/2509.09680","citing_paper":"/paper/2605.14876"},"observation_digest":"sha256:473a38432e2b8aedade4a8c719b58209b099a3908832e34ce013f075d0d6f511","observation_id":"fe9d9296-2407-4e88-90a3-9ca455a86712","resolution":{"observed_at":"2026-05-19T16:37:39.647701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"cited_work":{"arxiv_id":"2509.09680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09680","snapshot_observed_at":"2026-06-30T06:54:20.702391Z","title":"Flux-reason-6m & prism-bench: A million-scale text-to-image reasoning dataset and comprehensive benchmark","venue":null,"work_id":"a70f3cb4-6936-439a-aef0-f14fde9a5b95","year":2025},"citing_paper":{"arxiv_id":"2606.30124","last_updated":"2026-06-29T10:59:10Z","snapshot_observed_at":"2026-08-02T12:26:27.389877Z","submitted_at":"2026-06-29T10:59:10Z","title":"SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T06:48:22.594002Z"},"links":{"cited_paper":"/paper/2509.09680","citing_paper":"/paper/2606.30124"},"observation_digest":"sha256:fd32649dc5db25df3bc4aac946b17b5878ef354ddae48ef5b3aa611bd52ccf2d","observation_id":"6850081c-98f7-4258-831d-423ea5956fb1","resolution":{"observed_at":"2026-06-30T06:54:20.704034Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09680","snapshot_observed_at":"2026-08-01T15:42:58.828756Z","title":"Flux-reason-6m & prism-bench: A million-scale text-to-image reasoning dataset and comprehensive benchmark.arXiv preprint arXiv:2509.09680, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-06T02:32:50.045651Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:58.828756Z"},"links":{"cited_paper":"/paper/2509.09680","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:b301855bea4714b965892cbe088e7eb8e5821a0d4287df047d22d30de6c9ef4d","observation_id":"0b8bbb34-8a38-4ddd-9730-8cd48d5abea2","resolution":{"observed_at":"2026-08-01T15:42:58.828756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09680","snapshot_observed_at":"2026-08-04T04:09:49.613004Z","title":"Flux-reason-6m & prism-bench: A million-scale text-to-image reasoning dataset and comprehensive benchmark.arXiv preprint arXiv:2509.09680,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-07T04:06:20.351418Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:49.613004Z"},"links":{"cited_paper":"/paper/2509.09680","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:57e1bcf833da233643759ac17c204311925a5882b0012d38a95e287e37ca31f9","observation_id":"a87f0171-fe34-42dc-86dc-ead1f635dfe0","resolution":{"observed_at":"2026-08-04T04:09:49.613004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.09680/citation-record","integrity":"/paper/2509.09680/integrity","json":"/paper/2509.09680/citation-record.json","paper":"/paper/2509.09680"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T18:48:03.563904Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.563904Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:ac73fea4537ceb5ddb3be9bb06f76704877fc0ae400e5ea7f97b6d1bede40f1a","observation_id":"f94e70a3-b1a5-48c8-84da-86480cc79bb4","resolution":{"observed_at":"2026-08-04T18:48:03.563904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.570285Z","title":"Hrs-bench: Holistic, reliable and scalable benchmark for text-to-image models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.570285Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:1b61802529ce87126732adf4a8365f9e6bc1c48c76cfcc1fb63329d789949b70","observation_id":"43c2b44d-78a7-4e5d-bd7a-5685ed2424ae","resolution":{"observed_at":"2026-08-04T18:48:03.570285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.574995Z","title":"Flux, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.574995Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:4693c0300389246ed789ff55388908b2190216823d790c46486bb843e1f22e9a","observation_id":"0e83f8f1-4be9-4566-8f41-c96b1d33e98a","resolution":{"observed_at":"2026-08-04T18:48:03.574995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.579471Z","title":"Flux.1 krea, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.579471Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:b92cf063bfc33119ad4cab1c902845e5dbffde47db78c3af978243cc30f18088","observation_id":"44bd8c79-4409-4e9f-91aa-a0c4607246f6","resolution":{"observed_at":"2026-08-04T18:48:03.579471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22705","last_updated":"2025-05-28T17:59:15Z","snapshot_observed_at":"2026-07-30T00:45:52.058972Z","submitted_at":"2025-05-28T17:59:15Z","title":"HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22705","snapshot_observed_at":"2026-08-04T18:48:03.584164Z","title":"Hidream-i1: A high-efficient image generative foundation model with sparse diffusion transformer.arXiv preprint arXiv:2505.22705, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.584164Z"},"links":{"cited_paper":"/paper/2505.22705","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:7116c71254ad82f5e070d9d9dfa7e2eee2eabbda875fab04461531a6c4b6af31","observation_id":"01df3abc-a748-4c1f-897a-12ea03a3e2d2","resolution":{"observed_at":"2026-08-04T18:48:03.584164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.588996Z","title":"Conceptual 12m: Pushing web- scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.588996Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:c055ccc548e665303b7a830134f220df776d73cdf77a7c0c4edc9d5b0bd8af5f","observation_id":"8744a1d0-620d-4afb-8e54-d2144bda7a69","resolution":{"observed_at":"2026-08-04T18:48:03.588996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.594301Z","title":"Attend-and-excite: Attention- based semantic guidance for text-to-image diffusion models.ACM transactions on Graphics (TOG), 42 (4):1–10, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.594301Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:b43066d46a9555aa6899d6fe8a8ccf8aa82fbbac46d6c9b962fffb0ba677ef68","observation_id":"0d15c85a-743b-404b-a2bd-92fb6e79b5df","resolution":{"observed_at":"2026-08-04T18:48:03.594301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.598554Z","title":"Textdiffuser: Diffusion models as text painters.Advances in Neural Information Processing Systems, 36:9353–9387, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.598554Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:eca33b9d2ac40b61c8197ffbf7304f6823f67f7d81ab63d392770e8e32036005","observation_id":"e03adb8d-a695-4f2b-a510-211206bdb279","resolution":{"observed_at":"2026-08-04T18:48:03.598554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-04T18:48:03.602753Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset.arXiv preprint arXiv:2505.09568, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.602753Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:f5fa21d37996935b7589f2aecbccdd4e78a66cddddcce94f0307976a9de65350","observation_id":"d11eda94-b037-487d-b91b-fb9edf9641a0","resolution":{"observed_at":"2026-08-04T18:48:03.602753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-04T18:48:03.608245Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.608245Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:696e19429a50f681bc6ce916434c2ed8b113c0e68d7ff5789e343559c3503349","observation_id":"d52c7b55-7cc0-4e1a-b710-fc45ed3298d6","resolution":{"observed_at":"2026-08-04T18:48:03.608245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10741","last_updated":"2025-06-12T14:28:12Z","snapshot_observed_at":"2026-08-07T04:16:58.919477Z","submitted_at":"2025-06-12T14:28:12Z","title":"PosterCraft: Rethinking High-Quality Aesthetic Poster Generation in a Unified Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10741","snapshot_observed_at":"2026-08-04T18:48:03.613130Z","title":"Postercraft: Rethinking high-quality aesthetic poster generation in a unified framework.arXiv preprint arXiv:2506.10741, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.613130Z"},"links":{"cited_paper":"/paper/2506.10741","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:87e44890c378e2d28e9ca101d0ecd3fa81dcd365869e97e40bb6646b59b21804","observation_id":"61fb0654-ee82-4366-9b49-ebdf97ab9ccb","resolution":{"observed_at":"2026-08-04T18:48:03.613130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-04T18:48:03.618107Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling.arXiv preprint arXiv:2501.17811, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.618107Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:202c2cb41a0659e6a0bb593ade0a1bfd554914a39d63eeca854ac783239eb9be","observation_id":"493d2111-f5c4-4ee3-847f-f6256d730c5a","resolution":{"observed_at":"2026-08-04T18:48:03.618107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18235","last_updated":"2024-03-13T21:58:59Z","snapshot_observed_at":"2026-07-06T16:39:32.455002Z","submitted_at":"2023-10-27T16:20:10Z","title":"Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18235","snapshot_observed_at":"2026-08-04T18:48:03.622457Z","title":"Davidsonian scene graph: Improving reliability in fine-grained evaluation for text-to-image generation.arXiv preprint arXiv:2310.18235, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.622457Z"},"links":{"cited_paper":"/paper/2310.18235","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:db4733f47f791cdaf9bc915f03444336149bc14eb6fc0cb778ed0187541eba4f","observation_id":"1e079fd0-bf99-4dbb-9b5a-b28863b6d373","resolution":{"observed_at":"2026-08-04T18:48:03.622457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-04T18:48:03.626833Z","title":"Emerging properties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.626833Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:bcf04dcd507d77da5927f1d0b21ba4ed81885ea2ba7ec0261768f3be9277a1cd","observation_id":"102199fd-c156-441e-b7d0-d8e8ef9efe48","resolution":{"observed_at":"2026-08-04T18:48:03.626833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17022","last_updated":"2026-04-12T04:05:04Z","snapshot_observed_at":"2026-07-06T21:28:43.610849Z","submitted_at":"2025-05-22T17:59:58Z","title":"GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17022","snapshot_observed_at":"2026-08-04T18:48:03.631140Z","title":"Got-r1: Unleashing reasoning capability of mllm for visual generation with reinforcement learning.arXiv preprint arXiv:2505.17022, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.631140Z"},"links":{"cited_paper":"/paper/2505.17022","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:44493710243f933e499d1e959185137c1322603dbbb599e29bb9bd6fca450f0c","observation_id":"5aa4c4a5-d4bd-4dba-a56a-700e5605e989","resolution":{"observed_at":"2026-08-04T18:48:03.631140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.635989Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.635989Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:78a796e3499dd459d7c5a784b1b0da16146b19994111d3e0b23e055d7deacc14","observation_id":"9c2c9c9f-153d-4808-aad0-f3dc622ed302","resolution":{"observed_at":"2026-08-04T18:48:03.635989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13861","last_updated":"2024-10-21T15:42:46Z","snapshot_observed_at":"2026-07-06T19:35:30.732080Z","submitted_at":"2024-10-17T17:59:57Z","title":"PUMA: Empowering Unified MLLM with Multi-granular Visual Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13861","snapshot_observed_at":"2026-08-04T18:48:03.640677Z","title":"Puma: Empowering unified mllm with multi-granular visual generation.arXiv preprint arXiv:2410.13861, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.640677Z"},"links":{"cited_paper":"/paper/2410.13861","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:7a166594be538ef5c2768581e915d41e76fd6f14e94aad70fb4770862951b0a1","observation_id":"c3c5cd98-926e-4ae3-afbd-c637bb033a3c","resolution":{"observed_at":"2026-08-04T18:48:03.640677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-04T18:48:03.645811Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv preprint arXiv:2503.10639, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.645811Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:5958c2a343704c373b616b4d6128f65d394fc431b44e065dd8d8ef6efcf50840","observation_id":"15feb0bb-9423-4260-a030-ccd50ba0b956","resolution":{"observed_at":"2026-08-04T18:48:03.645811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-04T03:38:52.868510Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-04T18:48:03.650851Z","title":"Training-free structured diffusion guidance for compositional text-to-image synthesis.arXiv preprint arXiv:2212.05032, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.650851Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:f814a166f9bb33b0a697e316298f8e3cee21e9affa45fac558d97927bc921443","observation_id":"0f6fadec-312e-44c2-b44d-623bec1bce2f","resolution":{"observed_at":"2026-08-04T18:48:03.650851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07546","last_updated":"2024-08-12T19:33:52Z","snapshot_observed_at":"2026-07-06T18:29:08.586253Z","submitted_at":"2024-06-11T17:59:48Z","title":"Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07546","snapshot_observed_at":"2026-08-04T18:48:03.655845Z","title":"Commonsense-t2i challenge: Can text-to-image generation models understand commonsense?arXiv preprint arXiv:2406.07546, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.655845Z"},"links":{"cited_paper":"/paper/2406.07546","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:3f54511d47ba161ae4274a8a8cdb3ad9e98e92df82404dd29e526aa4dcdabd2f","observation_id":"66c32426-e674-488e-8e1d-aaad6cc0f225","resolution":{"observed_at":"2026-08-04T18:48:03.655845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.661172Z","title":"Datacomp: In search of the next generation of multimodal datasets.Advances in Neural Information Processing Systems, 36:27092–27112, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.661172Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:9d75f51c9854dd94ee9efbd1af09b30e7d16f2c63cb56a1950fe1c661a091258","observation_id":"4a359ab1-f411-42fc-9429-91ab5da67e97","resolution":{"observed_at":"2026-08-04T18:48:03.661172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11346","last_updated":"2025-06-28T11:46:35Z","snapshot_observed_at":"2026-07-06T21:09:50.780345Z","submitted_at":"2025-04-15T16:19:07Z","title":"Seedream 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11346","snapshot_observed_at":"2026-08-04T18:48:03.665647Z","title":"Seedream 3.0 technical report.arXiv preprint arXiv:2504.11346, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.665647Z"},"links":{"cited_paper":"/paper/2504.11346","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:49c07e0d55264fdc0c4356683fee758cf90f949c00f3475c031e46d3ebcde0bc","observation_id":"22dd52d8-9ef1-4103-bfb2-6d994cfa619d","resolution":{"observed_at":"2026-08-04T18:48:03.665647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.670397Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment.Advances in Neural Information Processing Systems, 36:52132– 52152, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.670397Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:0261c5cb96978e7361dbbd58b72d408a4953b415dad85463690e08299f05f082","observation_id":"1d147607-e9e8-4fc6-9e11-1252bb0c4383","resolution":{"observed_at":"2026-08-04T18:48:03.670397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07703","last_updated":"2025-03-10T17:58:33Z","snapshot_observed_at":"2026-07-06T20:50:09.622181Z","submitted_at":"2025-03-10T17:58:33Z","title":"Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07703","snapshot_observed_at":"2026-08-04T18:48:03.674844Z","title":"Seedream 2.0: A native chinese-english bilingual image generation foundation model.arXiv preprint arXiv:2503.07703, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.674844Z"},"links":{"cited_paper":"/paper/2503.07703","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:5d673eb267746c8d1be1346257fd05ae31e86d4868524d370b42d2d47fdeaf7b","observation_id":"20adb2b8-4782-4348-8e6b-348dc4ba1ab5","resolution":{"observed_at":"2026-08-04T18:48:03.674844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.679408Z","title":"Gemini2.5-pro, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.679408Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:5066c2bd0927ff024a8a972ed35f92d68ca8798e1f5f4ba700cab942f384d6cd","observation_id":"a7103d71-2262-4a62-a77e-d9d3114b67ba","resolution":{"observed_at":"2026-08-04T18:48:03.679408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.683844Z","title":"Imagen4, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.683844Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:eca1420fbb8cf0c9bfd4c110ede9a6b39ef69d3cabf8f561f566199c671265df","observation_id":"a4855d2b-abd7-4496-988e-e78d7d438bb5","resolution":{"observed_at":"2026-08-04T18:48:03.683844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.688106Z","title":"Gemini2.5-flash-image, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.688106Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:007bb725311acc2767c46887a5ce949f03a0e65edaa377d4ab3445b072a80864","observation_id":"88f7b782-fd25-43b6-a00a-426d7ba02dfe","resolution":{"observed_at":"2026-08-04T18:48:03.688106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-07-06T20:12:35.886724Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18150","snapshot_observed_at":"2026-08-04T18:48:03.692481Z","title":"Evalmuse-40k: A reliable and fine-grained benchmark with comprehensive human annotations for text-to-image generation model evaluation.arXiv preprint arXiv:2412.18150, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.692481Z"},"links":{"cited_paper":"/paper/2412.18150","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:dc9c3d5e9effddb7f2bfbf18fc6fb84146096ed6f6b8f3972ff5b1b9f3c09bbb","observation_id":"f050f52b-e189-4d85-9826-0aa32acfc810","resolution":{"observed_at":"2026-08-04T18:48:03.692481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-04T18:48:03.697231Z","title":"Clipscore: A reference- free evaluation metric for image captioning.arXiv preprint arXiv:2104.08718, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.697231Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:42d52109fc774fe90f94a8fb770ac8b2a42cb3850770fc0558106614d7af2c54","observation_id":"6f6cefc9-a127-45e4-9762-eedb1cfcf7f9","resolution":{"observed_at":"2026-08-04T18:48:03.697231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.701850Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.701850Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:a20b942f692ca35ab97e292c9e690346730edcc8075d021f7b710a4595035723","observation_id":"d3674176-1a2c-4c13-a57e-88a56dbbaee2","resolution":{"observed_at":"2026-08-04T18:48:03.701850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.706247Z","title":"Scaling up vision-language pre-training for image captioning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.706247Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:77b6c980f462df042549ac60329e24706502c8f04dec22b9e6c39c81cb5f43c0","observation_id":"b0fb7470-f858-49c1-a777-2b6f6d7da733","resolution":{"observed_at":"2026-08-04T18:48:03.706247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-04T18:48:03.710756Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment.arXiv preprint arXiv:2403.05135, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.710756Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:0c2eba5ee0718bb1f8102b2c1e000cf4aea168838c481bf383198ddf51db78c4","observation_id":"bb319ba8-5638-4b97-a767-a9b0cb625bb2","resolution":{"observed_at":"2026-08-04T18:48:03.710756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.715302Z","title":"Tifa: Accurate and interpretable text-to-image faithfulness evaluation with question answer- ing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.715302Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:2482c2936c3f4c9b7a0d851abb18d3eff3b771d1704f8bab5158fd3cc8238d80","observation_id":"d87c14be-6654-48a6-9516-ba005052566b","resolution":{"observed_at":"2026-08-04T18:48:03.715302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.719868Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation.Advances in Neural Information Processing Systems, 36:78723–78747, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.719868Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:9afa203cf2da12c69d4997d8db5e2c2fa2d6cbac52c1a16ec58694d171956bb3","observation_id":"c7fce712-9928-48a5-b394-133de9993800","resolution":{"observed_at":"2026-08-04T18:48:03.719868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.724083Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.724083Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:65f8dcfe90b37e7d316689a62c229be76470e66201533840987f37492e87c697","observation_id":"7944bef0-bd39-4828-a8ff-83ebf1886063","resolution":{"observed_at":"2026-08-04T18:48:03.724083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.728017Z","title":"Genetic k-means algorithm.IEEE Transactions on Systems, Man, and Cybernetics, Part B (Cybernetics), 29(3):433–439, 1999","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.728017Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:d48c72dc0ad6236da651561da3d9c2486d2468e636da9900ad905d41a9c8dc53","observation_id":"19fe8c2c-f8bf-4602-a64b-228326cd7725","resolution":{"observed_at":"2026-08-04T18:48:03.728017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13743","last_updated":"2024-11-03T20:22:32Z","snapshot_observed_at":"2026-07-30T19:48:58.731788Z","submitted_at":"2024-06-19T18:00:07Z","title":"GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13743","snapshot_observed_at":"2026-08-04T18:48:03.732027Z","title":"Genai-bench: Evaluating and improving compositional text-to-visual generation.arXiv preprint arXiv:2406.13743, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.732027Z"},"links":{"cited_paper":"/paper/2406.13743","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:92f44d1d191038e6303cbeab446c8c969c078b2a9096cb7f516df3af1b9ef07d","observation_id":"817fe4d2-c078-4b26-b7d9-ae1f0aec9d92","resolution":{"observed_at":"2026-08-04T18:48:03.732027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-04T18:48:03.736630Z","title":"Playground v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.736630Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:0cbf1b7be723a3081cd9d4eacd6d73cc7e94a82678cf9226dcaf2019c5fa77c0","observation_id":"b6ce2eb6-4a67-476f-b610-2c536fc11828","resolution":{"observed_at":"2026-08-04T18:48:03.736630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.741275Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.741275Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:b7c57d60b01f1bab71939eb2736e3d1fd155bf7235d636a8e470cd2af9811881","observation_id":"b371269d-14db-4774-babd-8ae7f7a9625d","resolution":{"observed_at":"2026-08-04T18:48:03.741275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-04T18:48:03.745641Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding.arXiv preprint arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.745641Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:ae9e715917c4c4f0b743bf2fad3ccf824eb96779473556c7a8d6d01d8ff9892f","observation_id":"0356551c-13d7-480c-8ac5-f129a797c09f","resolution":{"observed_at":"2026-08-04T18:48:03.745641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.749799Z","title":"Nuwa-infinity: Autoregressive over autoregressive generation for infinite visual synthesis.Advances in Neural Information Processing Systems, 35:15420–15432, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.749799Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:2fcb429e41e4c2a19f6b54a9e7afa7ab40043590519da06d9e710fe1fe57015f","observation_id":"c24289ca-fdc0-419f-a700-62dc2927313b","resolution":{"observed_at":"2026-08-04T18:48:03.749799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.754532Z","title":"Evaluating text-to-visual generation with image-to-text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.754532Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:9017548d9ede8c535eeaebc2c7748455d3347048685bf498766101a5199051e8","observation_id":"2157b36c-7885-484e-a4f1-3c621f24ba8b","resolution":{"observed_at":"2026-08-04T18:48:03.754532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-04T18:48:03.759187Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow.arXiv preprint arXiv:2209.03003, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.759187Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:8f2c9e0ac5cd6887f66ff1f01e3d890f4a7de5ef0ef0c3f4bb17336e25c3bc7d","observation_id":"8ca082a6-7773-467d-af2e-1bcf828cd6e2","resolution":{"observed_at":"2026-08-04T18:48:03.759187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.764203Z","title":"Summarizing emotions from text using plutchik’s wheel of emotions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.764203Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:1a9aacc02b6b14974dac03898242dc61856850fcc042d26917bcecc994b8ae65","observation_id":"dda439af-19b4-429b-938c-c35248794e9a","resolution":{"observed_at":"2026-08-04T18:48:03.764203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.768998Z","title":"Gpt-4.1, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.768998Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:81a0a0a5c3e4e23693561e4cf785bc1588bd6010cdd15772a17ae316caacac9d","observation_id":"3d5ed760-fcb6-457c-a127-e274c368c6a3","resolution":{"observed_at":"2026-08-04T18:48:03.768998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.773709Z","title":"Gpt-image-1, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.773709Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:5e0711712b7ef3aa62a23bbb832f9595304756c06c2ef3faa04c880fdfd466d7","observation_id":"14637733-d07d-4f0d-a3a7-94d010d9e8fa","resolution":{"observed_at":"2026-08-04T18:48:03.773709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.778454Z","title":"Dall·e 3, September 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.778454Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:87f313b7a1c85dedd3a11ac294277c27016cad0cee96aa0be3761e314273f1f4","observation_id":"b8bc7723-71da-420b-afb6-57ca6ea7c95e","resolution":{"observed_at":"2026-08-04T18:48:03.778454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-04T18:48:03.782559Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.782559Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:d7226034293d067c1f1b586eee439fd9b3ae45c60b3f04b56b7f6f5bb8fb94e8","observation_id":"20cb7434-a7c0-466f-a31e-d8119da7e8d8","resolution":{"observed_at":"2026-08-04T18:48:03.782559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21758","last_updated":"2025-03-27T17:57:07Z","snapshot_observed_at":"2026-08-07T16:59:27.482089Z","submitted_at":"2025-03-27T17:57:07Z","title":"Lumina-Image 2.0: A Unified and Efficient Image Generative Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21758","snapshot_observed_at":"2026-08-04T18:48:03.787032Z","title":"Lumina-image 2.0: A unified and efficient image generative framework.arXiv preprint arXiv:2503.21758, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.787032Z"},"links":{"cited_paper":"/paper/2503.21758","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:499ba1264e0a95685c87d6734bdd4dc583879df9b6ca234bbe764a3323057595","observation_id":"cbbeac40-3f01-459a-84ed-0493b3223119","resolution":{"observed_at":"2026-08-04T18:48:03.787032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.791588Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.791588Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:73214173a90a3944cd8870afa427dd053345b71222bb60f844adf23c28d6d605","observation_id":"e2299ed6-5290-44bf-9101-c6001ce104c8","resolution":{"observed_at":"2026-08-04T18:48:03.791588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.795622Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in neural information processing systems, 35:25278–25294, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.795622Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:960d5a05269fa473b318147e22f6f5826da1b8f2bbadd5e4215e41cdef0a0b99","observation_id":"00b83a60-5eb1-4ff5-8eb9-0d3a3afa232f","resolution":{"observed_at":"2026-08-04T18:48:03.795622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.799595Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.799595Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:9a435ca55ff8947a21c4699b57b98f5dc9348af74d5f4e55432106b69b9f00eb","observation_id":"bb70cb03-f76e-4543-bde6-2c52f6442a69","resolution":{"observed_at":"2026-08-04T18:48:03.799595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-04T18:48:03.803853Z","title":"From pixels to prose: A large dataset of dense image captions.arXiv preprint arXiv:2406.10328, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.803853Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:4aa5b0635eca543f5b09970f65eee32928e64dcf6d4f054b278fe09efbfcd830","observation_id":"a40919a6-6724-4fa7-b093-3f5f9d14a557","resolution":{"observed_at":"2026-08-04T18:48:03.803853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.808078Z","title":"Stable diffusion 2.1, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.808078Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:7592942c99f3b7ecc8a4583dab9025ba6b7559207f009259ff8aeb8720f4a18f","observation_id":"767ffcd6-8a63-472b-838c-284ae1be0a57","resolution":{"observed_at":"2026-08-04T18:48:03.808078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.812209Z","title":"Stable diffusion 3, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.812209Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:0f22181696af369c04428d0d710b5be2dbdc53eb083a923163d7790dda503850","observation_id":"c8ce336c-b8b7-4bfa-a370-63d1d229dd7f","resolution":{"observed_at":"2026-08-04T18:48:03.812209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.816335Z","title":"Stable diffusion 3.5, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.816335Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:39dca45424a08f8b0065051d18cce097d3f174c9afbbec81a88a536f126dde1e","observation_id":"6437c0c5-32ed-4980-8808-28a8ca0458c8","resolution":{"observed_at":"2026-08-04T18:48:03.816335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17472","last_updated":"2025-08-24T17:59:38Z","snapshot_observed_at":"2026-08-05T16:56:27.362307Z","submitted_at":"2025-08-24T17:59:38Z","title":"T2I-ReasonBench: Benchmarking Reasoning-Informed Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17472","snapshot_observed_at":"2026-08-04T18:48:03.820245Z","title":"T2i-reasonbench: Benchmarking reasoning-informed text-to-image generation.arXiv preprint arXiv:2508.17472, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.820245Z"},"links":{"cited_paper":"/paper/2508.17472","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:bbc4abc2dd2e41cba8bcb838b820a838b7b40192e9c7ab162892b447577981f8","observation_id":"05a59200-9ff6-43f0-b1f9-ba3cd7497707","resolution":{"observed_at":"2026-08-04T18:48:03.820245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.824740Z","title":"Journeydb: A benchmark for generative image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.824740Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:2e8ffcfdcdad4dc302fa53f2f2ac6c54d3725fb654e0c8741cf6540a337cb62a","observation_id":"9d54b302-4927-4779-9b8d-1947f2a21fa7","resolution":{"observed_at":"2026-08-04T18:48:03.824740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03054","last_updated":"2024-02-21T07:12:45Z","snapshot_observed_at":"2026-07-06T16:43:30.807088Z","submitted_at":"2023-11-06T12:10:43Z","title":"AnyText: Multilingual Visual Text Generation And Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03054","snapshot_observed_at":"2026-08-04T18:48:03.828806Z","title":"Anytext: Multilingual visual text generation and editing.arXiv preprint arXiv:2311.03054, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.828806Z"},"links":{"cited_paper":"/paper/2311.03054","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:3d766e44511a0122c31f8a99e010d9fdb5e701a5d7abadba07cf910b78cf6aeb","observation_id":"d8dfc13f-ab11-4415-b4fb-afc6ddb6ecd0","resolution":{"observed_at":"2026-08-04T18:48:03.828806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.832885Z","title":"Textatlas5m: A large-scale dataset for dense text image generation.arXiv preprint arXiv:2502.07870, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.832885Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:a65baace43e8bd7b110dc4489d406e8b2527061a26b6cba0d1203a5fe6835c3f","observation_id":"9314c1d1-ec1f-4db1-867a-30d8c7dfebc2","resolution":{"observed_at":"2026-08-04T18:48:03.832885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.836817Z","title":"Nuwa: Visual synthesis pre-training for neural visual world creation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.836817Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:ba43d6b6bc2736fa20d8c679d2640d31335d8427521136f32146284f5eb89ebb","observation_id":"7a952e4b-07f4-4ffa-92fe-5179ad069cae","resolution":{"observed_at":"2026-08-04T18:48:03.836817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-04T18:48:03.840789Z","title":"Qwen-image technical report.arXiv preprint arXiv:2508.02324, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.840789Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:4e732d1f06c16988919ce91d49c353cda18ab303e28cb3040981ad57d0762614","observation_id":"7d331a1d-46c9-4d4d-b0a4-e012fdae3b65","resolution":{"observed_at":"2026-08-04T18:48:03.840789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-04T18:48:03.845193Z","title":"Omnigen2: Exploration to advanced multimodal generation.arXiv preprint arXiv:2506.18871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.845193Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:7c8f44f82909cfac0b685b7d9093c671e0fc7715bda61e388de90b2d0302ec2c","observation_id":"41db8f31-f4b4-4a70-b193-2734420b0857","resolution":{"observed_at":"2026-08-04T18:48:03.845193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-04T18:48:03.849652Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis.arXiv preprint arXiv:2306.09341, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.849652Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:f615ad0036ca1976d7c723f70ab6ec90abca2c2f5845259b6fc941b4f6e6de62","observation_id":"938a92ab-78fd-47e7-a096-b670c3016288","resolution":{"observed_at":"2026-08-04T18:48:03.849652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.854018Z","title":"Conceptmix: A com- positional image generation benchmark with controllable difficulty.Advances in Neural Information Processing Systems, 37:86004–86047, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.854018Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:e8b530f750d738e0816967a7fc454c5a241837dcf88377574f42419873dc219e","observation_id":"d8d8bce3-6b48-4a3e-9891-050a87ba4cf2","resolution":{"observed_at":"2026-08-04T18:48:03.854018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18427","last_updated":"2025-05-17T13:26:31Z","snapshot_observed_at":"2026-08-06T13:34:35.279373Z","submitted_at":"2025-01-30T15:31:48Z","title":"SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18427","snapshot_observed_at":"2026-08-04T18:48:03.858574Z","title":"Sana 1.5: Efficient scaling of training-time and inference-time compute in linear diffusion transformer.arXiv preprint arXiv:2501.18427, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.858574Z"},"links":{"cited_paper":"/paper/2501.18427","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:3d343fc3b921abd124afc59281ae0537fdb03c12821f166440070a9191c14ca8","observation_id":"29c414a0-efcf-470c-a956-7d6eb10b54d1","resolution":{"observed_at":"2026-08-04T18:48:03.858574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15564","snapshot_observed_at":"2026-08-04T18:48:03.862906Z","title":"Show-o2: Improved native unified multimodal models.arXiv preprint arXiv:2506.15564, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.862906Z"},"links":{"cited_paper":"/paper/2506.15564","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:dd818426dadaca8a17889fac4e460ed6159fa87e8008c09d950ed0af3daa8559","observation_id":"e6ece735-e814-416a-ba27-7dc34e34b37f","resolution":{"observed_at":"2026-08-04T18:48:03.862906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T18:48:03.867345Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.867345Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:88be7134c89f64ef7bc481a75a873a1fef9e93d9ea2564c608f9befbf79faf55","observation_id":"db94fd1b-4d1a-4e33-80da-4069954ad002","resolution":{"observed_at":"2026-08-04T18:48:03.867345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-04T18:48:03.872017Z","title":"Scaling autoregressive models for content-rich text-to-image generation.arXiv preprint arXiv:2206.10789, 2(3):5, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.872017Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:796b492ead4232d27ba3834a02c3b451404e1d7192e277e4fb85847dc1bb7a69","observation_id":"d6030455-2072-4d5c-8360-fa3b2aee2280","resolution":{"observed_at":"2026-08-04T18:48:03.872017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.876743Z","title":"Capsfusion: Rethinking image-text data at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.876743Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:bdfdd47fdd4c9f16e943414456484a7ab49bd66ec36d47c12053d00d09238b4d","observation_id":"5216cd83-fb07-494a-a7c0-8828e1a8916c","resolution":{"observed_at":"2026-08-04T18:48:03.876743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00529","last_updated":"2021-03-10T01:27:16Z","snapshot_observed_at":"2026-08-03T19:27:03.174412Z","submitted_at":"2021-01-02T23:35:27Z","title":"VinVL: Revisiting Visual Representations in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00529","snapshot_observed_at":"2026-08-04T18:48:03.880972Z","title":"Vinvl: Making visual representations matter in vision-language models.arXiv preprint arXiv:2101.00529, 1(6):8, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.880972Z"},"links":{"cited_paper":"/paper/2101.00529","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:3b7df5e1957e7040165362df1de2166e3adb74f1d87deb8d6047ba2ba54c36a5","observation_id":"700b9ab6-fd88-4774-99c9-fa3b8739461a","resolution":{"observed_at":"2026-08-04T18:48:03.880972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:48:03.885237Z","title":"Lumina-next: Making lumina-t2x stronger and faster with next-dit.Advances in Neural Information Processing Systems, 37:131278–131315, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.885237Z"},"links":{"citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:97d71d85b2d6bc26ea433dc3fd6b861441c2411452e889e1acad532c863be09e","observation_id":"8da24999-f075-454c-88ba-faedb3fde794","resolution":{"observed_at":"2026-08-04T18:48:03.885237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":72,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 10 inbound Pith citation observations for arXiv:2509.09680."}