{"as_of":"2026-08-06T15:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:63cda17a2fd970b578ae9462813d22609a09c8648e4e56b31f2a45b154518807","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T22:55:44.984216Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:44:28.524092Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:39:58.253188Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-08-03T17:06:55.166111Z","title":"Interleaving rea- soning for better text-to-image generation.arXiv preprint arXiv:2509.06945, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.166111Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:8e2802af84ebadf3e3f1e0942aec6d872666d89fbefeea6b6c6bf5f5baa011cd","observation_id":"7a4ba74c-4fae-4ac1-a9d8-8357d14b0a7a","resolution":{"observed_at":"2026-08-03T17:06:55.166111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2509.06945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-07-04T16:39:58.253188Z","title":"Interleaving reasoning for better text-to-image generation","venue":null,"work_id":"d8284b77-8931-4f0c-bf78-042627e2d030","year":2025},"citing_paper":{"arxiv_id":"2603.01070","last_updated":"2026-04-28T01:29:21Z","snapshot_observed_at":"2026-07-06T22:47:28.681790Z","submitted_at":"2026-03-01T12:18:12Z","title":"How RL Unlocks the Aha Moment in Geometric Interleaved Reasoning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T18:16:25.372627Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2603.01070"},"observation_digest":"sha256:7d528494467a79fbb96dc80727735aa3c6248e44822a2eed3cf39bd8d5e73648","observation_id":"685c24f6-8ff2-4100-87cb-c52c064ff8e9","resolution":{"observed_at":"2026-05-15T18:20:14.441950Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-07-12T22:22:06.385856Z","title":"Interleaving reasoning for better text-to-image generation.arXiv preprint arXiv:2509.06945, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10783","last_updated":"2026-05-25T13:18:36Z","snapshot_observed_at":"2026-07-12T22:21:23.393919Z","submitted_at":"2026-04-12T19:18:02Z","title":"Learning Preference-Based Objectives from Clinical Narratives for Dynamic Sepsis Treatment","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T22:22:06.385856Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2604.10783"},"observation_digest":"sha256:6197597181c5abf258e496e458ebf47b4682594b2e05e0432da0758501b50ade","observation_id":"b316f3e0-46ec-46b5-8fb3-fd08f3daa2ec","resolution":{"observed_at":"2026-07-12T22:22:06.385856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2509.06945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-07-04T16:39:58.253188Z","title":"Interleaving reasoning for better text-to-image generation","venue":null,"work_id":"d8284b77-8931-4f0c-bf78-042627e2d030","year":2025},"citing_paper":{"arxiv_id":"2604.10784","last_updated":"2026-05-19T19:12:18Z","snapshot_observed_at":"2026-07-06T22:59:18.756089Z","submitted_at":"2026-04-12T19:19:04Z","title":"TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T15:32:01.551829Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2604.10784"},"observation_digest":"sha256:16a83867c015138ec1c82a94fdc97fc4ee4570bb8b995d49825af655e125b43e","observation_id":"c5f51071-fd0f-44b1-a625-9e7400416a2c","resolution":{"observed_at":"2026-05-11T10:21:03.058943Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2509.06945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-07-04T16:39:58.253188Z","title":"Interleaving reasoning for better text-to-image generation","venue":null,"work_id":"d8284b77-8931-4f0c-bf78-042627e2d030","year":2025},"citing_paper":{"arxiv_id":"2604.10784","last_updated":"2026-05-19T19:12:18Z","snapshot_observed_at":"2026-07-06T22:59:18.756089Z","submitted_at":"2026-04-12T19:19:04Z","title":"TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T08:59:10.877437Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2604.10784"},"observation_digest":"sha256:7ebceffb87540c4051d4009fc1cffbe1ee99ffab1abf744487f7d0f28bba82c6","observation_id":"3f383230-214a-4a49-86a1-679e9d4442f1","resolution":{"observed_at":"2026-05-21T08:59:55.292592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2509.06945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-07-04T16:39:58.253188Z","title":"Interleaving reasoning for better text-to-image generation","venue":null,"work_id":"d8284b77-8931-4f0c-bf78-042627e2d030","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:6dfa364bde573e7c354baf0839c55a440f6f3022146cb077d0361e31036fa160","observation_id":"78c1b218-e674-4b05-b64c-8811eeaa877c","resolution":{"observed_at":"2026-05-11T21:41:19.288085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2509.06945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-07-04T16:39:58.253188Z","title":"Interleaving reasoning for better text-to-image generation","venue":null,"work_id":"d8284b77-8931-4f0c-bf78-042627e2d030","year":2025},"citing_paper":{"arxiv_id":"2604.25636","last_updated":"2026-04-28T13:36:03Z","snapshot_observed_at":"2026-07-06T23:11:25.757664Z","submitted_at":"2026-04-28T13:36:03Z","title":"Refinement via Regeneration: Enlarging Modification Space Boosts Image Refinement in Unified Multimodal Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-07T16:55:19.763050Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2604.25636"},"observation_digest":"sha256:57fa7a8bb1dc08439dbffdc02b62e949d988913d18849f63006dc6560ae6c44a","observation_id":"b890564b-ba3d-47d4-89d5-74e044db0147","resolution":{"observed_at":"2026-05-11T23:31:14.310799Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2509.06945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-07-04T16:39:58.253188Z","title":"Interleaving reasoning for better text-to-image generation","venue":null,"work_id":"d8284b77-8931-4f0c-bf78-042627e2d030","year":2025},"citing_paper":{"arxiv_id":"2605.08043","last_updated":"2026-05-08T17:32:30Z","snapshot_observed_at":"2026-07-06T23:20:19.821342Z","submitted_at":"2026-05-08T17:32:30Z","title":"SCOPE: Structured Decomposition and Conditional Skill Orchestration for Complex Image Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-11T02:27:36.104714Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2605.08043"},"observation_digest":"sha256:faca0d1a8e9e5e4bd59ece3c9ef386eac0252a3c803d2ce1b03fae162f99ce9e","observation_id":"d1ab0b94-b4e9-4270-915d-cad94ddabee2","resolution":{"observed_at":"2026-05-11T03:30:57.539775Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2509.06945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-07-04T16:39:58.253188Z","title":"Interleaving reasoning for better text-to-image generation","venue":null,"work_id":"d8284b77-8931-4f0c-bf78-042627e2d030","year":2025},"citing_paper":{"arxiv_id":"2605.08063","last_updated":"2026-05-24T05:25:48Z","snapshot_observed_at":"2026-08-02T18:58:31.704300Z","submitted_at":"2026-05-08T17:50:15Z","title":"Flow-OPD: On-Policy Distillation for Flow Matching Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T02:04:16.335479Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2605.08063"},"observation_digest":"sha256:a27d3408b20219de50ff023f56c9226589d4f16b8d595e33e3b420f9f02ab18f","observation_id":"cd069034-a83f-49d8-b350-c40ee2a3e0bb","resolution":{"observed_at":"2026-05-11T04:00:54.250991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2509.06945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-07-04T16:39:58.253188Z","title":"Interleaving reasoning for better text-to-image generation","venue":null,"work_id":"d8284b77-8931-4f0c-bf78-042627e2d030","year":2025},"citing_paper":{"arxiv_id":"2605.08063","last_updated":"2026-05-24T05:25:48Z","snapshot_observed_at":"2026-08-02T18:58:31.704300Z","submitted_at":"2026-05-08T17:50:15Z","title":"Flow-OPD: On-Policy Distillation for Flow Matching Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T01:17:08.955601Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2605.08063"},"observation_digest":"sha256:8ac568f4ecedf40ad6bd3762a9504adfb83f17f8da02ccb0d84f0c97224a77dd","observation_id":"e91cf0d4-220b-4294-bbb2-e2c4dc308fb7","resolution":{"observed_at":"2026-05-13T01:27:02.795232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2509.06945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-07-04T16:39:58.253188Z","title":"Interleaving reasoning for better text-to-image generation","venue":null,"work_id":"d8284b77-8931-4f0c-bf78-042627e2d030","year":2025},"citing_paper":{"arxiv_id":"2605.08063","last_updated":"2026-05-24T05:25:48Z","snapshot_observed_at":"2026-08-02T18:58:31.704300Z","submitted_at":"2026-05-08T17:50:15Z","title":"Flow-OPD: On-Policy Distillation for Flow Matching Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T05:52:26.736304Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2605.08063"},"observation_digest":"sha256:ac0376afadc3d2e7f1cefebeecd105b0eb60e0be041e07f615b2792c0673285c","observation_id":"b968cffc-d6c6-4451-a5bb-9ad3dae66c79","resolution":{"observed_at":"2026-05-15T05:55:05.137604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2509.06945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-07-04T16:39:58.253188Z","title":"Interleaving reasoning for better text-to-image generation","venue":null,"work_id":"d8284b77-8931-4f0c-bf78-042627e2d030","year":2025},"citing_paper":{"arxiv_id":"2605.08063","last_updated":"2026-05-24T05:25:48Z","snapshot_observed_at":"2026-08-02T18:58:31.704300Z","submitted_at":"2026-05-08T17:50:15Z","title":"Flow-OPD: On-Policy Distillation for Flow Matching Models","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T22:39:32.496303Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2605.08063"},"observation_digest":"sha256:533911577912791eee8e8c496574b086fd583d54eb430f882f9b44f7d4bf3434","observation_id":"d3b2a36d-e9d5-4c90-bf62-5f9a86decb77","resolution":{"observed_at":"2026-05-20T22:43:51.740816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2509.06945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-07-04T16:39:58.253188Z","title":"Interleaving reasoning for better text-to-image generation","venue":null,"work_id":"d8284b77-8931-4f0c-bf78-042627e2d030","year":2025},"citing_paper":{"arxiv_id":"2605.08063","last_updated":"2026-05-24T05:25:48Z","snapshot_observed_at":"2026-08-02T18:58:31.704300Z","submitted_at":"2026-05-08T17:50:15Z","title":"Flow-OPD: On-Policy Distillation for Flow Matching Models","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T23:02:29.120150Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2605.08063"},"observation_digest":"sha256:94eea119e4fce11f1fa168955c2fab939a3f90906969b5b059b82b7afd0bc4b1","observation_id":"b10ec737-893f-4828-8850-e260f3b6d7e4","resolution":{"observed_at":"2026-06-30T23:05:07.211199Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2509.06945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-07-04T16:39:58.253188Z","title":"Interleaving reasoning for better text-to-image generation","venue":null,"work_id":"d8284b77-8931-4f0c-bf78-042627e2d030","year":2025},"citing_paper":{"arxiv_id":"2605.11400","last_updated":"2026-05-12T01:43:57Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:43:57Z","title":"UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T01:29:23.774196Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2605.11400"},"observation_digest":"sha256:f0ff7af4dd01508a6d26436811b399080b17544da682c98ba79af4bb73781f9a","observation_id":"2480ca98-713e-4083-877f-7bcb775e4451","resolution":{"observed_at":"2026-05-13T01:47:04.938139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2509.06945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-07-04T16:39:58.253188Z","title":"Interleaving reasoning for better text-to-image generation","venue":null,"work_id":"d8284b77-8931-4f0c-bf78-042627e2d030","year":2025},"citing_paper":{"arxiv_id":"2605.14876","last_updated":"2026-05-15T05:10:39Z","snapshot_observed_at":"2026-08-02T23:16:15.609028Z","submitted_at":"2026-05-14T14:22:25Z","title":"Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T16:35:43.166697Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2605.14876"},"observation_digest":"sha256:dc4bcaea52c06bc21d9ee1004af7073568f8967b5b2942dbfd9b9c2d4c55deef","observation_id":"4d94f5ca-30ea-45a2-93af-68710ce439fb","resolution":{"observed_at":"2026-05-19T16:37:39.755072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2509.06945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-07-04T16:39:58.253188Z","title":"Interleaving reasoning for better text-to-image generation","venue":null,"work_id":"d8284b77-8931-4f0c-bf78-042627e2d030","year":2025},"citing_paper":{"arxiv_id":"2605.17766","last_updated":"2026-05-18T02:35:05Z","snapshot_observed_at":"2026-08-02T02:51:49.314780Z","submitted_at":"2026-05-18T02:35:05Z","title":"LatentUMM: Dual Latent Alignment for Unified Multimodal Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T12:39:28.058049Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2605.17766"},"observation_digest":"sha256:683e8d9357c9a300e958cbc13153c3b7bcef88723fd510f0688850d315bfda00","observation_id":"28de1f0c-778d-4778-bf02-b61f1fa7d7d1","resolution":{"observed_at":"2026-05-20T12:43:17.447238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2509.06945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-07-04T16:39:58.253188Z","title":"Interleaving reasoning for better text-to-image generation","venue":null,"work_id":"d8284b77-8931-4f0c-bf78-042627e2d030","year":2025},"citing_paper":{"arxiv_id":"2605.28805","last_updated":"2026-05-27T17:56:04Z","snapshot_observed_at":"2026-07-06T23:38:19.096349Z","submitted_at":"2026-05-27T17:56:04Z","title":"OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T13:01:08.529979Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2605.28805"},"observation_digest":"sha256:097283a9c7631f819fe278bf179eda858a45d699632e120bc5b1762d1f20c6be","observation_id":"86c8d491-79c1-4d6b-89f9-afd5f2f656cf","resolution":{"observed_at":"2026-06-29T13:03:25.978252Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2509.06945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-07-04T16:39:58.253188Z","title":"Interleaving reasoning for better text-to-image generation","venue":null,"work_id":"d8284b77-8931-4f0c-bf78-042627e2d030","year":2025},"citing_paper":{"arxiv_id":"2606.11683","last_updated":"2026-06-10T05:52:14Z","snapshot_observed_at":"2026-07-06T23:50:44.713490Z","submitted_at":"2026-06-10T05:52:14Z","title":"Reason, Then Re-reason: Cross-view Revisiting Improves Spatial Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T10:41:41.697216Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2606.11683"},"observation_digest":"sha256:d947ac23df84df63d07bf5590ccbc5c21f97b34c7f85a1ff90c2525733aa8d7a","observation_id":"2e4f6a9a-d3a6-417a-897c-15e969a7484e","resolution":{"observed_at":"2026-07-03T08:47:50.518611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2509.06945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-07-04T16:39:58.253188Z","title":"Interleaving reasoning for better text-to-image generation","venue":null,"work_id":"d8284b77-8931-4f0c-bf78-042627e2d030","year":2025},"citing_paper":{"arxiv_id":"2606.24849","last_updated":"2026-06-23T17:28:00Z","snapshot_observed_at":"2026-08-03T11:30:36.402988Z","submitted_at":"2026-06-23T17:28:00Z","title":"IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-26T00:19:49.071495Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2606.24849"},"observation_digest":"sha256:1da0a23d44ea90d2feb4d76ae6bf18381d479d7b2939237317df0122d9d6c1dc","observation_id":"66a7c912-fa2b-4992-b99e-417e7cce5358","resolution":{"observed_at":"2026-07-04T16:39:58.254509Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2509.06945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-07-04T16:39:58.253188Z","title":"Interleaving reasoning for better text-to-image generation","venue":null,"work_id":"d8284b77-8931-4f0c-bf78-042627e2d030","year":2025},"citing_paper":{"arxiv_id":"2606.31504","last_updated":"2026-06-30T11:22:24Z","snapshot_observed_at":"2026-08-02T16:40:34.907828Z","submitted_at":"2026-06-30T11:22:24Z","title":"SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-01T06:02:48.532478Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2606.31504"},"observation_digest":"sha256:591590d90d6da31acab3eef522d6d8987008761c96981d74ff95251424ee6e61","observation_id":"eee4709d-d147-47d7-81fa-b1206a14b403","resolution":{"observed_at":"2026-07-01T09:55:41.095644Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-08-05T04:44:28.524092Z","title":"arXiv preprint arXiv:2509.06945 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-06T14:33:08.095759Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:28.524092Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:a739ee1d4f09fe4c3958d796eb8ca20abb36ac1316f9bc2fdcb196746d43da2a","observation_id":"097f2bcd-f015-46ea-b082-5db26a881451","resolution":{"observed_at":"2026-08-05T04:44:28.524092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.06945/citation-record","integrity":"/paper/2509.06945/integrity","json":"/paper/2509.06945/citation-record.json","paper":"/paper/2509.06945"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T22:55:44.859430Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.859430Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:258eb38cb1432d55130264183eb0a092197152655c2c0328cd6dfed8f6814d77","observation_id":"5124f506-35d6-405b-8e95-25bfe6394496","resolution":{"observed_at":"2026-08-04T22:55:44.859430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-04T22:55:44.873401Z","title":"Emerging properties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.873401Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:50b66c2f109f91826b802086f93b59e87dca5760dac8efc181714496b162ca62","observation_id":"10576f2d-416c-403f-a149-1fc83f13bcee","resolution":{"observed_at":"2026-08-04T22:55:44.873401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-07-06T20:52:14.274575Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-04T22:55:44.877594Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv preprint arXiv:2503.10639,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.877594Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:c537e9176500c250db7bafc8ddc93357938d5ee8673c5098e52519647a89b9e3","observation_id":"9f56752a-f678-4670-b871-473500b61ff1","resolution":{"observed_at":"2026-08-04T22:55:44.877594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-04T22:55:44.881929Z","title":"Seed-x: Multimodal models with unified multi-granularity comprehension and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.881929Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:381cf3248dfec8f6dd90682ba20e9d26e3c83912f56c965ac285c6fff0dc3b49","observation_id":"6f0d6a40-9d29-4a19-8936-10f296ef8d0b","resolution":{"observed_at":"2026-08-04T22:55:44.881929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-04T22:55:44.890907Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.890907Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:1971309283b85d078c1e4456d763603ddd1e09f472e5e8a905162fdf65d70762","observation_id":"44623535-7df1-419b-9f58-44f48e8dbe26","resolution":{"observed_at":"2026-08-04T22:55:44.890907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-07-06T20:49:27.466064Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-04T22:55:44.894915Z","title":"Accessed 2025-08-19","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.894915Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:85e0dfb965dbbe3d44b6150e838172477e40c7c91ccfb95c15f7e3c3fab98160","observation_id":"5b9bcf84-7d04-4b07-b310-f5bb9393f428","resolution":{"observed_at":"2026-08-04T22:55:44.894915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-04T22:55:44.898925Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.898925Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:3b2073d7c448b51c6c966ad2e3ca7bd80964c1d95b0dd1b03070b471c8e31529","observation_id":"400b2981-4301-4a12-b296-a09abfdf8ee5","resolution":{"observed_at":"2026-08-04T22:55:44.898925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-07-06T21:17:42.853055Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-04T22:55:44.903011Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot.arXiv preprint arXiv:2505.00703,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.903011Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:24c416ef35887570f5e759fb40cd86ef86d2edc5bcdf7977ece9c764267f27bb","observation_id":"90676a64-8725-46a9-ad1c-173bd31af4e9","resolution":{"observed_at":"2026-08-04T22:55:44.903011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-04T22:55:44.907085Z","title":"Baiqi Li, Zhiqiu Lin, Deepak Pathak, Jiayao Li, Yixin Fei, Kewen Wu, Tiffany Ling, Xide Xia, Pengchuan Zhang, Graham Neubig, and Deva Ramanan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.907085Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:35a9153e207933882e027e7411d282264b6d546c9aab7e87682e311552c28dcf","observation_id":"e913c196-2937-4c88-9adc-fc01578ed526","resolution":{"observed_at":"2026-08-04T22:55:44.907085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-04T22:02:38.792513Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05472","snapshot_observed_at":"2026-08-04T22:55:44.911235Z","title":"Mogao: An omni foundation model for interleaved multi-modal generation.arXiv preprint arXiv:2505.05472,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.911235Z"},"links":{"cited_paper":"/paper/2505.05472","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:2eba21073c901a4ed90da6ba1be6204708504d3fd40694bedcdadfea13d6edad","observation_id":"c94664b9-3afc-4601-b1c1-1ee5a6dfc69f","resolution":{"observed_at":"2026-08-04T22:55:44.911235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-08-04T22:55:44.915056Z","title":"Uniworld: High-resolution semantic encoders for unified visual understanding and generation.arXiv preprint arXiv:2506.03147,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.915056Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:ca9dbbc1ae1375fc2653e3fa91c05bd57a53f6389ce2a8d3f368bc0052026c09","observation_id":"1ecae873-fb11-4561-9f18-6b0b8472fce7","resolution":{"observed_at":"2026-08-04T22:55:44.915056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-05T16:01:06.026395Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-04T22:55:44.919199Z","title":"World model on million-length video and language with ringattention.arXiv preprint arxiv:2402.08268,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.919199Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:3051bcf8c8e1144946279d5b9c21b088d2b8846e783443efc19554d551549bf6","observation_id":"e958345e-03c1-4134-a54f-10d17e56ae3b","resolution":{"observed_at":"2026-08-04T22:55:44.919199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.923109Z","title":"Unitok: A unified tokenizer for visual generation and understanding.arXiv preprint arXiv:2502.20321,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.923109Z"},"links":{"citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:9d9451ab532f46d9fac8642f2908ca1f7852532f56cd043ed6e1b5f11ccb1500","observation_id":"143acc15-20e2-4963-bea2-b262de52529a","resolution":{"observed_at":"2026-08-04T22:55:44.923109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07975","last_updated":"2025-03-24T08:33:32Z","snapshot_observed_at":"2026-07-06T19:49:17.129421Z","submitted_at":"2024-11-12T17:55:10Z","title":"JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07975","snapshot_observed_at":"2026-08-04T22:55:44.926786Z","title":"Janusflow: Harmonizing autoregression and rectified flow for unified multimodal understanding and generation.arXiv preprint arXiv:2411.07975,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.926786Z"},"links":{"cited_paper":"/paper/2411.07975","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:35c9386f443dcb25feda8e154a850b63d68032a4092a36b71406b06115cafc02","observation_id":"1de9c5af-6f41-4e77-854c-14ae561f2ab8","resolution":{"observed_at":"2026-08-04T22:55:44.926786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-07-06T20:49:51.505079Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-08-04T22:55:44.930599Z","title":"Yuwei Niu, Munan Ning, Mengren Zheng, Bin Lin, Peng Jin, Jiaqi Liao, Kunpeng Ning, Bin Zhu, and Li Yuan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.930599Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:f856c8e2f713b438ab137a25addadf50f14144c905c92a9ed9bc5d4f1da82f4f","observation_id":"f8fef04f-988b-4924-b6c2-dcdc3e59eb9e","resolution":{"observed_at":"2026-08-04T22:55:44.930599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-04T22:55:44.934415Z","title":"Introducing deep research","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.934415Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:f1d19c63a25f69dea2466a81d9aa5d65a1a55983f8459a618b947536f7c45394","observation_id":"8417e21d-2b57-426d-bb17-b6ae00a836fd","resolution":{"observed_at":"2026-08-04T22:55:44.934415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21758","last_updated":"2025-03-27T17:57:07Z","snapshot_observed_at":"2026-08-05T11:15:36.366240Z","submitted_at":"2025-03-27T17:57:07Z","title":"Lumina-Image 2.0: A Unified and Efficient Image Generative Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21758","snapshot_observed_at":"2026-08-04T22:55:44.938727Z","title":"Lumina-image 2.0: A unified and efficient image generative framework.arXiv preprint arXiv:2503.21758,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.938727Z"},"links":{"cited_paper":"/paper/2503.21758","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:8d0643266790c5634a425c25dc0f87116f061a5142a4d2ae5fa117aba50178c0","observation_id":"aea23b05-9223-43c1-b718-afbfdddcb612","resolution":{"observed_at":"2026-08-04T22:55:44.938727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-07-06T20:01:23.373458Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-04T22:55:44.942757Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation.arXiv preprint arXiv:2412.03069,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.942757Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:c862c7fffc6d7856d3dfb997ac67968c55eb11b32df3e15aebb073a574c0b25c","observation_id":"b6a80fd0-984a-4d3a-b633-fccfc4c216a0","resolution":{"observed_at":"2026-08-04T22:55:44.942757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-04T22:55:44.946720Z","title":"Hierarchical text- conditional image generation with clip latents.arXiv preprint arxiv:2204.06125,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.946720Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:49110c1408de51450f009bcfeacf67339fcbc496dc7cff0850bbd02807a00b50","observation_id":"7c5b707e-5997-40d3-8563-10b5c8b89bce","resolution":{"observed_at":"2026-08-04T22:55:44.946720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-04T22:55:44.954534Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.954534Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:ff69e858786211d54f639a2d618a8b49358db03b5f55273ff13bd0658a07ddf8","observation_id":"6149699a-4a80-4225-a911-7bf60ff7540a","resolution":{"observed_at":"2026-08-04T22:55:44.954534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-04T22:55:44.958495Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning.arXiv preprint arXiv:2412.14164,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.958495Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:f39f6c960c9d237b1c5020199d6acb1cfa2ee35d889d6771b0cd1f971dec9d07","observation_id":"7f3efb74-57f0-4b11-ae1b-346a7a6f4f81","resolution":{"observed_at":"2026-08-04T22:55:44.958495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06673","last_updated":"2024-12-09T17:11:50Z","snapshot_observed_at":"2026-07-06T20:04:01.034597Z","submitted_at":"2024-12-09T17:11:50Z","title":"ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06673","snapshot_observed_at":"2026-08-04T22:55:44.963071Z","title":"Illume: Illuminating your llms to see, draw, and self-enhance.arXiv preprint arXiv:2412.06673, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.963071Z"},"links":{"cited_paper":"/paper/2412.06673","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:daa5bf9372d2d3823a7dcaa8915a1a6da209275cda85f024bfd2a029f3c79e62","observation_id":"f7a83eec-5066-409a-87c3-31ec6c7fb86f","resolution":{"observed_at":"2026-08-04T22:55:44.963071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-04T22:55:44.967227Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.967227Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:3110e0b30bcb04948673f04e3c41b09e210e6ebd5333d3a9441575a08d35a0c5","observation_id":"84579299-7ced-436f-8ae8-b816cbe7fedd","resolution":{"observed_at":"2026-08-04T22:55:44.967227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15564","snapshot_observed_at":"2026-08-04T22:55:44.971860Z","title":"Show-o2: Improved native unified multimodal models.arXiv preprint arXiv:2506.15564, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.971860Z"},"links":{"cited_paper":"/paper/2506.15564","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:033e971e41e0cb50c3dbe3c1e2c4161e9b4e6f309103804f076f660b6adfabde","observation_id":"558594d0-d1f6-48f9-a683-2152cbed355b","resolution":{"observed_at":"2026-08-04T22:55:44.971860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T22:55:44.976360Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.976360Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:ed0d20278e843c3601bf41b53c830df0386556bb4b9f64b72b4c1adf067ad421","observation_id":"573de087-0f8f-42a2-9344-7eb92521f4f1","resolution":{"observed_at":"2026-08-04T22:55:44.976360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-04T22:55:44.980217Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model.arXiv preprint arxiv:2408.11039,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.980217Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:0db161ab953cacbdfe237ab4d4506efa5483975d3b1f0aab07fb4af603fb7484","observation_id":"b87d6789-8fed-404b-bf6e-8d880ea1d689","resolution":{"observed_at":"2026-08-04T22:55:44.980217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16080","last_updated":"2025-04-22T17:58:07Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:58:07Z","title":"From Reflection to Perfection: Scaling Inference-Time Optimization for Text-to-Image Diffusion Models via Reflection Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16080","snapshot_observed_at":"2026-08-04T22:55:44.984216Z","title":"From reflection to perfection: Scaling inference-time optimization for text-to-image diffusion models via reflection tuning.arXiv preprint arXiv:2504.16080,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.984216Z"},"links":{"cited_paper":"/paper/2504.16080","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:e265ed22c7d7ed0a476e5b0480f68171beef24c2d11e2804797ecd623e72ce3e","observation_id":"cbe2b674-3fa5-42d5-8723-e92f31c46a4b","resolution":{"observed_at":"2026-08-04T22:55:44.984216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-04T22:55:44.950531Z","title":"Llamafusion: Adapting pretrained language models for multimodal generation.arXiv preprint arXiv:2412.15188,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.950531Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:dd798772dd51d3d557ed34e95f539cc97c7d94aa60c28c47fce930a729d22816","observation_id":"93875204-2588-4310-b563-7bab02756f4c","resolution":{"observed_at":"2026-08-04T22:55:44.950531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T22:55:44.886846Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.886846Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:c63dd553458d3490b7cbe579a4c391e44faa1ecde592e7624500d6068583559b","observation_id":"31b420a8-9e27-48f7-be8e-059af6970582","resolution":{"observed_at":"2026-08-04T22:55:44.886846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:44.868981Z","title":"Advancing multimodal reasoning: From optimized cold start to staged reinforcement learning.arXiv preprint arXiv:2506.04207, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.868981Z"},"links":{"citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:d41ef2e9508607b02a355f4f41a73a1bebd812c7a631fa6309bc4b43dd520940","observation_id":"8235d2a8-716d-4e57-a318-1de3f1d2d672","resolution":{"observed_at":"2026-08-04T22:55:44.868981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07977","last_updated":"2025-06-26T15:47:09Z","snapshot_observed_at":"2026-08-03T22:18:20.423791Z","submitted_at":"2025-06-09T17:50:21Z","title":"OneIG-Bench: Omni-dimensional Nuanced Evaluation for Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07977","snapshot_observed_at":"2026-08-04T22:55:44.864389Z","title":"Jiuhai Chen, Zhiyang Xu, Xichen Pan, Yushi Hu, Can Qin, Tom Goldstein, Lifu Huang, Tianyi Zhou, Saining Xie, Silvio Savarese, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.864389Z"},"links":{"cited_paper":"/paper/2506.07977","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:bc2bb3cb0b7cb5574aa8f461702d9f92540c6459deca4b47d217b5677257fe62","observation_id":"c1c9beee-3b0d-41a7-af2f-2b5562734f09","resolution":{"observed_at":"2026-08-04T22:55:44.864389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 21 inbound Pith citation observations for arXiv:2509.06945."}