{"as_of":"2026-08-19T07:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fe04980b1688a1ad0cb2cfe74cdc362e72d5e2a554dd664160f837a06ae55c6e","coverage":[{"denominator":90,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:41:47.881363Z","state":"measured"},{"denominator":144,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":144,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":54,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:21:12.930967Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:29:50.900451Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-15T23:21:12.930967Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":193,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.930967Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:26042b1a70ca32f3de44b25af048419128462adeffe98be7f6368da7bcb5fcd6","observation_id":"93443880-4fe7-4bd2-ac50-24776bf0f423","resolution":{"observed_at":"2026-08-15T23:21:12.930967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-15T23:09:10.738161Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05422","last_updated":"2025-08-15T08:56:27Z","snapshot_observed_at":"2026-08-16T05:36:45.421294Z","submitted_at":"2025-05-08T17:12:19Z","title":"TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T23:09:10.738161Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2505.05422"},"observation_digest":"sha256:6ce9090de9affdd43e9622b3557a373c1ae779b4b42b9464183f222d3ce4bb34","observation_id":"e370a414-200a-46aa-87af-6c6bcee4645d","resolution":{"observed_at":"2026-08-15T23:09:10.738161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-07T14:55:52.031634Z","title":"T2I-R1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-15T08:58:29.185639Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:52.031634Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:69e9eb6554f8fbb0c2e41b2a7b864eb9088ea7be439399e88c6351cfb5176d89","observation_id":"6cae1717-2a14-4e02-8196-c49abafb20a8","resolution":{"observed_at":"2026-08-07T14:55:52.031634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-07T14:49:03.893674Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17540","last_updated":"2025-05-23T06:44:26Z","snapshot_observed_at":"2026-08-16T18:16:09.696569Z","submitted_at":"2025-05-23T06:44:26Z","title":"RePrompt: Reasoning-Augmented Reprompting for Text-to-Image Generation via Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:03.893674Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2505.17540"},"observation_digest":"sha256:d1a68e5ff88369ff08312e9b808e0f1ba41deedb31494e16778161b59f297b3c","observation_id":"7ee20ec3-bc98-4ba6-beea-86807f72809f","resolution":{"observed_at":"2026-08-07T14:49:03.893674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-07T14:42:11.989658Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17941","last_updated":"2025-05-23T14:17:56Z","snapshot_observed_at":"2026-08-16T20:29:48.636084Z","submitted_at":"2025-05-23T14:17:56Z","title":"VeriThinker: Learning to Verify Makes Reasoning Model Efficient","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:11.989658Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2505.17941"},"observation_digest":"sha256:fb46f3f7705407bd083534e5dc84c89ca1ae693ae68a108aa5c4678b1c423883","observation_id":"a5699b35-3f0e-46a0-a48a-9bed8c3207cb","resolution":{"observed_at":"2026-08-07T14:42:11.989658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-07T14:31:19.216711Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-16T23:13:31.947741Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:19.216711Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:d7e65e6717944532902b24fb96ce62cfef56f1be7cd057ddb7a653b62ed20f7c","observation_id":"05c39cc4-c44a-450b-a593-856d3763aeb0","resolution":{"observed_at":"2026-08-07T14:31:19.216711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-07T13:14:37.175516Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22407","last_updated":"2025-05-28T14:37:21Z","snapshot_observed_at":"2026-08-15T07:34:28.741855Z","submitted_at":"2025-05-28T14:37:21Z","title":"Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:37.175516Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2505.22407"},"observation_digest":"sha256:a94b994fbedc8de9d43f4435b74f50938840351a934f7ba729114320d76bcee3","observation_id":"de49025f-2bac-4931-abef-4fb98952154d","resolution":{"observed_at":"2026-08-07T13:14:37.175516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-07T13:04:52.609011Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22792","last_updated":"2025-08-09T10:28:46Z","snapshot_observed_at":"2026-08-17T21:37:45.703700Z","submitted_at":"2025-05-28T19:03:37Z","title":"Rhetorical Text-to-Image Generation via Two-layer Diffusion Policy Optimization","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:04:52.609011Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2505.22792"},"observation_digest":"sha256:6a222e5e1c220c00c01ab6ad85c1e2bd2d1525429ef625203a56f9ac8b670a4e","observation_id":"e2cad6bb-c177-4a4d-92bb-14b35ea8cfc2","resolution":{"observed_at":"2026-08-07T13:04:52.609011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-07T12:48:51.964061Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23493","last_updated":"2025-05-29T14:43:46Z","snapshot_observed_at":"2026-08-17T00:12:26.393808Z","submitted_at":"2025-05-29T14:43:46Z","title":"R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:51.964061Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2505.23493"},"observation_digest":"sha256:771e98fe97a539d5f647eef41db0bcc323e19f338f40cd7f9beb2676cbbac3ee","observation_id":"804ffdb4-d090-4c42-9dc0-ddf05b948e29","resolution":{"observed_at":"2026-08-07T12:48:51.964061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-07T12:18:33.312078Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24787","last_updated":"2025-05-30T16:48:14Z","snapshot_observed_at":"2026-08-13T04:32:44.496715Z","submitted_at":"2025-05-30T16:48:14Z","title":"Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:33.312078Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2505.24787"},"observation_digest":"sha256:e277700f8ffd6117031534a7de188054b46b7396ceeb2f8a0820e6b7d444ab1b","observation_id":"3fc4fcca-8607-4d3f-89b2-1a62594e9e94","resolution":{"observed_at":"2026-08-07T12:18:33.312078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-07T12:35:41.646136Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24863","last_updated":"2025-05-30T17:58:36Z","snapshot_observed_at":"2026-08-17T00:16:10.036550Z","submitted_at":"2025-05-30T17:58:36Z","title":"AlphaOne: Reasoning Models Thinking Slow and Fast at Test Time","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:41.646136Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2505.24863"},"observation_digest":"sha256:b6c59ff4d44821b31c992c93654cd40111878c2cfee6249f279a62f72c5397ac","observation_id":"f3bd3219-bc58-467c-8528-8baebc2508fa","resolution":{"observed_at":"2026-08-07T12:35:41.646136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-07T11:33:20.777967Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot.arXiv preprint arXiv:2505.00703, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02161","last_updated":"2026-07-12T08:53:18Z","snapshot_observed_at":"2026-08-13T12:37:57.526772Z","submitted_at":"2025-06-02T18:44:07Z","title":"TIIF-Bench: How Does Your T2I Model Follow Your Instructions?","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:20.777967Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2506.02161"},"observation_digest":"sha256:f1f68cfd3ae8744d2ae7cae3b51fb45c2b0f381f18b64fad5e54e6abd435a97c","observation_id":"d51ba9b8-8998-4242-9582-26b28514a842","resolution":{"observed_at":"2026-08-07T11:33:20.777967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-07T10:28:49.485230Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot.arXiv preprint arXiv:2505.00703, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05331","last_updated":"2025-06-05T17:59:02Z","snapshot_observed_at":"2026-08-16T07:14:23.993847Z","submitted_at":"2025-06-05T17:59:02Z","title":"MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:49.485230Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2506.05331"},"observation_digest":"sha256:811cf8a35979d0f259425713335abb27b194836668d1c6cf2597fcbda7cb1f3f","observation_id":"40bf3f65-d25c-46a1-a54e-149775932d25","resolution":{"observed_at":"2026-08-07T10:28:49.485230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-07T10:23:12.520489Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-13T05:25:22.532423Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.520489Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:57667713d57ab111f0c0b0afe8a770121607f5607a71723099171be70272ba13","observation_id":"38bfa069-c6de-4947-9281-2cf7158039a3","resolution":{"observed_at":"2026-08-07T10:23:12.520489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-07T05:48:49.635302Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot.arXiv preprint arXiv:2505.00703, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07045","last_updated":"2025-06-08T08:47:44Z","snapshot_observed_at":"2026-08-14T19:11:46.794849Z","submitted_at":"2025-06-08T08:47:44Z","title":"Interpretable and Reliable Detection of AI-Generated Images via Grounded Reasoning in MLLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:49.635302Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2506.07045"},"observation_digest":"sha256:abce4b56ef004eda153789c63db923f3ef460e02bd345b3f9fb6620911f3e7e9","observation_id":"f8cfe678-9952-47c6-8012-f97e01aa4c3f","resolution":{"observed_at":"2026-08-07T05:48:49.635302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-07T05:30:27.014921Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07963","last_updated":"2025-09-08T14:31:08Z","snapshot_observed_at":"2026-08-16T08:36:19.881596Z","submitted_at":"2025-06-09T17:38:45Z","title":"SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:27.014921Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2506.07963"},"observation_digest":"sha256:4306adc9ff59b556203a40366faf28d4029540aafbda182416fbe9bbb4cca5db","observation_id":"178dfa81-561c-42dd-8a3c-99f3cbd1dca0","resolution":{"observed_at":"2026-08-07T05:30:27.014921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-06T23:20:47.615355Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18564","last_updated":"2025-06-23T12:20:14Z","snapshot_observed_at":"2026-08-14T20:37:45.346566Z","submitted_at":"2025-06-23T12:20:14Z","title":"VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.615355Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2506.18564"},"observation_digest":"sha256:670a12deec289dd09e26db52a02858309ae80c2a1e04b53e04f1129a54329463","observation_id":"95ed0bfe-c13f-491e-844b-ef08dfc5a867","resolution":{"observed_at":"2026-08-06T23:20:47.615355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-08-18T21:48:45.801096Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:31d8fe3befb2c7572d90734100f412825c55bb3aa3e872154094b798a90b603e","observation_id":"8fdf8c54-6038-4419-bf5a-81cc3a9e0dd2","resolution":{"observed_at":"2026-05-19T07:52:10.955016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-06T14:45:53.279862Z","title":"T2i-r1: Reinforcing image generation with col- laborative semantic-level and token-level cot.arXiv preprint arXiv:2505.00703, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17853","last_updated":"2026-06-21T15:14:16Z","snapshot_observed_at":"2026-08-14T15:47:00.181656Z","submitted_at":"2025-07-23T18:20:46Z","title":"Detail++: Training-Free Detail Enhancer for T2I Diffusion Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:45:53.279862Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2507.17853"},"observation_digest":"sha256:92fe1ea2d0490c53d90758e23c19aca321864b9be02e73e9e1ae4c472dd8d4a7","observation_id":"fdd6b089-cfbe-4c94-aa58-c5a82acd1891","resolution":{"observed_at":"2026-08-06T14:45:53.279862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-05T20:44:12.948621Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-16T09:12:52.847939Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.948621Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:da698fc85ecd231a0b51897ae339aa20a98217eecb1c1b8c73e666e62a8dd8f4","observation_id":"ac2ac4a8-37f7-4a10-9308-141a84c5d824","resolution":{"observed_at":"2026-08-05T20:44:12.948621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":259,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:d3611bbf9ecbbf02b79c7c7d7a4394af0e8e884c7105772ac2f52d9710650d9b","observation_id":"3bfec692-9a94-4374-b131-f57acf47d3a7","resolution":{"observed_at":"2026-05-18T19:21:48.297225Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-04T22:55:44.903011Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot.arXiv preprint arXiv:2505.00703,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-17T07:21:36.818837Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.903011Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:335c3159570f79b08e040b210230202a7b77405cd439daaeefa28841c4257b76","observation_id":"90676a64-8725-46a9-ad1c-173bd31af4e9","resolution":{"observed_at":"2026-08-04T22:55:44.903011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":238,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:79e8902cf2d71eff8a62bcf9e2a58392ff97b884c4bca1989e9ba6933838fb49","observation_id":"c0df9d00-b55b-4d79-afa3-129a2bb8ee42","resolution":{"observed_at":"2026-05-18T00:02:24.554428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-04T16:43:50.734979Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.12046","last_updated":"2026-07-04T12:10:43Z","snapshot_observed_at":"2026-08-13T13:57:34.064755Z","submitted_at":"2025-09-15T15:27:29Z","title":"Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T16:43:50.734979Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2509.12046"},"observation_digest":"sha256:27a68fd23dd20d2fca5c2623e96e4db41a70c23b1dd15889e67bd8ac9ef82c0b","observation_id":"56769464-32f3-47a8-8100-d91e911f06b0","resolution":{"observed_at":"2026-08-04T16:43:50.734979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-04T16:07:31.520711Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:31.520711Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:132f7803dc763222e7f171abc052838367f97526b39d868b283d5dd00fb75994","observation_id":"2497ffc9-72aa-4900-8f5f-06a21319f463","resolution":{"observed_at":"2026-08-04T16:07:31.520711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-03T20:15:28.449218Z","title":"T2i-r1: Reinforcing image generation with col- laborative semantic-level and token-level cot.arXiv preprint arXiv:2505.00703, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20651","last_updated":"2026-07-21T00:23:00Z","snapshot_observed_at":"2026-08-14T13:42:29.127732Z","submitted_at":"2025-11-25T18:59:55Z","title":"RubricRL: Simple Generalizable Rewards for Text-to-Image Generation","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T20:15:28.449218Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2511.20651"},"observation_digest":"sha256:7fe8bc73ed2ad9809828491ae05f3cb2799641f15bcd6ef851cc2b7f12f63b53","observation_id":"e2c0655b-8669-40cd-a085-c0ded760ede8","resolution":{"observed_at":"2026-08-03T20:15:28.449218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2512.01236","last_updated":"2026-04-09T08:04:17Z","snapshot_observed_at":"2026-08-14T07:05:40.400161Z","submitted_at":"2025-12-01T03:25:49Z","title":"PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T03:49:05.489626Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2512.01236"},"observation_digest":"sha256:be820f285a87980af99e1d0d7c21a38fa0c17fb51eedefaa8d1212b536fb82e1","observation_id":"bcba91bb-5bb1-40eb-8930-6dce6197526a","resolution":{"observed_at":"2026-05-17T03:51:29.333727Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2512.07348","last_updated":"2026-04-28T10:02:14Z","snapshot_observed_at":"2026-08-06T12:32:11.849043Z","submitted_at":"2025-12-08T09:40:11Z","title":"MICo-150K: A Comprehensive Dataset Advancing Multi-Image Composition","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T00:20:58.483350Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2512.07348"},"observation_digest":"sha256:0b14f6e128098bf8dfb1543037d878abe0b7b554b86f40a41f46a4e8eba7dc0b","observation_id":"c6f0a055-0c1e-45a7-a062-c0b446be3aee","resolution":{"observed_at":"2026-05-17T00:21:23.320875Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-03T17:06:55.560762Z","title":"T2i-r1: Reinforcing image generation with col- laborative semantic-level and token-level cot.arXiv preprint arXiv:2505.00703, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-16T02:44:52.522803Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.560762Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:d5193519163fc1a421b2d9411ba09b0bf465c3ba9b04a5fde4f6630f1ce41c46","observation_id":"8552b6ab-0018-4605-88eb-224b19a75e27","resolution":{"observed_at":"2026-08-03T17:06:55.560762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2602.19974","last_updated":"2026-05-07T22:11:37Z","snapshot_observed_at":"2026-08-13T16:29:00.157808Z","submitted_at":"2026-02-23T15:39:53Z","title":"RL-RIG: A Generative Spatial Reasoner via Intrinsic Reflection","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T20:33:09.627731Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2602.19974"},"observation_digest":"sha256:59ed50a5207cba5186ea15637f50ba84bdb10d1a2114439187940c4dceb5859d","observation_id":"ae246701-722a-4b4b-8620-259c8637f152","resolution":{"observed_at":"2026-05-15T20:36:35.327041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-13T23:27:11.006580Z","title":"arXiv preprint arXiv:2505.00703 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-17T03:37:13.586856Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T23:27:11.006580Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:9f12a8f828c37e469202e44168322b360bac29ed44efebbd175be62c3a3ec09e","observation_id":"445ecd03-6d81-4967-952f-49821628ec1f","resolution":{"observed_at":"2026-07-13T23:27:11.006580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-03T02:33:55.036331Z","title":"arXiv preprint arXiv:2505.00703 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-17T03:37:13.586856Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:55.036331Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:9c338ee69f94e063460485b610089a30d04d6cd9399f2ad62a8947854f3cd09f","observation_id":"0e924498-084f-4499-a413-563005529d2f","resolution":{"observed_at":"2026-08-03T02:33:55.036331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2604.02355","last_updated":"2026-03-12T12:49:26Z","snapshot_observed_at":"2026-07-06T22:51:44.663367Z","submitted_at":"2026-03-12T12:49:26Z","title":"From Broad Exploration to Stable Synthesis: Entropy-Guided Optimization for Autoregressive Image Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-15T12:50:13.764159Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2604.02355"},"observation_digest":"sha256:0410544dac76212538be04f380d13094aea31fc7e578f3f8c71e548e8ddbe5bd","observation_id":"0762839f-e757-4b11-8c03-a1cbfd36deec","resolution":{"observed_at":"2026-05-15T12:50:37.081599Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2604.04500","last_updated":"2026-04-06T07:51:59Z","snapshot_observed_at":"2026-08-13T02:16:47.977396Z","submitted_at":"2026-04-06T07:51:59Z","title":"Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T19:59:19.379119Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2604.04500"},"observation_digest":"sha256:0575df00a0297ad7005c0968759fb2e71ee6bc222446afe1b8d42392ebc1fd44","observation_id":"7fadf1c3-1b51-486d-a12d-1bece5cf3e67","resolution":{"observed_at":"2026-05-10T22:20:47.910406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2604.04746","last_updated":"2026-04-08T01:34:51Z","snapshot_observed_at":"2026-08-04T23:51:46.943276Z","submitted_at":"2026-04-06T15:11:57Z","title":"Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:58.323955Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2604.04746"},"observation_digest":"sha256:06f59408dbc6dc04387617cfe226bc184ef78d9e1e9c9fce44fb1346eb0efd0f","observation_id":"9c2a2f93-6c03-460c-b878-df31db549271","resolution":{"observed_at":"2026-05-10T23:10:53.770009Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2604.06966","last_updated":"2026-04-08T11:30:35Z","snapshot_observed_at":"2026-08-11T08:53:53.480489Z","submitted_at":"2026-04-08T11:30:35Z","title":"MAR-GRPO: Stabilized GRPO for AR-diffusion Hybrid Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T18:00:50.105629Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2604.06966"},"observation_digest":"sha256:d168ccf9fc672a9749cadc2ff000837f64c5bf90270a4b43540cc08caf4f49ac","observation_id":"85cfe501-6a2e-483f-babf-6e7dfb06f060","resolution":{"observed_at":"2026-05-11T05:40:58.322357Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2604.12617","last_updated":"2026-04-17T10:49:33Z","snapshot_observed_at":"2026-08-15T00:01:31.978729Z","submitted_at":"2026-04-14T11:45:15Z","title":"SOAR: Self-Correction for Optimal Alignment and Refinement in Diffusion Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:44:19.379349Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2604.12617"},"observation_digest":"sha256:0c49c0889becae3669c48ceb9ed88b2f4b3e6ebc51ce0fc56c6315d6beae7d88","observation_id":"32398d84-a1b8-4dc5-ab41-03e62cacbfa1","resolution":{"observed_at":"2026-05-11T09:56:04.017345Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:93cce69ced092bba8249ba4896735cee68c69799b12d8941f99101bc773dc08b","observation_id":"660225a3-82dc-469d-bbf7-5c2231f9b071","resolution":{"observed_at":"2026-05-11T21:41:19.265561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2605.11400","last_updated":"2026-05-12T01:43:57Z","snapshot_observed_at":"2026-08-12T23:46:44.282001Z","submitted_at":"2026-05-12T01:43:57Z","title":"UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T01:29:23.774196Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2605.11400"},"observation_digest":"sha256:b2ee48cdd73dd0600a342daefd00865b136fa03aaae7be23e213e11795e7e706","observation_id":"06a5e778-a0da-47f8-bcef-b1239457f0fe","resolution":{"observed_at":"2026-05-13T01:47:04.902778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-12T16:57:23.214654Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot.arXiv preprint arXiv:2505.00703,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.12479","last_updated":"2026-07-06T08:55:19Z","snapshot_observed_at":"2026-08-19T01:18:52.313438Z","submitted_at":"2026-05-12T17:56:29Z","title":"Cutting rules in strong field QED with application to trident pair production","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T16:57:23.214654Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2605.12479"},"observation_digest":"sha256:367f46d1dbbc31cd424c82e7afd8226dcaaeb0de5d79d6d054450e64139f5ab3","observation_id":"7f0c0e66-c649-4492-a547-51f1d73998bb","resolution":{"observed_at":"2026-07-12T16:57:23.214654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2605.12480","last_updated":"2026-05-12T17:56:59Z","snapshot_observed_at":"2026-08-17T14:30:15.195820Z","submitted_at":"2026-05-12T17:56:59Z","title":"OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T06:16:20.612291Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2605.12480"},"observation_digest":"sha256:c7c0c7f20f27cf6c150b3f43083e7a7f4d1af43354feaa76f8007eb4f804ff81","observation_id":"e6700c57-373d-48c6-b095-86a15dd7376c","resolution":{"observed_at":"2026-05-13T06:17:22.912538Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2605.14876","last_updated":"2026-05-15T05:10:39Z","snapshot_observed_at":"2026-08-16T01:24:23.710882Z","submitted_at":"2026-05-14T14:22:25Z","title":"Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T16:35:43.166697Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2605.14876"},"observation_digest":"sha256:4407c4d5dab4bade369197bc4d93a98dafbbd606116833d957ffa00a0a3c9e0f","observation_id":"a825db6b-d8f2-443c-b838-5dff0e8bc6a7","resolution":{"observed_at":"2026-05-19T16:37:39.653920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2605.17602","last_updated":"2026-05-20T20:58:48Z","snapshot_observed_at":"2026-08-02T06:34:30.012151Z","submitted_at":"2026-05-17T19:00:44Z","title":"AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T12:11:23.775843Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2605.17602"},"observation_digest":"sha256:aab0f7f2f0ae0123cf0558f1ed4d956330dd5a9de10dc54629437ce6b5a13d57","observation_id":"d8cf2ff7-5bbb-4039-b5d4-d5151e5ae00d","resolution":{"observed_at":"2026-05-20T12:13:16.136936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2605.17602","last_updated":"2026-05-20T20:58:48Z","snapshot_observed_at":"2026-08-02T06:34:30.012151Z","submitted_at":"2026-05-17T19:00:44Z","title":"AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T09:19:39.848194Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2605.17602"},"observation_digest":"sha256:4e2ef596175df7e8fd3ef1920e363cc2ceb874dc943e5da53aa2a1256e51813f","observation_id":"55c3b928-e57c-43d2-8d59-d8c3732ebdce","resolution":{"observed_at":"2026-05-22T09:21:21.473886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:b130e8c89dc981ed0a8c1e9fa6e5e12f3db3d37592a07040f8830278a6a4d87d","observation_id":"ca4cf6d2-d980-4039-8557-4a92afa9714f","resolution":{"observed_at":"2026-05-21T05:49:40.939540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2605.22564","last_updated":"2026-05-21T14:45:02Z","snapshot_observed_at":"2026-08-17T01:56:18.979421Z","submitted_at":"2026-05-21T14:45:02Z","title":"SynAE: A Framework for Measuring the Quality of Synthetic Data for Tool-Calling Agent Evaluations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T06:25:06.024542Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2605.22564"},"observation_digest":"sha256:3a01c8da98516685077283b6c0e8c7ea46ba637e8b776d8e761dbcc8d76e7bb5","observation_id":"450a6df2-ca55-44c7-9a81-619c53954b53","resolution":{"observed_at":"2026-05-22T06:26:09.909567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":191,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:e6d85adb0aee7d3e700dfbfd9b8c4b47a698776fc654fdb533e6a34945c6335b","observation_id":"677e36ff-5cb3-4c67-b06f-e1b99c6593f2","resolution":{"observed_at":"2026-06-29T23:04:01.801590Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2605.28615","last_updated":"2026-05-27T15:27:13Z","snapshot_observed_at":"2026-08-11T23:33:03.733557Z","submitted_at":"2026-05-27T15:27:13Z","title":"Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T13:15:24.299457Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2605.28615"},"observation_digest":"sha256:8c462ddece99cb98d2869a0e08dae3baac773033ded4b9d5015f842ab0c033fc","observation_id":"284535c7-d273-4ca5-a1f0-286ab423d777","resolution":{"observed_at":"2026-06-29T13:23:28.308162Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2605.30248","last_updated":"2026-05-29T03:57:25Z","snapshot_observed_at":"2026-07-06T23:39:34.232661Z","submitted_at":"2026-05-28T17:13:18Z","title":"GenClaw: Code-Driven Agentic Image Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T07:36:54.292448Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2605.30248"},"observation_digest":"sha256:c75a816c11ab1c6e87d459212839216dae8a39e6cfd14090543bacee841a8388","observation_id":"60152a42-4a23-4706-81f8-aaca9d024cad","resolution":{"observed_at":"2026-06-29T07:43:13.932216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:746e6ff584972dda16d21f6c8fc6288e2f5e1b3b761912446427efbab6169faf","observation_id":"4e41e694-401b-4ea4-a1c0-b39ec79e72f4","resolution":{"observed_at":"2026-07-02T03:06:29.453307Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2606.05031","last_updated":"2026-06-03T15:58:56Z","snapshot_observed_at":"2026-08-13T09:30:06.328516Z","submitted_at":"2026-06-03T15:58:56Z","title":"MetaPoint: Unlocking Precise Spatial Control in Agentic Visual Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T06:07:06.056441Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2606.05031"},"observation_digest":"sha256:59e13e22e4d13037b31df2d2e9c95b81d9b215b3b871f11273ad027836662db7","observation_id":"ce2df6d0-897a-4bb5-9fa2-e0a3a638a0c1","resolution":{"observed_at":"2026-07-02T08:26:47.770694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2606.17888","last_updated":"2026-06-16T13:09:32Z","snapshot_observed_at":"2026-08-08T01:57:17.698279Z","submitted_at":"2026-06-16T13:09:32Z","title":"MathVis-Fine: Aligning Visual Supervision with Necessity via Progressive Dependency-Guided Training for Multimodal Mathematical Reasoning","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-06-27T01:23:40.564561Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2606.17888"},"observation_digest":"sha256:d9649a99457c7aacbb94dec1fa922a3ad698dc882c7290432a2ac754c067de24","observation_id":"a1e2b285-67a1-4652-a09b-e2a579ad066b","resolution":{"observed_at":"2026-07-03T20:18:57.753638Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2606.26930","last_updated":"2026-06-25T12:05:40Z","snapshot_observed_at":"2026-08-16T22:08:02.834262Z","submitted_at":"2026-06-25T12:05:40Z","title":"PortraitGen: Exemplar-Driven GRPO with Dual-Reward Guidance for Photorealistic Portrait Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T05:14:14.053344Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2606.26930"},"observation_digest":"sha256:2e2e4adc243c7c37bffcffc09e9bfe1455d12b6e1737e2152f6671761ec3b2b5","observation_id":"df34f479-10fc-481a-af36-9d2337570a3a","resolution":{"observed_at":"2026-07-04T13:29:50.901975Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2606.31711","last_updated":"2026-06-30T14:17:05Z","snapshot_observed_at":"2026-08-14T17:19:56.615623Z","submitted_at":"2026-06-30T14:17:05Z","title":"Arena-T2I Hard: Benchmarking and Improving Faithfulness with Dependency-Aware Checklist","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-01T05:15:40.555929Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2606.31711"},"observation_digest":"sha256:ec573949df3c51d78edc180890772c7499f357772fb2f76e65d88a645ec0560f","observation_id":"f767ac3f-ceb9-43fe-a6ca-11abd55c120e","resolution":{"observed_at":"2026-07-01T10:45:42.046656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.00703/citation-record","integrity":"/paper/2505.00703/integrity","json":"/paper/2505.00703/citation-record.json","paper":"/paper/2505.00703"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1905.13319","last_updated":"2019-05-30T21:28:12Z","snapshot_observed_at":"2026-08-16T02:16:32.508169Z","submitted_at":"2019-05-30T21:28:12Z","title":"MathQA: Towards Interpretable Math Word Problem Solving with Operation-Based Formalisms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13319","snapshot_observed_at":"2026-08-16T04:41:47.493660Z","title":"arXiv preprint arXiv:1905.13319 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.493660Z"},"links":{"cited_paper":"/paper/1905.13319","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:c712fca7d8ee0bd53f77e97730bae86bb0a4a63ce929ee4d5664a93afa495493","observation_id":"4b903d3d-d5f2-4c91-a13f-e6e472bf29b4","resolution":{"observed_at":"2026-08-16T04:41:47.493660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-16T04:41:47.498738Z","title":"CoRR abs/2108.07732 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.498738Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:1cbf5174167e79bcde49bd768eae5e15dc1db9fdbd0dffcf33f8d7362a0fb0f0","observation_id":"f9c9af51-d185-4d09-91ad-1c890d368f9b","resolution":{"observed_at":"2026-08-16T04:41:47.498738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.503344Z","title":"ACM Transactions on Graphics (TOG) 42(4), 1–10 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.503344Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:33ead3af0de8e39ad764e5b9684578570a74ecf51dadd9914d3a93199a6d3229","observation_id":"745cd16a-5606-4cfd-9b0f-17c5b6c725b3","resolution":{"observed_at":"2026-08-16T04:41:47.503344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.507549Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.507549Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:a511727038fe77053cda2ef4dac1313f4a5d61bd58dfa54b46b406608ff15a77","observation_id":"a985d27e-8d85-4a45-9a69-62d646b66a24","resolution":{"observed_at":"2026-08-16T04:41:47.507549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.511844Z","title":"https://github.com/Deep-Agent/R1-V (2025), accessed: 2025-02-02","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.511844Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:abcc3b7ca9679ebcef523c2653a820b739d6c4091b7cf63fac6d32f7f33f2c61","observation_id":"f786e9ba-f4e8-4730-869f-d0a90bf3df12","resolution":{"observed_at":"2026-08-16T04:41:47.511844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-16T04:41:47.516610Z","title":"CoRR abs/2107.03374 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.516610Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:de35d445b3b62bd2b84a1f106fb572be8d8c6c14991552b0a0d5c69ec8bc65de","observation_id":"fb4e93fb-3974-4577-9d67-fca97d891481","resolution":{"observed_at":"2026-08-16T04:41:47.516610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-16T04:41:47.521870Z","title":"arXiv preprint arXiv:2501.17811 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.521870Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:f49ad3b9ec85ede77c85d1ab9faddfa39ae5ef3fa2a7c83d6cf9b5df55defc45","observation_id":"1b771f63-16c0-4f8a-904d-23335881d2be","resolution":{"observed_at":"2026-08-16T04:41:47.521870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.526510Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.526510Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:c12bc07818e7b345aceea2774d4a21e0d6af2c95921ad921b3b71bee7919ca2a","observation_id":"c280d0a4-6d1e-476b-85b6-b325f0247855","resolution":{"observed_at":"2026-08-16T04:41:47.526510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.530997Z","title":"In: Ku, L.W., Martins, A., Srikumar, V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.530997Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:0adb95493b66d75d198c098c4ba09e64babe45995167437084d2337f55b00616","observation_id":"047416ed-2031-446e-8967-702ab210771c","resolution":{"observed_at":"2026-08-16T04:41:47.530997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-16T04:41:47.535324Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.535324Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:3502cd8d89782cd5921b3e790bf5db45032b6d7edbc2b4d0d12deb25d4c735ba","observation_id":"1d3ffa0b-f48e-4fc1-afd5-3cb5406cc5c8","resolution":{"observed_at":"2026-08-16T04:41:47.535324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-18T18:23:18.371488Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-16T04:41:47.539989Z","title":"arXiv preprint arXiv:2309.11499 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.539989Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:653a90a3c1cb55227920be1022f5fa432fe261cd874d9942e1f4654d9f61546c","observation_id":"3a0b2565-a255-4da5-aaa7-87e205a73fe8","resolution":{"observed_at":"2026-08-16T04:41:47.539989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.544537Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.544537Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:beaaac50cea1181922f81617ad2058e7c0187833d926bf947c2499a20f7e17d3","observation_id":"723c8f06-df27-4cf1-9ce2-1d4f7560c515","resolution":{"observed_at":"2026-08-16T04:41:47.544537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13861","last_updated":"2024-10-21T15:42:46Z","snapshot_observed_at":"2026-08-16T23:13:56.317647Z","submitted_at":"2024-10-17T17:59:57Z","title":"PUMA: Empowering Unified MLLM with Multi-granular Visual Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13861","snapshot_observed_at":"2026-08-16T04:41:47.548784Z","title":"arXiv preprint arXiv:2410.13861 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.548784Z"},"links":{"cited_paper":"/paper/2410.13861","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:db87e4d4205ebceed25e0e8cd3d389fa461749fc45f49f1d317c34b6a15c1f24","observation_id":"53396554-e3f1-42a2-ab5a-54c88d1cfd82","resolution":{"observed_at":"2026-08-16T04:41:47.548784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-18T16:04:10.548936Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-16T04:41:47.552986Z","title":"arXiv preprint arXiv:2212.05032 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.552986Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:338df92416db8e54cefab63936ef1bd0874bee4a4eeded6166f3b166d84089d3","observation_id":"966780be-d776-4236-95a3-b66961de40e6","resolution":{"observed_at":"2026-08-16T04:41:47.552986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02410","last_updated":"2023-07-02T22:58:51Z","snapshot_observed_at":"2026-08-16T16:26:39.313657Z","submitted_at":"2022-10-05T17:32:16Z","title":"The Vendi Score: A Diversity Evaluation Metric for Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02410","snapshot_observed_at":"2026-08-16T04:41:47.557496Z","title":"arXiv preprint arXiv:2210.02410 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.557496Z"},"links":{"cited_paper":"/paper/2210.02410","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:23d183a2130ed321e14c431295e9baaa071bf979c123b07ad7ea091d3b5929f1","observation_id":"a2e83712-a778-43dd-9426-a42831d97a74","resolution":{"observed_at":"2026-08-16T04:41:47.557496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-16T04:41:47.562023Z","title":"arXiv preprint arXiv:2312.11805 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.562023Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:5fede230b277f9f1b31b2a108af39b61ecfc430a68f55f78096ab4b4bd5e338d","observation_id":"42149007-a132-45b2-b4f0-262747650dc7","resolution":{"observed_at":"2026-08-16T04:41:47.562023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T04:41:47.566479Z","title":"arXiv preprint arXiv:2501.12948 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.566479Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:4be958888631638fc6dcc268064a8a0a6bffc27eec4edcbd2897676911409ec2","observation_id":"c7fea57c-da32-4ed3-be30-bfb9b6ef64f0","resolution":{"observed_at":"2026-08-16T04:41:47.566479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10627","last_updated":"2025-03-13T17:59:32Z","snapshot_observed_at":"2026-08-16T12:50:16.483230Z","submitted_at":"2025-03-13T17:59:32Z","title":"SciVerse: Unveiling the Knowledge Comprehension and Visual Reasoning of LMMs on Multi-modal Scientific Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10627","snapshot_observed_at":"2026-08-16T04:41:47.570542Z","title":"arXiv preprint arXiv:2503.10627 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.570542Z"},"links":{"cited_paper":"/paper/2503.10627","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:390889da4b5fde93122546e9f52a75fd34f2a6c65a88bb1557a63ebf119659a3","observation_id":"580ea783-a5c8-4fd8-89c5-57aa738d9362","resolution":{"observed_at":"2026-08-16T04:41:47.570542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-08-13T08:10:57.391295Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-08-16T04:41:47.575037Z","title":"arXiv preprint arXiv:2501.13926 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.575037Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:a968c802ce29f009b9afd69fe502a06efb2f19a9c647ee68c9c686aaf6ca1f95","observation_id":"38867dd6-2c10-4a26-9831-075800eaffb6","resolution":{"observed_at":"2026-08-16T04:41:47.575037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.579471Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.579471Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:01f6046f61338144f0ccf0bbbd12c338e22ced39fdd25047cedd26780b38b394","observation_id":"4e302370-6574-4ab8-8802-d99729066935","resolution":{"observed_at":"2026-08-16T04:41:47.579471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.583741Z","title":"NeurIPS (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.583741Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:10781f230b3d496e123fc7cc2a12194a3833758c2022e9ce8e23ddc3fb9a3565","observation_id":"2929fe3b-02ed-4053-8f1c-0ca53b7c8b1a","resolution":{"observed_at":"2026-08-16T04:41:47.583741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.588084Z","title":"Advances in Neural Information Processing Systems 36, 78723–78747 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.588084Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:ed3308298074a3ec8af8ea4bcdfc17f68c73cc1b9fc7454a2dca6e7b4e8214d7","observation_id":"bcec90e0-35f2-4812-94c2-0d236fca825e","resolution":{"observed_at":"2026-08-16T04:41:47.588084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-16T02:03:48.252223Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-16T04:41:47.592512Z","title":"arXiv preprint arXiv:2503.06749 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.592512Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:aaf994786a69895b04600c19f058f8c1b3abae8bbe234c62b2b7d1671441a5d9","observation_id":"b8936618-ca30-491a-a61f-999d2b48667f","resolution":{"observed_at":"2026-08-16T04:41:47.592512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-16T04:41:47.597010Z","title":"CoRR abs/2403.07974 (2024), https://doi.org/10.48550/arXiv.2403.07974","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.597010Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:e74602c4a194bce59f6b3a2188e3c6338364d0cbdee5adbdea3fb3981859d337","observation_id":"e734adca-e227-4a77-a61c-16b399e450e2","resolution":{"observed_at":"2026-08-16T04:41:47.597010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03653","last_updated":"2024-11-27T09:55:41Z","snapshot_observed_at":"2026-08-16T14:03:32.636664Z","submitted_at":"2024-04-04T17:59:46Z","title":"CoMat: Aligning Text-to-Image Diffusion Model with Image-to-Text Concept Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03653","snapshot_observed_at":"2026-08-16T04:41:47.602463Z","title":"arXiv preprint arXiv:2404.03653 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.602463Z"},"links":{"cited_paper":"/paper/2404.03653","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:c3f8df30a9de31ccc372fd7076be2c09d1af91c1f7a914d02232492e9abb1967","observation_id":"293fdf07-0a10-4d87-a755-6fc5a69722b2","resolution":{"observed_at":"2026-08-16T04:41:47.602463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-16T04:41:47.606617Z","title":"arXiv preprint arXiv:2502.09621 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.606617Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:18e2808015186de08d42ac8ba9fd46422c2e1b69d44e814bf08153942be538ab","observation_id":"d553872c-3bdc-45f3-84b6-02daa4b3731c","resolution":{"observed_at":"2026-08-16T04:41:47.606617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.611051Z","title":"Advances in neural information processing systems 35, 22199–22213 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.611051Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:3867ce0a8c0701a71f487388b3fceea525fbcb21f91840681151a882b17c54a6","observation_id":"7eb6451e-88d9-4c84-9e45-4bc11bae848d","resolution":{"observed_at":"2026-08-16T04:41:47.611051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.614860Z","title":"https://github.com/black-forest-labs/flux (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.614860Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:bee5a36ebe7b6d0afe2e372a86f24efc2245c53c0a5e60b541d430365da82909","observation_id":"5b719e99-717d-4b7e-b63f-7c927cccd29e","resolution":{"observed_at":"2026-08-16T04:41:47.614860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13920","last_updated":"2025-01-23T18:58:33Z","snapshot_observed_at":"2026-08-16T08:12:38.083229Z","submitted_at":"2025-01-23T18:58:33Z","title":"IMAGINE-E: Image Generation Intelligence Evaluation of State-of-the-art Text-to-Image Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13920","snapshot_observed_at":"2026-08-16T04:41:47.618286Z","title":"arXiv preprint arXiv:2501.13920 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.618286Z"},"links":{"cited_paper":"/paper/2501.13920","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:eb74f888073d00198fdc3f980b6c128575addf0e58e5b79f5ee20f9561a2566e","observation_id":"67f7bd7e-d60e-4b72-b268-ed3d0522c958","resolution":{"observed_at":"2026-08-16T04:41:47.618286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-16T04:41:47.622208Z","title":"arXiv preprint arXiv:2408.03326 (2024) 12","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.622208Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:f3f4e3086b3b21e449a2200e54f8baa4749e8806d1f6c2560e12ed9d68a5dbdd","observation_id":"806ee90c-2a6f-4a3b-b7bd-30d900174584","resolution":{"observed_at":"2026-08-16T04:41:47.622208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-08-16T13:11:20.195602Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-16T04:41:47.626135Z","title":"5: Three insights to- wards enhancing aesthetic quality in text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.626135Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:b0cff527e4780e1ee46d2aaa36c5f3072f669a8da25dc6d68e1ee6834ea10389","observation_id":"6894e5ab-004d-42e4-bdb6-b6a73af79953","resolution":{"observed_at":"2026-08-16T04:41:47.626135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09604","last_updated":"2024-12-12T18:59:26Z","snapshot_observed_at":"2026-08-16T05:48:44.789665Z","submitted_at":"2024-12-12T18:59:26Z","title":"SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09604","snapshot_observed_at":"2026-08-16T04:41:47.630162Z","title":"arXiv preprint arXiv:2412.09604 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.630162Z"},"links":{"cited_paper":"/paper/2412.09604","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:1c33401fecd49da0bd8b140f896aee94c3b86c298579f155fff4956e7be8d8ca","observation_id":"ad4eb845-bef3-4074-91e0-9bf532ce6662","resolution":{"observed_at":"2026-08-16T04:41:47.630162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.634560Z","title":"In: International Conference on Machine Learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.634560Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:714d60cdae660d7c613ab8d887841fb32d13c1563ffa8c56db70944adcd231a9","observation_id":"10d3cce4-0398-4d81-9026-1e2eaa690e67","resolution":{"observed_at":"2026-08-16T04:41:47.634560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-16T04:41:47.638621Z","title":"arXiv: 2403.18814 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.638621Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:0e9930fc50ddc43e44481c943087832314bcbb6a93127ebd27688cdc3f2b77af","observation_id":"ddf6537d-b9d0-4f46-a4b3-7fbeeb7e775e","resolution":{"observed_at":"2026-08-16T04:41:47.638621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-12T22:02:52.918587Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05472","snapshot_observed_at":"2026-08-16T04:41:47.643107Z","title":"arXiv preprint arXiv:2505.05472 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.643107Z"},"links":{"cited_paper":"/paper/2505.05472","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:d97130618781d0e1519cd15b891072c3a477ab4f3447461af221dcb8a7eb7dfb","observation_id":"49b1b15b-c31c-4e37-9988-ebea8cdd1830","resolution":{"observed_at":"2026-08-16T04:41:47.643107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.647639Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.647639Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:5406ce6ba15b74426fcc9a197d8deeff15a0b6900395a457dc23ec9245b7330c","observation_id":"cbf0e5e4-87a5-4413-b422-dd04506e1009","resolution":{"observed_at":"2026-08-16T04:41:47.647639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.059613Z","title":"arXiv e-prints pp","venue":null,"work_id":"1261bc72-64f5-43c6-aedc-4dc3f7105691","year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.651613Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:072a2dd1d231915bffa638ccbfeeee88d06b9c33a92aab2fa179e0a58738ec7e","observation_id":"d18858fd-7fe1-4b58-9717-6652bd6b1f34","resolution":{"observed_at":"2026-08-16T04:41:49.063965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.655820Z","title":"In: NeurIPS (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.655820Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:5ff8a2ae8d615cb884314b94ff8f7f22cd32778925ddece3f979e8f513129866","observation_id":"8e8f677c-ed77-49b1-9a0a-058f388b1eb8","resolution":{"observed_at":"2026-08-16T04:41:47.655820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-08-16T10:00:51.789693Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10631","snapshot_observed_at":"2026-08-16T04:41:47.660170Z","title":"arXiv preprint arXiv:2503.10631 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.660170Z"},"links":{"cited_paper":"/paper/2503.10631","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:027a6c1ef1edfb03186a1873af5ae8b3c81eba26c638a336651706c5b49c0743","observation_id":"42775345-5b96-47e8-af6a-366c89f4b0a7","resolution":{"observed_at":"2026-08-16T04:41:47.660170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.664410Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.664410Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:e66f6352ba7ecafc822d68f94a46c4bca74e564179f9338e87b854148d2ce84a","observation_id":"e20db545-8265-4d7d-8097-7585b809eaf2","resolution":{"observed_at":"2026-08-16T04:41:47.664410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-16T04:41:47.669267Z","title":"ArXiv abs/2303.05499 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.669267Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:c0d3b7eaf201929bf45d072a112112558f06ef333acf34440c15c91407257c2f","observation_id":"0c533199-a63d-4125-a009-408662553676","resolution":{"observed_at":"2026-08-16T04:41:47.669267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-16T12:51:49.357503Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06520","snapshot_observed_at":"2026-08-16T04:41:47.673735Z","title":"arXiv preprint arXiv:2503.06520 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.673735Z"},"links":{"cited_paper":"/paper/2503.06520","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:b4e08d6bb70f8ab571ce9c5faf1e8052d70b9b1925a30c68d3037162a1a976ff","observation_id":"7277b729-f890-4fa0-ace9-f3d998f81f2e","resolution":{"observed_at":"2026-08-16T04:41:47.673735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-16T04:41:47.678209Z","title":"ArXiv abs/2310.02255 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.678209Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:b02d414e5ebdb00cdefe6a77dca707e51827969604fc0ad95a06d2c1eef78b83","observation_id":"0c3c8a73-5d38-45c5-a3a9-06362db51803","resolution":{"observed_at":"2026-08-16T04:41:47.678209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.682687Z","title":"arXiv preprint arXiv:2502.20321 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.682687Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:f60162165651a663c609bd7985bd2b51b583031f8fb7256d1a83f328bdc768d0","observation_id":"7761ad23-8783-4f52-b878-883c8e23afa8","resolution":{"observed_at":"2026-08-16T04:41:47.682687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07975","last_updated":"2025-03-24T08:33:32Z","snapshot_observed_at":"2026-08-16T13:00:44.601845Z","submitted_at":"2024-11-12T17:55:10Z","title":"JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07975","snapshot_observed_at":"2026-08-16T04:41:47.686680Z","title":"arXiv preprint arXiv:2411.07975 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.686680Z"},"links":{"cited_paper":"/paper/2411.07975","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:de1fffebd601c4202619dfe09f4c048d6ad6ceb2025a487418754ad6fe916fee","observation_id":"3711cc91-3bf6-4924-9b13-ce92f8231a6a","resolution":{"observed_at":"2026-08-16T04:41:47.686680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.026215Z","title":"In: American Invita- tional Mathematics Examination - AIME 2024 (February 2024), https://maa.org/ math-competitions/american-invitational-mathematics-examination-aime","venue":null,"work_id":"70f84267-6e30-42d5-858d-732b56ebbf99","year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.691472Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:b990fdade1460a34e7273868301c4fe4abc4fad4b0020ab3a2c0cfc26d6d2f3b","observation_id":"da1d05d6-900f-4e2c-9a33-5a47c9558032","resolution":{"observed_at":"2026-08-16T04:41:49.030614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-13T20:16:31.803514Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-16T04:41:47.695486Z","title":"arXiv preprint arXiv:2503.07365 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.695486Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:f3c0ef00fdef23779d5816969a05e694b5c5bad1da6fd524b8966fe2ef4ab9ae","observation_id":"ecc7a0c3-5ac7-4359-baea-621550d58f37","resolution":{"observed_at":"2026-08-16T04:41:47.695486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.011466Z","title":"https://www.midjourney.com/ (2024) 13","venue":null,"work_id":"2b4b0721-f63b-4aaf-9e67-edabc48d1361","year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.700230Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:749c1bff52d27c9f5ef36821ace4ab3aedde7c484fbe86e7df235d29248aa1d7","observation_id":"c66ef752-095b-41ab-ad10-e760649b973d","resolution":{"observed_at":"2026-08-16T04:41:49.016137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-16T12:51:32.079370Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-08-16T04:41:47.704926Z","title":"arXiv preprint arXiv:2503.07265 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.704926Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:88fa504d4569ddc4cd9623b5df4d6148c0f0bd5eb32417d5fbae2878f2857543","observation_id":"5e1309e9-7e9a-4859-9e5e-783fa1ea033b","resolution":{"observed_at":"2026-08-16T04:41:47.704926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.709298Z","title":"https://chat.openai.com (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.709298Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:bf779fe11c5ff31c07a8b1dc26b1ed909c3d33f8b441a2e734bde99ca12d79e1","observation_id":"e9a9d7c2-c053-417a-b8c5-8acccb4c1538","resolution":{"observed_at":"2026-08-16T04:41:47.709298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.713259Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.713259Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:2224100823ec0371060910cc59a1728e0e83d07fce62273fa9f9b4acfdce2aed","observation_id":"2a3ea94f-5422-4682-862f-c495bf3be45b","resolution":{"observed_at":"2026-08-16T04:41:47.713259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.717399Z","title":"https://openai.com/index/hello-gpt-4o/ (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.717399Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:dc308d7b9eb3fe74de2b27cc5f2a44006a0c8f85d015e4a5f6629a7b1c530451","observation_id":"e12bde5d-4e0e-42be-a9f8-94a62ab781a3","resolution":{"observed_at":"2026-08-16T04:41:47.717399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:48.969190Z","title":"(2024), https://openai.com/o1/","venue":null,"work_id":"8e651d51-80a5-4383-b7de-c94537ca005f","year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.721874Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:4cb836df8a38ca01dee4425e42c9377a7f8fdf293be73b72448ce76dba0c2fdd","observation_id":"4dd7a63c-811f-4f65-ad65-a2fbc354c1dd","resolution":{"observed_at":"2026-08-16T04:41:48.973238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-16T04:41:47.726086Z","title":"arXiv preprint arXiv:2307.01952 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.726086Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:6ea34e6b1a2e5150801f8fd86955a3f3b16c5d04ef72ccf749b699aa68d9b016","observation_id":"1e54307d-998d-4ec4-8439-6ba7aa6c8725","resolution":{"observed_at":"2026-08-16T04:41:47.726086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-08-15T18:07:41.591747Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-16T04:41:47.730706Z","title":"arXiv preprint arXiv:2412.03069 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.730706Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:09fd971f69c605e05e1e17a8d72aa48f1072c95572f15b7d3be3cf13a600e790","observation_id":"e6a9ae03-2e7b-4916-846d-3c9c7d390273","resolution":{"observed_at":"2026-08-16T04:41:47.730706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.735271Z","title":"In: International Conference on Machine Learning (2021), https://api.semanticscholar.org/CorpusID:231591445","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.735271Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:c5357fb16bf333fe13f76ea6334103bb6216b2b82bdb9a4a65b400c9c29e41d8","observation_id":"213b7a74-5c1b-47db-ae75-08b277a1d8c9","resolution":{"observed_at":"2026-08-16T04:41:47.735271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-18T14:12:03.598270Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-16T04:41:47.739951Z","title":"arXiv preprint arXiv:2311.12022 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.739951Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:db3847756a8584fe6d0700ce5c07a05f4dd96a6686fe87beb2b00b714a1e1958","observation_id":"59ddba06-e07e-45dc-bc3f-dbc0af6644da","resolution":{"observed_at":"2026-08-16T04:41:47.739951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.743927Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.743927Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:e76d8aa9576c27f0f48a60617a9561fa2ecbaa7909208e360b5a2ab5b75390a7","observation_id":"6d4c23e7-2f3c-43af-8e9b-37ab1fe7d32a","resolution":{"observed_at":"2026-08-16T04:41:47.743927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.747452Z","title":"In: Medical image computing and computer-assisted intervention–MICCAI 2015: 18th international conference, Munich, Germany, October 5-9, 2015, proceedings, part III 18","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.747452Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:f0007331cde4857ef6665af813d9ac6e2c0621f0374d84b694cd9953e20c5fbd","observation_id":"b78d8405-f223-43f6-9cee-809ddb27b9e4","resolution":{"observed_at":"2026-08-16T04:41:47.747452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-16T04:41:47.750924Z","title":"arXiv preprint arXiv:1707.06347 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.750924Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:2e9c603f81924306af2e59fce81180d881a8b2d374ce1af5336c9d4b61ec7ca0","observation_id":"bd18496e-3a4e-4b90-afa2-717fcfeb9b98","resolution":{"observed_at":"2026-08-16T04:41:47.750924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-16T04:41:47.754698Z","title":"arXiv preprint arXiv:2402.03300 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.754698Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:5f18cda069b2510b2aaff46d46635e0225ec2982f5c3b9249710f9f472951c22","observation_id":"0a7658ef-2552-43a3-9252-d393fad3e324","resolution":{"observed_at":"2026-08-16T04:41:47.754698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14324","last_updated":"2026-04-20T17:55:12Z","snapshot_observed_at":"2026-08-02T12:34:37.994590Z","submitted_at":"2025-03-18T14:56:46Z","title":"DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14324","snapshot_observed_at":"2026-08-16T04:41:47.758686Z","title":"arXiv preprint arXiv:2503.14324 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.758686Z"},"links":{"cited_paper":"/paper/2503.14324","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:27dc351a083c65f680c640cae153547f12d2d5badd70580bc0935441b8535f36","observation_id":"9b5a809d-0829-4e99-8d81-f6b797e29a4e","resolution":{"observed_at":"2026-08-16T04:41:47.758686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-16T04:41:47.763067Z","title":"arXiv preprint arXiv:2406.06525 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.763067Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:e4475d61364fab21c46274517bb84ce0130f914ef6a4b9f239719010dfa7befc","observation_id":"d1ee6918-7327-4266-aa4e-bfe31e57039b","resolution":{"observed_at":"2026-08-16T04:41:47.763067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-16T04:41:47.767386Z","title":"https://doi.org/10.48550/arXiv.2406.06525","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.767386Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:4951608823eea4c1b88cfc43ae4a73a5b72bf31bb6cf47c8f24baccc12b6d25d","observation_id":"e7456a3f-f7f2-4297-8b05-5fed2ebff242","resolution":{"observed_at":"2026-08-16T04:41:47.767386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-08-16T14:32:51.503158Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-16T04:41:47.772238Z","title":"arXiv: 2312.13286 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.772238Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:1b1735c031c8d0f3db30f8b91f4707b3eb4315d53e7aecfba71bda3358450a55","observation_id":"894d1fbd-2872-4598-ae9b-c8a908fabc98","resolution":{"observed_at":"2026-08-16T04:41:47.772238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-16T04:41:47.776600Z","title":"arXiv: 2307.05222 (2023) 14","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.776600Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:d75b17d60a8ca620bcd55d4fdc3ee8749c096a9d594a93bf3c6e06d42b4c581f","observation_id":"91302e20-12e1-457b-9302-5cb600816c90","resolution":{"observed_at":"2026-08-16T04:41:47.776600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.781048Z","title":"Advances in neural information processing systems 37, 84839–84865 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.781048Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:34db9f2b861fb3810e7c0d3327f278c61d9c6aa4ae4f7ffab07ab78e8f517adf","observation_id":"f4263540-1a0c-4e7c-8ae1-07de0fc27b30","resolution":{"observed_at":"2026-08-16T04:41:47.781048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-17T07:24:03.168446Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-16T04:41:47.785326Z","title":"arXiv preprint arXiv:2412.14164 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.785326Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:9cd0aed1a48eeb5bef88ac9d44882fab4d9f923211b2fd420b6f77f4d0f596ba","observation_id":"156d704e-6471-4da7-aee6-93bc846cfbff","resolution":{"observed_at":"2026-08-16T04:41:47.785326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T04:41:47.789984Z","title":"arXiv preprint arXiv:2302.13971 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.789984Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:8f7c0c18dacf3eb884a27151f74df98f3feda3fcbf2b7d4357164fbcea32c1a0","observation_id":"6fa5fc57-06b0-4f16-8717-af8e11d5c082","resolution":{"observed_at":"2026-08-16T04:41:47.789984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-16T04:41:47.794530Z","title":"arXiv preprint arXiv:2205.14100 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.794530Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:072279a3d87e7f5fff49ccea7652465a7480ccae2bd6851ffec654144f72ee2c","observation_id":"13e86d09-b580-4c91-85c1-e1e939b1a488","resolution":{"observed_at":"2026-08-16T04:41:47.794530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-16T04:41:47.799526Z","title":"arXiv preprint arXiv:2409.18869 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.799526Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:d572e0f862cbd9677434460fe9f034316f19fb11bdae8f3473d1e836467d6836","observation_id":"d8ba14f7-2c9d-4726-9dae-f7f72e8bb025","resolution":{"observed_at":"2026-08-16T04:41:47.799526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:47.804337Z","title":"Advances in neural information processing systems 35, 24824–24837 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.804337Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:051cf36f5005ad8c91c5a02fb7a67dbab142e926ac991d19ab4a2d7d8e8ab283","observation_id":"822f121a-08e4-4812-8312-3a8c711fc542","resolution":{"observed_at":"2026-08-16T04:41:47.804337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02161","last_updated":"2026-07-12T08:53:18Z","snapshot_observed_at":"2026-08-13T12:37:57.526772Z","submitted_at":"2025-06-02T18:44:07Z","title":"TIIF-Bench: How Does Your T2I Model Follow Your Instructions?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02161","snapshot_observed_at":"2026-08-16T04:41:47.808845Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.808845Z"},"links":{"cited_paper":"/paper/2506.02161","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:333e1ea7dbfba44af108320e0d7a95d50602afc1ef8242d42c7a6694c7d7ead0","observation_id":"3685fef9-09d7-418d-82dd-18aba2442b36","resolution":{"observed_at":"2026-08-16T04:41:47.808845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-16T04:41:47.813623Z","title":"arXiv preprint arXiv:2410.13848 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.813623Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:a1ba47a14f65baa93c6693757ba1b8c477c5b0986a201ff68e6ea5ee024f41f9","observation_id":"9c154e1f-bf35-468a-a223-c83716a5e8dc","resolution":{"observed_at":"2026-08-16T04:41:47.813623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-17T15:03:59.348694Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-16T04:41:47.818219Z","title":"arXiv preprint arXiv:2412.04332 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.818219Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:ae0d0d4b8a119cf29c50d783cdc027aad1c0916f8aca3c9abcf1c82a5bc6af78","observation_id":"0badafda-fe4e-40e3-8296-7993fe19c30c","resolution":{"observed_at":"2026-08-16T04:41:47.818219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08619","last_updated":"2025-03-11T16:58:02Z","snapshot_observed_at":"2026-08-16T12:51:02.408506Z","submitted_at":"2025-03-11T16:58:02Z","title":"LightGen: Efficient Image Generation through Knowledge Distillation and Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08619","snapshot_observed_at":"2026-08-16T04:41:47.822761Z","title":"https://doi.org/10.48550/arXiv.2503.08619","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.822761Z"},"links":{"cited_paper":"/paper/2503.08619","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:4e66584dc7d78d800eaeb0d09be0b58f2e3dd4cbfb3d2929e2cafa2e27f187d8","observation_id":"69a90652-9296-4717-b9d6-ac399feac4d7","resolution":{"observed_at":"2026-08-16T04:41:47.822761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-08-14T02:46:25.655503Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-16T04:41:47.827508Z","title":"arXiv preprint arXiv:2306.09341 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.827508Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:596a44fa6db750175740e020e6353ff67bc1b0630e4a06c6e2e13c647ee14596","observation_id":"f5892b2d-71a6-4e88-930a-000fde285d08","resolution":{"observed_at":"2026-08-16T04:41:47.827508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-16T04:41:47.832039Z","title":"arXiv preprint arXiv:2409.04429 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.832039Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:33c3b6a74d251a026948ab01430575a9df977d37bcd0007de0bd906d19c8e353","observation_id":"a9c6a6ae-21af-4b28-a13a-9b0753dacf1c","resolution":{"observed_at":"2026-08-16T04:41:47.832039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-08-18T17:34:44.890427Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-16T04:41:47.836622Z","title":"arXiv preprint arXiv:2408.12528 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.836622Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:cd7a19962e3955d38d337fce22e8b9e99cb686245d96ae889c0da5c561607073","observation_id":"17250bf1-ecbd-4793-a18f-e840eaf8360d","resolution":{"observed_at":"2026-08-16T04:41:47.836622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:48.904940Z","title":"In: Proceedings of the 37th International Conference on Neural Information Processing Systems","venue":null,"work_id":"bd44cf0a-8f54-429a-826a-264c2c2741bc","year":2023},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.841126Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:c1db807b27e616432690b5fee90f0cf77c7b68e7239063374b0734943f85610c","observation_id":"2e0c46c2-9b58-41b2-b13f-984cace1266e","resolution":{"observed_at":"2026-08-16T04:41:48.910305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-16T04:41:47.845525Z","title":"arXiv preprint arXiv:2407.10671 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.845525Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:ecb2a47d4ae5c8e9af0915bc03c44759915525befe2097df07a3eba68d7670a3","observation_id":"b7f83332-4fab-4812-8719-fac5fabfe6ec","resolution":{"observed_at":"2026-08-16T04:41:47.845525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-15T09:44:57.157415Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-16T04:41:47.849590Z","title":"arXiv preprint arXiv:2503.10615 (2025) 15","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.849590Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:cd4e1f08f313a33e55a376340262574ac366f8b7a4976a000fadc0eccc256fe7","observation_id":"7d37980f-aebf-4ca7-b89b-0ac94dd21b36","resolution":{"observed_at":"2026-08-16T04:41:47.849590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-16T04:41:47.853443Z","title":"arXiv preprint arXiv:2503.14476 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.853443Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:181c07960ab163ba6203aabd32bc308e320cd099f20dcdba638ff871eda5b37d","observation_id":"a95bc10c-3846-4a17-99c9-7818b162790d","resolution":{"observed_at":"2026-08-16T04:41:47.853443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-13T01:30:54.104133Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-16T04:41:47.857154Z","title":"arXiv preprint arXiv:2503.12937 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.857154Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:7103fc0b044f778e93f378777d0704c36cc869eccb988e0c1c82d7a4c3d4b7dd","observation_id":"46dd63e9-ab45-472a-a0cd-0061c70d3001","resolution":{"observed_at":"2026-08-16T04:41:47.857154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:48.889687Z","title":"In: ICLR 2024 (2024)","venue":null,"work_id":"49694cb9-744d-4597-af69-7d5d1378533c","year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.861218Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:ac55bcd58664b323e4a39b2225a87cc33f8aaff69c9b61bddfb33b6ebe0d36a9","observation_id":"b343df6b-13da-41e4-814f-79326a907175","resolution":{"observed_at":"2026-08-16T04:41:48.894460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:48.874447Z","title":null,"venue":null,"work_id":"5cc9e8e0-e606-42b6-8791-ba421cd629ee","year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.864850Z"},"links":{"citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:fffe2e8c5a80c22ffc71f6d954415edda8166773e15547fa5f05d873ab282a24","observation_id":"a2910bc9-8b4e-4c95-a520-84cbf404907b","resolution":{"observed_at":"2026-08-16T04:41:48.880056Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08739","last_updated":"2024-11-01T22:14:24Z","snapshot_observed_at":"2026-08-16T13:34:58.849974Z","submitted_at":"2024-07-11T17:59:47Z","title":"MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08739","snapshot_observed_at":"2026-08-16T04:41:47.868491Z","title":"arXiv preprint arXiv:2407.08739 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.868491Z"},"links":{"cited_paper":"/paper/2407.08739","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:1dfecb3e7cb542a870d277e03ddfaee103ae4bd73f21b1d3068a7ac1fe9b13c3","observation_id":"8f77bb31-266a-484a-b632-62cd419008ed","resolution":{"observed_at":"2026-08-16T04:41:47.868491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-16T04:41:47.872272Z","title":"arXiv preprint arXiv:2408.11039 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.872272Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:188ded626025ec267dbd9fb1168a48cd4ec2d6dcca66a42742ec570888c991d5","observation_id":"4c479a0d-e9fd-4f68-b5af-8ea113e653b4","resolution":{"observed_at":"2026-08-16T04:41:47.872272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09618","last_updated":"2024-12-12T18:59:48Z","snapshot_observed_at":"2026-08-13T01:30:47.696305Z","submitted_at":"2024-12-12T18:59:48Z","title":"EasyRef: Omni-Generalized Group Image Reference for Diffusion Models via Multimodal LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09618","snapshot_observed_at":"2026-08-16T04:41:47.876859Z","title":"arXiv preprint arXiv:2412.09618 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.876859Z"},"links":{"cited_paper":"/paper/2412.09618","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:d1dbf612fd7b618910b1b7587604c4d85255f9c03547a94b58130908ac00ac9d","observation_id":"1107dff6-57bc-4278-be39-0640a759363d","resolution":{"observed_at":"2026-08-16T04:41:47.876859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13046","last_updated":"2024-10-31T17:39:34Z","snapshot_observed_at":"2026-08-16T13:59:23.383222Z","submitted_at":"2024-04-19T17:59:48Z","title":"MoVA: Adapting Mixture of Vision Experts to Multimodal Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13046","snapshot_observed_at":"2026-08-16T04:41:47.881363Z","title":"arXiv preprint arXiv:2404.13046 (2024) 16 A More Experiment Details A.1 Experiment Setup Training Settings","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-16T04:41:47.881363Z"},"links":{"cited_paper":"/paper/2404.13046","citing_paper":"/paper/2505.00703"},"observation_digest":"sha256:50c801d0923e4bff9b73e20db7619cbe2bd04d73f39978e694185e2ab4239c55","observation_id":"8eb1f15b-2349-4ac8-9745-3c3c63c941c0","resolution":{"observed_at":"2026-08-16T04:41:47.881363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT"},"reference_resolution":{"displayed":90,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":84,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":90},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 54 inbound Pith citation observations for arXiv:2505.00703."}