{"as_of":"2026-08-19T11:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9b3b056c5409c69ede77fe60dedee8debc839006e7d30b0fb28ba17002cabf4f","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T05:47:21.834145Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:44:16.917352Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T00:44:18.368421Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"cited_work":{"arxiv_id":"2605.21195","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.21195","snapshot_observed_at":"2026-08-05T00:44:18.368421Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","venue":"cs.CV","work_id":"2272d660-db7c-461f-a02f-d8bf27d16419","year":2026},"citing_paper":{"arxiv_id":"2608.00562","last_updated":"2026-08-01T10:00:42Z","snapshot_observed_at":"2026-08-16T00:58:31.696191Z","submitted_at":"2026-08-01T10:00:42Z","title":"Beyond Token-Level Cross-Entropy: Fr\\'echet Distributional Post-Training for Autoregressive Image Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T00:44:16.917352Z"},"links":{"cited_paper":"/paper/2605.21195","citing_paper":"/paper/2608.00562"},"observation_digest":"sha256:dbed6356020174c5aa833a7c27b067eb228ecb54dfcd99ad0d4afab93d591acf","observation_id":"2a3574f6-5c24-470c-b556-17fca20f6ffa","resolution":{"observed_at":"2026-08-05T00:44:18.374263Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.21195/citation-record","integrity":"/paper/2605.21195/integrity","json":"/paper/2605.21195/citation-record.json","paper":"/paper/2605.21195"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scheduled sampling for sequence prediction with recurrent neural networks","venue":null,"work_id":"d2552993-c3fa-477b-9307-2974bad0fd1a","year":2015},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:a9a74e4281b6bb3f8e2ed2616dcf3d335865f7aa68f73ba2afcf56fa11ccf8fa","observation_id":"db2e2fd7-62d6-46e6-b286-3f0dac047765","resolution":{"observed_at":"2026-05-21T05:54:41.377600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-08-14T04:51:04.817737Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":"1308.3432","doi":"10.48550/arxiv.1308.3432","metadata_source":"pith","pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","venue":"cs.LG","work_id":"1fe8c7c8-aff7-4b94-9096-e549d7e60789","year":2013},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:6da86220fbf53815317e8f0e907b774bf3e459d23b23bfee8e179adf5242ad42","observation_id":"835dd210-d7db-479f-8fe3-a650e61c5b59","resolution":{"observed_at":"2026-05-21T05:49:40.943052Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:27.235199+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:27.235199+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving image generation with better captions.Computer Science","venue":null,"work_id":"2b129edd-5e6b-46aa-bfbf-4acd176ced68","year":2023},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:11e570e284da66b5110de7a4b9e770deaf0f413974388f5caf21b9ffc21339ea","observation_id":"258e872b-34bb-4814-8ca8-dcca2fb39929","resolution":{"observed_at":"2026-05-21T05:54:41.418221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training diffusion models with reinforcement learning","venue":null,"work_id":"c516c7fb-b476-4ee4-8611-8098c4d87667","year":2024},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:84959364b4c4bf6125a657152dee9e19f06f846d29ef25e65288aa6af608c241","observation_id":"a3334b46-bb73-477b-8446-197227deefce","resolution":{"observed_at":"2026-05-21T05:54:41.465422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:ec371e1602497bbb0fb77eb71c41148aea90ad79e5af3c769740ca8dd2e4a93c","observation_id":"db2ad8f2-f2ab-4ddd-aa5a-714234c05e24","resolution":{"observed_at":"2026-05-21T05:49:40.946283Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MaskGIT: Masked generative image transformer","venue":null,"work_id":"bec73cf8-0185-4cc9-8dd9-b5c1ae541a30","year":2022},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:671c584bbb9cb3f315dcd966d633f7f65efa54b44c37e3650e1c4a0381da985b","observation_id":"2d1f24a4-fe15-4486-98e5-bac91995117a","resolution":{"observed_at":"2026-05-21T05:54:41.380493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Muse: Text-to-image generation via masked generative transformers","venue":null,"work_id":"404c36de-052a-4fca-af82-7ada673de59c","year":2023},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:e15f925349be4302557fb4be4dbded99690fe62af31459092fe2bddaa43e12d7","observation_id":"268762fd-9748-4a32-b68b-9f72aa804967","resolution":{"observed_at":"2026-05-21T05:54:41.389778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Softvq-vae: Efficient 1-dimensional continuous tokenizer","venue":null,"work_id":"76cdfb8c-4810-43c4-a5d1-bfeb04178778","year":2025},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:3f85aaa50874e7e88988bbd718cd01afd7f5ff75a6ad598c18189eff07c86066","observation_id":"ffa2debe-7263-429d-9f91-d9849d2fb707","resolution":{"observed_at":"2026-05-21T05:54:41.485848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-08-16T09:34:56.272667Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":"2505.09568","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-07-08T00:04:22.585543Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","venue":"cs.CV","work_id":"86d896d2-592f-4d9b-938e-dfeb11f9388f","year":2025},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:71921c460b7a2fe139348194c8b7bebe4c2268c729b163c983b52fef5366ca8a","observation_id":"79beca6a-5e48-47a3-beaa-3d6c9701db1b","resolution":{"observed_at":"2026-05-21T05:49:40.929209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":"2501.17811","doi":"10.48550/arxiv.2501.17811","metadata_source":"pith","pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","venue":"cs.AI","work_id":"67d9e391-26d1-459e-ab56-07e60511c886","year":2025},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:227ed7cd63947a47d5c7d563a64ed5007bb6bbf291904d833927247f85063e51","observation_id":"a7ca868f-348f-4fa3-9325-c9c4796e84cc","resolution":{"observed_at":"2026-05-21T05:49:40.918911Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Directly fine-tuning diffusion models on differentiable rewards","venue":null,"work_id":"c4ad45fd-706f-4893-947f-fb347e2ac421","year":2024},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:305f9202311392ee4563e0d6a74e505cab8de3c257ca6c8105ade93ee1bd2382","observation_id":"3e356c21-d1fc-4769-9178-26d9a918dd18","resolution":{"observed_at":"2026-05-21T05:54:41.462571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":"b48a2366-cdc0-4563-925d-74e874486c13","year":2024},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:73ea020dbb4755861d00c1607c3d1595a18d37733d80062682b663bc0e15e091","observation_id":"5f675a19-cb74-4e86-96cf-ab269928e8ce","resolution":{"observed_at":"2026-05-21T05:54:41.361004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maximum likelihood from incomplete data via the EM algorithm.Journal of the Royal Statistical Society: Series B","venue":null,"work_id":"808bee38-cb6d-4316-959a-c2e7c577a3af","year":1977},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:6b06355d0434dcf4b68c0f404b4f277b040e46c239c2653a02be8ce80d2926eb","observation_id":"647b8112-eb94-43c2-9cf4-9a748f4deaa7","resolution":{"observed_at":"2026-05-21T05:54:41.437236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CogView: Mastering text-to-image generation via transformers","venue":null,"work_id":"eab445df-72cb-4856-9739-eefcbc1dedb1","year":2021},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:f25010b8dd2d0e1133ef47575748e6911b17fe8e6688032e52ef10ce6f42f9fa","observation_id":"da327be3-0b19-4cce-950f-a444ebd5f578","resolution":{"observed_at":"2026-05-21T05:54:41.400084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"748d2433-d16f-4355-ba33-c78b9f3a2dff","year":2021},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:eea21dc22beeb9d5f21e16beec289c9b1ee46be0568199c8d92618c82d31f704","observation_id":"b23b23b2-edea-48d2-b6ee-0f9bb0139b1e","resolution":{"observed_at":"2026-05-21T05:54:41.482532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dpok: Reinforcement learning for fine-tuning text-to-image diffusion models","venue":null,"work_id":"7820458c-8eb9-4114-acb9-43ea6b5190ce","year":2024},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:bec4f918067cafa98b485c4a115b2363dbaf51e64ee2436d215daa5660380647","observation_id":"00bcc4aa-984b-4064-973e-01b40deeb51a","resolution":{"observed_at":"2026-05-21T05:54:41.451507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":"918c5563-0a29-4513-8272-82aa32c051d3","year":null},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:6f046b0949c799f6a37e844e4043bab95bc6ce9e74a39983cb6f076f64e60f5a","observation_id":"1a3381cf-29c5-4cff-bc00-8ac170d97b99","resolution":{"observed_at":"2026-05-21T05:54:41.356071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11513","last_updated":"2023-10-17T18:20:03Z","snapshot_observed_at":"2026-08-16T14:51:16.293174Z","submitted_at":"2023-10-17T18:20:03Z","title":"GenEval: An Object-Focused Framework for Evaluating Text-to-Image Alignment","version":1},"cited_work":{"arxiv_id":"2310.11513","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.11513","snapshot_observed_at":"2026-07-04T13:19:50.698021Z","title":"GenEval: An Object-Focused Framework for Evaluating Text-to-Image Alignment","venue":null,"work_id":"39e1cc77-c682-4e20-bc57-ee5498213f92","year":2023},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"cited_paper":"/paper/2310.11513","citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:f76d6584062e70ba9b65aac0df4b62d684aedbcbca7c11acf8a9993c3a9132aa","observation_id":"9e3f5bf3-cd6e-4d47-8837-c3f80b0b497d","resolution":{"observed_at":"2026-05-21T05:49:40.887362Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative adversarial nets","venue":null,"work_id":"a02212c5-1a4d-48b0-85f6-04676ff072a6","year":2014},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:38af59fc9c75d702e04cbdf7ddb404d5d4d1b7cb9b2b8076bcd5fd79c496cde8","observation_id":"9047968a-8cf2-4756-be8d-1adcf9e420d0","resolution":{"observed_at":"2026-05-21T05:54:41.467945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bootstrap your own latent: A new approach to self-supervised learning","venue":null,"work_id":"c07ae7cb-cc2e-4ba0-adb6-183ce63b11b8","year":2020},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:620ad72ab1758a01b29dd0ba5a849b859e0dcc5b42744230c952473c4eae8a76","observation_id":"1cbc049c-b4d9-4084-ab53-8411ef582ac2","resolution":{"observed_at":"2026-05-21T05:54:41.363459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":"f7e8a766-c8b8-4705-9dc1-06e25795b868","year":2017},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:e1680608c87a8c53d7fa786b68a218f6966938592b1fd632434cb4e78dd4d675","observation_id":"2369d1a8-69f5-4867-b899-ea405719d91c","resolution":{"observed_at":"2026-05-21T05:54:41.353723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Straightening out the straight-through estimator: Overcoming optimization challenges in vector quantized networks.ICML","venue":null,"work_id":"58145bb7-d8ec-4331-9e88-d7c97c273218","year":2023},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:f599bf60ad690b57eaa720f9f503da16837cf4323ca1e180cc2c844ef5f27389","observation_id":"db6e7e4b-2c02-48ef-95bf-5c20baef0421","resolution":{"observed_at":"2026-05-21T05:54:41.439992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image-to-image translation with conditional adversarial networks","venue":null,"work_id":"ab11e23e-c559-45d7-9164-fafd88fbbbc7","year":2017},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:0a91a4549b03f1467ed2851cd4e273d8e8e42ffd361ba91284692b65310e79ea","observation_id":"b058a46d-162c-4847-827b-e9ace4943bcb","resolution":{"observed_at":"2026-05-21T05:54:41.395854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Categorical reparameterization with Gumbel-softmax","venue":null,"work_id":"218ced1f-03e8-438a-aa14-b489c969a304","year":null},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:81678bb2c5d25f7981ceabcb62cc1f2720154f2783bb891a89340a11c54ecad8","observation_id":"c7c750c3-af60-409c-84e3-3dfbb6901a28","resolution":{"observed_at":"2026-05-21T05:54:41.374282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:b130e8c89dc981ed0a8c1e9fa6e5e12f3db3d37592a07040f8830278a6a4d87d","observation_id":"ca4cf6d2-d980-4039-8557-4a92afa9714f","resolution":{"observed_at":"2026-05-21T05:49:40.939540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast decoding in sequence models using discrete latent variables","venue":null,"work_id":"d1c67efb-06ca-4c73-bd36-d7867b4706a5","year":2018},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:5902c9cc4f1d42de78c18170ad32fff194d9e14ec005a683a7acc1c03e560220","observation_id":"4d1779f1-4aa7-427e-945c-5220296c0d93","resolution":{"observed_at":"2026-05-21T05:54:41.454097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:65cf581261a47c58362788b286f24fa10818c325952b1688504edbbfad2f1671","observation_id":"252948aa-eb6f-4c20-9c65-8e615d8d2006","resolution":{"observed_at":"2026-05-21T05:49:40.895881Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Overcoming catastrophic forgetting in neural networks.Proceedings of the national academy of sciences","venue":null,"work_id":"4e805ee4-f278-4093-8539-d8b6dc3f522e","year":2017},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:81ddaf5b1ba18aa232e304ce8d715acd77489898f145bece5d2d3474ccfb633f","observation_id":"17e547c3-6cdf-4146-8896-273e98c8b408","resolution":{"observed_at":"2026-05-21T05:54:41.402512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rl with kl penalties is better viewed as bayesian inference","venue":null,"work_id":"b288aba9-d119-470a-8a61-39c3a5e46c38","year":2022},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:a714d7e2c8b3f275f1d57b85b930e45159e5b36a0c114d5e74eb0f9520cdad18","observation_id":"be44dd44-0f06-4900-b493-a8e8e15be454","resolution":{"observed_at":"2026-05-21T05:54:41.457034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Repa-e: Unlocking vae for end-to-end tuning of latent diffusion transformers","venue":null,"work_id":"ab253326-848e-42ee-a1f7-c806fdbacaf3","year":2025},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:def1eefa76e5b66eb1498d4de62b07a123687fbd390fe8054709f0784f185dca","observation_id":"cc197f03-4d9c-4fef-a091-90bca4f42eeb","resolution":{"observed_at":"2026-05-21T05:54:41.434350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00909","last_updated":"2018-05-20T20:03:59Z","snapshot_observed_at":"2026-08-08T20:31:18.897748Z","submitted_at":"2018-05-02T17:11:20Z","title":"Reinforcement Learning and Control as Probabilistic Inference: Tutorial and Review","version":3},"cited_work":{"arxiv_id":"1805.00909","doi":"10.4249/scholarpedia.1658.url:http://www.scholarpedia","metadata_source":"pith","pith_arxiv_id":"1805.00909","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Reinforcement Learning and Control as Probabilistic Inference: Tutorial and Review","venue":"cs.LG","work_id":"e29031ac-37fe-4702-86de-bb869d1f5c9a","year":2018},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"cited_paper":"/paper/1805.00909","citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:f2490794697ec5afa6235bc91fd2868f08c1c78b5b04b3c57068d390774b2d72","observation_id":"6e20c38a-dfc5-4474-8c14-540a4a85e694","resolution":{"observed_at":"2026-05-21T05:49:40.922660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mergevq: A unified framework for visual generation and representation with disentangled token merging and quantization","venue":null,"work_id":"1107a4c8-8ed1-4617-a726-f27a262b8cf0","year":2025},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:23abd54e62e1578b15e752062f1895995cadf1c41e169687e61ae390d24c1b80","observation_id":"3ed9c092-213e-4874-b0c0-a54b1fd9485b","resolution":{"observed_at":"2026-05-21T05:54:41.476791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Va-π: Variational policy alignment for pixel-aware autoregressive generation","venue":null,"work_id":"9076f59f-f3fa-4b5f-a003-8ff0aabb00bc","year":2026},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:52023c248540ecd2e757a6a1ff1d0fbf74710903b6806951574474bc8ae0f402","observation_id":"a00f1cdf-ef07-4fbc-970b-5e75ae6aa320","resolution":{"observed_at":"2026-05-21T05:54:41.383433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Microsoft COCO: Common objects in context","venue":null,"work_id":"900f7798-6293-4f5c-a11e-293c92b06e1b","year":2014},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:e5b926000ee2c1c251d081411fb9f5b72e1c41181186e9bae92940fcd3df78ac","observation_id":"2895b185-b4ac-4d28-87ac-3f08c4ed41e7","resolution":{"observed_at":"2026-05-21T05:54:41.470854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flow matching for generative modeling","venue":null,"work_id":"d46968eb-69f6-4cac-b86c-5dbcef9a160a","year":2023},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:25ee99f61b067d21b6f673907695dec10826e4e22dae06aef2d147effdfc2923","observation_id":"5270a4d4-ee6b-4e3a-998e-d70a5bcb3ecd","resolution":{"observed_at":"2026-05-21T05:54:41.415475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flow-grpo: Training flow matching models via online rl","venue":null,"work_id":"df5c7fd6-ceb5-454e-bc01-0ae2cb6e1149","year":2025},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:dab17ba0ee4cde96a042e9ab5bdfd9e1e8d09ecef288f825305e8c3622f2ca8d","observation_id":"3124c93e-500a-4ac3-b566-d83a7d20d87f","resolution":{"observed_at":"2026-05-21T05:54:41.504245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"7c78b1ca-6a05-43f8-8e87-208a434c579c","year":2019},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:bc8a537c3926a87c8d1ac09fba370a0219a26908ef23f39b59d0f0cad9a2d2c3","observation_id":"9b72ce2e-b051-42bb-b5d7-9f3e6428fc2a","resolution":{"observed_at":"2026-05-21T05:54:41.459808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-16T13:20:41.485941Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":"2409.04410","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-07-04T13:09:50.831210Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual gener- ation","venue":null,"work_id":"a2523977-d17d-43e1-8c06-1f6ba1c28388","year":2025},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:5ce3dc35c728842eac42c8eb70ba0b3e15e66a560e89f8842aa89acb37ad21f8","observation_id":"9b86cf57-c2e3-45f2-85f3-543a1f838036","resolution":{"observed_at":"2026-05-21T05:49:40.890541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A view of the em algorithm that justifies incremental, sparse, and other variants","venue":null,"work_id":"08fc7752-23a1-4441-bc16-f6b4b72626e8","year":1998},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:bd21bdc983194e1ccb45d52210636bd4e89b1ce9102af2315dd876e0841add92","observation_id":"a3e3c970-89a2-477a-b93c-d088cf3168e6","resolution":{"observed_at":"2026-05-21T05:54:41.366121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback.NeurIPS","venue":null,"work_id":"6e21236d-cf0a-41b6-9a8d-9e7062a4879c","year":2022},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:a5c3fdf8a91bd89315b2737b48d45a6c1d58eda9ea3d42dd31b8fab27d081fe4","observation_id":"fe5c188d-28d5-4cc6-90ef-9a49c3d79606","resolution":{"observed_at":"2026-05-21T05:54:41.371457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Freeman, and Yu-Xiong Wang","venue":null,"work_id":"15922952-dbb4-4c13-b2f1-ad03bc189c56","year":2024},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:c4212bfeb529f3c2999eacf7a199ec0de8fe916554f6640160d689c32da99540","observation_id":"9137680d-1a3e-44de-a9cd-1450bda5abaf","resolution":{"observed_at":"2026-05-21T05:54:41.496257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"6a9fa31a-edba-4467-960b-830dc7cb4f0e","year":2023},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:2fe3fa1a97823b14e51fcb1042d68ebac8fc6500795fcb79112a67538f738f5a","observation_id":"89afd83d-ad0e-4974-a251-bb568dd56ed6","resolution":{"observed_at":"2026-05-21T05:54:41.493788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1910.00177","doi":"10.48550/arxiv.1910.00177","metadata_source":"pith","pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","venue":"cs.LG","work_id":"ab561983-ab59-4f04-a11e-a467ddde4848","year":2019},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:62169c2c27fb965159cd123bfc4dd0fa410a951b2060dfbfd00638c668ebeebc","observation_id":"3feb2a8d-1b1b-4bd4-94a7-b51667d0fded","resolution":{"observed_at":"2026-05-21T05:49:40.904468Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning by reward-weighted regression for operational space control","venue":null,"work_id":"aad421b9-f8e1-4d34-b8d3-1d41a1b339ee","year":2007},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:54cbc3bed49bc6cac435ac80eca2d5949be10aad25187917e2196a7cca5ad86c","observation_id":"320f6548-1bc8-47ea-b981-e48324685b76","resolution":{"observed_at":"2026-05-21T05:54:41.488818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"7e2e6080-7d97-4300-9dad-a98ffab1ba60","year":2024},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:983e8f592e348f07a79608beebdcbc524322bbd42e3fa0ad78be19453f5bf5da","observation_id":"22391721-289a-46c4-81af-87c7c340988f","resolution":{"observed_at":"2026-05-21T05:54:41.473560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03739","last_updated":"2024-11-07T03:54:22Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:18Z","title":"Aligning Text-to-Image Diffusion Models with Reward Backpropagation","version":5},"cited_work":{"arxiv_id":"2310.03739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03739","snapshot_observed_at":"2026-07-04T16:59:58.107705Z","title":"arXiv preprint arXiv:2310.03739 , year=","venue":null,"work_id":"2f08b3dc-2c38-42da-b4ca-915d54c1b32d","year":2023},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"cited_paper":"/paper/2310.03739","citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:586d8645bc7c150bb90820888f079ce6716da9b18ef70f965b63b0146c0996d0","observation_id":"998adf9c-7bc3-406d-abe3-4598238b86b9","resolution":{"observed_at":"2026-05-21T05:49:40.925892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen2.5 technical report","venue":null,"work_id":"ff7267a2-116a-4438-8644-912aa531fc7b","year":2024},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:2cc6f6b66d5a15620bee349d292ed6f5489cf355cbe2472ec810dd093e4a9c0b","observation_id":"b0bd8bd7-27c3-4ad2-8331-05e46cb215a1","resolution":{"observed_at":"2026-05-21T05:54:41.501501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"4a35513c-6181-4dd9-bfb6-7ca5c0ac3862","year":2021},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:ceb2bc5b13bc14b28f446dbcfa7c23e803694eb1a10740044a9668e581b49283","observation_id":"1d74986a-d75c-47be-b3d0-ca03e3af65d0","resolution":{"observed_at":"2026-05-21T05:54:41.392998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"6f199210-003b-41d4-8d86-1084658c7b92","year":2021},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:dac0170d83ed86c63daa458d7e52d3bf6cfd2b3c36bb0a866d58053713018b98","observation_id":"12671343-6041-4760-8183-cf512836a71a","resolution":{"observed_at":"2026-05-21T05:54:41.386057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sequence level training with recurrent neural networks","venue":null,"work_id":"ec898ffa-451e-4769-a5cc-e635b7c89061","year":2016},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:ec863ea3654b9c17793a01fb4386b6aa6aa01fd0daff89a1fd2b6955bf2d7937","observation_id":"06bb285b-4ebf-4cba-92e7-c744690086ed","resolution":{"observed_at":"2026-05-21T05:54:41.358541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating diverse high-fidelity images with VQ-V AE-2","venue":null,"work_id":"22d9814a-aa25-41ef-aa72-917c1acb3362","year":2019},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:d48152e2b318980ceb14f6922464e0bc15d1151c8fe5cede39e236fa459fc72d","observation_id":"6e2ec4e9-7129-4cff-9701-a7565a47cd5f","resolution":{"observed_at":"2026-05-21T05:54:41.368817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"6231d090-491a-48b0-8e4d-b587cb051193","year":2022},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:3fef11c4c3053595be6a08d0c363940ab9a1dca0a2b0ad3de1ed42adc3d1a5c2","observation_id":"eba44567-e1b8-47c8-931b-e91dfdafb10b","resolution":{"observed_at":"2026-05-21T05:54:41.491385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:4c7ac8857355b87862e093b06f9cc0c312ad5845832f5b5ce57216bbbf018586","observation_id":"fc73c602-8a6e-4197-923c-b468de688c15","resolution":{"observed_at":"2026-05-21T05:49:40.893219Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:b7ba19ebe7db62438bd1d7de0c925657d6e035c91f85057822e072727890c4e6","observation_id":"166f7554-a7ba-4629-a787-355201b2604b","resolution":{"observed_at":"2026-05-21T05:49:40.907757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable image tokenization with index backpropagation quantization","venue":null,"work_id":"7501ebb8-10e6-46d9-ba0b-d07699a50f70","year":2025},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:8ca3ca02706e874a5e80114bd677ea580342499eeea770c7ea7fdfaff84b783c","observation_id":"4764e018-30cd-4cae-bcdd-00c4cae8f206","resolution":{"observed_at":"2026-05-21T05:54:41.423558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journeydb: A benchmark for generative image understanding.NeurIPS","venue":null,"work_id":"10891ae3-4121-48c3-89cb-77867cd8b263","year":2023},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:fe4f0cb59892d12e4514727cea35aa79cf71a491fe3cc5d86f15fb22de056c60","observation_id":"e7b2041d-67f8-46d0-948d-c1b2a788d58d","resolution":{"observed_at":"2026-05-21T05:54:41.410605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":"2406.06525","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-07-10T11:37:03.266757Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","venue":"cs.CV","work_id":"41efe203-9377-4c63-b1d6-e499cd6e46f6","year":2024},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:6f1658d29cf086118ea8a06d40ef4d8299c4cc85605e173342833511024d6d21","observation_id":"04043bd1-4302-4c54-b35f-8a2cc443b8a5","resolution":{"observed_at":"2026-05-21T05:49:40.898442Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mean teachers are better role models: Weight-averaged consistency targets improve semi-supervised learning results","venue":null,"work_id":"ebe07b05-b2f8-48ef-acb7-387618811b50","year":2017},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:69ce5be9f903eb9d75662abea8056929de32bd43a91689154a0a530bccb64522","observation_id":"4cde9640-29e7-4918-88de-4f5ff581f8b7","resolution":{"observed_at":"2026-05-21T05:54:41.431547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction.NeurIPS","venue":null,"work_id":"39867469-bbc6-4d05-bfd7-520377d066b2","year":2024},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:6dacfc815022f01095b2d1e59f0be65ca44b40480dcafd2af8ece8eec9c6d2ea","observation_id":"8ae6a361-1703-47a9-a7ff-add8d84f01ff","resolution":{"observed_at":"2026-05-21T05:54:41.498961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural discrete representation learning","venue":null,"work_id":"0a6a12c2-cf33-4723-b6df-8ef63d47dbd1","year":2017},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:5f909ce806fa78922646d07478fca6a6295bc81bf9451310b45cf1699cc37a41","observation_id":"010c0cc4-a98a-4697-b5e0-13a97fd71478","resolution":{"observed_at":"2026-05-21T05:54:41.405231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion model alignment using direct preference optimization","venue":null,"work_id":"3f2223a8-b100-43c1-aefd-15bbcbef829a","year":2024},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:0c663b5244ac74c6efb4038cde9d191d0bbafc0e9af2bdff5649d7dd9f5d7127","observation_id":"829e91de-b4a4-449f-aa06-2a4fe8cfe1c2","resolution":{"observed_at":"2026-05-21T05:54:41.479405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11455","last_updated":"2025-04-15T17:59:46Z","snapshot_observed_at":"2026-08-16T12:40:45.550358Z","submitted_at":"2025-04-15T17:59:46Z","title":"SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL","version":1},"cited_work":{"arxiv_id":"2504.11455","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11455","snapshot_observed_at":"2026-07-05T11:41:02.764172Z","title":"Simplear: Pushing the frontier of autoregressive visual generation through pretraining, sft, and rl","venue":"cs.CV","work_id":"facbbd34-503d-4c9a-b758-a9b88c18d9c6","year":2025},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"cited_paper":"/paper/2504.11455","citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:56508d2a88ef3b63608bfdeb81296b38bff375df1c54b8cc397aab3d7fa5d03c","observation_id":"9eb7b858-8c79-4dae-a80a-29698f4c93e2","resolution":{"observed_at":"2026-05-21T05:49:40.884259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:e54bf87c1d0f18caa188290f0768151ef4fecc71d837b9b55e8ac222ff6da0b6","observation_id":"758f3bb4-ea34-4db1-9cd1-55e07836234e","resolution":{"observed_at":"2026-05-21T05:49:40.914523Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Williams","venue":null,"work_id":"e2ad6ef8-0d0e-4c12-80d1-88e96c973b2c","year":1992},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:f7498d2a8db6c6b3597614f57fa45a532ad0d3a3dad6e6395dbf34b2b57ea79f","observation_id":"bacc4c14-0fc6-4a36-8d32-9b0fda4aba92","resolution":{"observed_at":"2026-05-21T05:54:41.445121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"931e0dce-3351-4eb1-a8db-2700979b800a","year":null},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:9a4a39864e635c5af88ca31cadf8ae4c4ea99663e57219f0da34b1d7a3ce2780","observation_id":"4a06f67c-2df2-43d9-9776-81527c0560e0","resolution":{"observed_at":"2026-05-21T05:54:41.442460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-08-14T02:46:25.655503Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":"2306.09341","doi":"10.48550/arxiv.2306.09341","metadata_source":"pith","pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","venue":"cs.CV","work_id":"40702548-f094-4c67-a5db-a62f426f852e","year":2023},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:fca44f729ba3093f949555a091568b8cb7c7b74188b6a082e790966b7d207422","observation_id":"a3f5fbd8-24b7-477b-93df-3184d7ceaa5c","resolution":{"observed_at":"2026-05-21T05:49:40.901207Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-15T14:08:11.306027+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T14:08:11.306027+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gigatok: Scaling visual tokenizers to 3 billion parameters for autoregressive image generation","venue":null,"work_id":"b7b4b81a-1929-4953-bd0b-cc746c17b010","year":2025},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:dcbb8dadce1213b3f515fb983b8bd4a5893cc5b2ad4ed8f8f93deb1d8fc978da","observation_id":"406f16d3-5e8a-4213-b879-18d379e0a399","resolution":{"observed_at":"2026-05-21T05:54:41.426179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagereward: Learning and evaluating human preferences for text-to-image generation","venue":null,"work_id":"cba8ca09-40e2-441c-b606-d802aae73852","year":2023},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:249305dfdc37f91c8c2369baf28ef1d2343facef38ac94357aa7df5320e22b63","observation_id":"b7ef1236-a161-4797-b15e-4484ab5a9a1b","resolution":{"observed_at":"2026-05-21T05:54:41.420804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling autoregressive models for content-rich text-to-image generation.TMLR","venue":null,"work_id":"61f241cb-0bc7-4c14-b06a-267a2b62da72","year":2022},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:047be3f47bef219b6051e8819e854d3287074d0b17cd93e8e63b6cb36b6482f7","observation_id":"e6d1e4ef-a56c-445f-b189-a6f2f08b37fc","resolution":{"observed_at":"2026-05-21T05:54:41.412931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 32 tokens for reconstruction and generation","venue":null,"work_id":"dfb4c1a9-d1b8-4c3d-8718-55fd90bf4da2","year":2024},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:f51188738d927c0f8ead366f28790712171e271258de86f498199d50a7241813","observation_id":"49c00af3-c48c-44bb-81a9-23746d6ca8a2","resolution":{"observed_at":"2026-05-21T05:54:41.428780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Group critical-token policy optimization for autoregressive image generation","venue":null,"work_id":"02b73151-3886-4368-abc0-821e4359a1a7","year":null},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:a29ee589d7d2f3a5a2951082e66bb14c10d028229c0f164b6d8c9e6bdd421bb4","observation_id":"e18ad42a-e5b5-44fd-8d5f-1fed50eb0348","resolution":{"observed_at":"2026-05-21T05:54:41.408153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"417e08a3-f3ab-47c7-8654-04b7f832d3b3","year":2018},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:8bf8366349cb1ca0aa132adf01767815c3e67fdac60d3c3ab298ac607ad1140e","observation_id":"c7578e74-1dcf-4652-8874-a5b4cf6ffc0e","resolution":{"observed_at":"2026-05-21T05:54:41.448413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":"2408.11039","doi":"10.48550/arxiv.2408.11039","metadata_source":"pith","pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","venue":"cs.AI","work_id":"c2bb4d2d-29de-4bf2-9150-3d6373ff358f","year":2024},"citing_paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-21T05:47:21.834145Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2605.21195"},"observation_digest":"sha256:077fcafdb7bbf56e72c842254bb799b8a2869c1945769c538ffd774fbc7e7bf1","observation_id":"e0583df5-fc43-4f66-be56-590770960393","resolution":{"observed_at":"2026-05-21T05:49:40.949420Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.21195","last_updated":"2026-05-20T13:56:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T03:20:44.366568Z","submitted_at":"2026-05-20T13:56:52Z","title":"RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":18,"verified_fuzzy":54},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 1 inbound Pith citation observation for arXiv:2605.21195."}