Pith. sign in

Paper Citation Record · LEDGER

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models

As of 6 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2605.16842.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2605.16842 v1

Coverage vector

measured 49 of 49 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-19T21:18:03.005508Z

measured 49 of 49 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-05T06:32:48.257954+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

49 of 49 outbound references displayed

  • verified exact34
  • verified fuzzy14
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation f460ee5a-99ca-4f56-8772-4d02b46ad0d8 · outbound

This paper cites Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer

Reference 1

Resolution
verified exact
local_arxiv, observed 2026-05-19T21:22:48.589217Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:bfea032b384d7e1bf4e5d2af9aa488ae33f938a5ec02631278de5d5382287982

Observation b6a272f0-3834-4d1b-ba1e-c8aeef13f1af · outbound

This paper cites Lumina-image 2.0: A unified and efficient image generative framework.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Lumina-image 2.0: A unified and efficient image generative framework

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T21:23:14.832594Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:0769a39fe32010d4a6ad2064bd064f0061126094b7b25af09b3d57298d1ee2ee

Observation ee1a60e2-83ce-47f5-9167-ab0d876e4e58 · outbound

This paper cites Qwen-Image Technical Report.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Qwen-Image Technical Report

Reference 3

Resolution
verified exact
local_arxiv, observed 2026-05-19T21:22:48.560584Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:4a10264d635c06b08a4f9a69ee6c633b60b662888872120dba7b5209389ac8df

Observation c84aceb3-dec1-47a1-a36f-7825ee420759 · outbound

This paper cites LongCat-Image Technical Report.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models LongCat-Image Technical Report

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-05-19T21:22:48.609181Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:9a2e96ca664cf14be16ece63c66c3d151fc0316e35d376049011f71378ced3d4

Observation d9d4a631-93cf-43e9-8bf1-8c62cf56fb28 · outbound

This paper cites Emu3: Next-Token Prediction is All You Need.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Emu3: Next-Token Prediction is All You Need

Reference 5

Resolution
verified exact
local_arxiv, observed 2026-05-19T21:22:48.583032Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:3e594efd98b085dde750b48f159b16ba6324001d42123a3ecaa44022fd531b6d

Observation 773d1a32-1274-4cd2-bb7f-56a356d6077e · outbound

This paper cites Emu3.5: Native Multimodal Models are World Learners.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Emu3.5: Native Multimodal Models are World Learners

Reference 6

Resolution
verified exact
local_arxiv, observed 2026-05-19T21:22:48.576713Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:0b17b1f945bf33bcd78689f86deeb7e286ea7f3987c62de3016436aa9c38d5e2

Observation 1060435f-8558-4503-aeda-cd47e9cf9b2d · outbound

This paper cites Lumina-mGPT 2.0: Stand-Alone AutoRegressive Image Modeling.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Lumina-mGPT 2.0: Stand-Alone AutoRegressive Image Modeling

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-05-19T21:22:48.550167Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:69edc6b39d366b01354e5f92b19dfbfa6847054ec138722ff51cf1a177e13512

Observation c8c90f32-138c-4828-a5fd-e9d6f1531f7b · outbound

This paper cites Lumina-mgpt: Flexible photorealistic autoregressive text-to-image generation.International Journal of Computer Vision (IJCV).

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Lumina-mgpt: Flexible photorealistic autoregressive text-to-image generation.International Journal of Computer Vision (IJCV)

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T21:23:14.834876Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:588da315c255be88c0774c7697cae8d2e2ed145c43aac5a30e289689b32863aa

Observation 2c6a8c4e-76c7-4fca-9d10-bae455a9b106 · outbound

This paper cites Flow-GRPO: Training Flow Matching Models via Online RL.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Flow-GRPO: Training Flow Matching Models via Online RL

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-05-19T21:22:48.565620Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:17769e9d2283c983d70975fed22020d017f9fa16c163a45187eacdee215b175f

Observation cba3d55e-8d41-4cee-8aa1-2b8b5a794120 · outbound

This paper cites DanceGRPO: Unleashing GRPO on Visual Generation.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models DanceGRPO: Unleashing GRPO on Visual Generation

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-05-19T21:22:48.617928Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:fb8dbf13ab91db53db9c2f97b4fdcc713511939a4bfd9e02051cb1f8c0ce898a

Observation ed110ddf-2b60-4d99-a96e-0c1e2fe1802a · outbound

This paper cites X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-19T21:22:48.507548Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:45b81b5f5a2fe9ff3a9a4d06f8970022eb789622e3837a60408588cd0e815571

Observation c575a3f5-7646-4901-99cd-ab997056f66a · outbound

This paper cites AR-GRPO: Training Autoregressive Image Generation Models via Reinforcement Learning.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models AR-GRPO: Training Autoregressive Image Generation Models via Reinforcement Learning

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-05-19T21:22:48.539798Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:3da25d4192ce43ef3c6117553724bce26428ea77f1f935e6f29ba5793865b608

Observation 2e8bf2f2-27b2-469b-8588-9945b2aee1de · outbound

This paper cites MMaDA: Multimodal large diffusion language models.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models MMaDA: Multimodal large diffusion language models

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T21:23:14.836812Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:bd9dead1ba6a324d74745346df1ba94680d7e0b7c616679d9f19879c8407be56

Observation 30505bb3-d463-428e-b049-b7f80845073a · outbound

This paper cites Lumina-dimoo: An omni diffusion large language model for multi-modal generation and understanding.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Lumina-dimoo: An omni diffusion large language model for multi-modal generation and understanding

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-19T21:22:48.614059Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:3c19acf41dd1aff7d145a6a94f1323f57c9bd0ac1e35ab80eb24eb1475e10b35

Observation da9e6d2b-6a40-4784-852f-cb7b644f0ee3 · outbound

This paper cites Muddit: Liberating generation beyond text-to-image with a unified discrete diffusion model.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Muddit: Liberating generation beyond text-to-image with a unified discrete diffusion model

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T21:23:14.841180Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:0590e97b35211b0db2a2054a6b81f2422b80aa2c01bbf9f0e2e6e303f1b44f00

Observation 11c948bd-60f3-452a-84b3-c19168cd5d62 · outbound

This paper cites LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-05-19T21:22:48.556143Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:f4bd3ba9e4d007f959b4923a7c9d74e8e0ca4bf70ea2c9520911453efcf13038

Observation b76634e9-5341-4712-be1f-9e45cfcb7ec2 · outbound

This paper cites Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-07-17T01:20:38.687334Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:2844e4b93fa7c13f7a8692dc7105c55f7995d089bc8ca0cc3e35f9fcbf49ac1d

Observation 19a736db-3bec-4b98-abca-f4da32c0c141 · outbound

This paper cites Llada-o: An effective and length-adaptive omni diffusion model.arXiv preprint arXiv:2603.01068.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Llada-o: An effective and length-adaptive omni diffusion model.arXiv preprint arXiv:2603.01068

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-05-19T21:22:48.520427Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:3f45ae3d84de234e4dc38449de3602634dee55b84998cc7e9f0b4bd796ee7535

Observation 50693bed-ee73-4bee-b287-d33541b9c364 · outbound

This paper cites Consolidating reinforcement learning for multimodal discrete diffusion models.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Consolidating reinforcement learning for multimodal discrete diffusion models

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-05-19T21:22:48.599261Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:fd906340c58e065e9782ade3ab5bc7eb9f960a21b2cb57807e5b30111d5ba574

Observation 045966a3-6947-4a08-be20-0d284b7cb4ce · outbound

This paper cites d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-19T21:22:48.533291Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:6061c86d6cdcdb274abb062c7e9282c0649f146c6cf88e4e1c754d140594cc4c

Observation 8df9261b-ad7f-4cbb-8250-ba7c7bf647fd · outbound

This paper cites UniGRPO: Unified policy optimization for reasoning-driven visual generation.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models UniGRPO: Unified policy optimization for reasoning-driven visual generation

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-05-19T21:22:48.514071Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:0fbffc5e1e7aecacfba9c497f13d8b020f4672e368e89385cae83aeb8620853e

Observation 9f028af6-4e13-4f28-b5e5-57169d77a00d · outbound

This paper cites Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models

Reference 22

Resolution
metadata mismatch
arxiv_id, observed 2026-05-19T21:22:48.527344Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:056abf4fa0633ba69235f1d10bff2dfccd8ce76f13ffbd6fd66acddc567a1712

Observation 508e0e80-055f-474a-b128-f84a38cd4b72 · outbound

This paper cites Taming masked diffusion language models via consistency trajectory re- inforcement learning with fewer decoding step.arXiv preprint arXiv:2509.23924.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Taming masked diffusion language models via consistency trajectory re- inforcement learning with fewer decoding step.arXiv preprint arXiv:2509.23924

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-19T21:22:48.571256Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:efeaaa7aebc59a9a3eab953f3c4fd03aa71a3025811c159ef19a31e331519d11

Observation 32f8586d-e94d-4a0f-ad2b-82986eb3f894 · outbound

This paper cites d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models

Reference 24

Resolution
verified exact
local_arxiv, observed 2026-05-19T21:22:48.544553Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:6a91e2f2c375e2dd5401760b827123919e33d4c1b59701ce2e2f10e7a1c981df

Observation 89987c6c-4ccc-4e06-aa44-bea15b840bdc · outbound

This paper cites Simple Policy Gradients for Reasoning with Diffusion Language Models.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Simple Policy Gradients for Reasoning with Diffusion Language Models

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-07-24T02:22:55.208247Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:ef5b8bc2e213e727a0011c0d622119b9dca6ae1f41a2013282cb19ae0e7a07d7

Observation e9c06bac-9a0a-4879-8e30-b8c3324089c8 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 26

Resolution
verified exact
local_arxiv, observed 2026-05-19T21:22:48.501485Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:8f5b5f343dc45382d3a3cad32e1daf79fce33a16d1d2e180e7946bd7171bc147

Observation 754a7ebc-c948-497b-84da-7e731bc611d4 · outbound

This paper cites SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis

Reference 27

Resolution
verified exact
local_arxiv, observed 2026-05-19T21:22:48.431438Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:30829f767bc2dd6ab7650d210d8c424e5881c14c70e097ccaf2644255b6bfdbb

Observation 731adc10-f142-41e0-9f79-2628b7ed5c5b · outbound

This paper cites Improving image generation with better captions.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Improving image generation with better captions

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T21:23:14.830465Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:5cddf0e211281eb5280d2d4670f60a570afdb54c6eabf58f03bdc381e7957676

Observation a1130de7-6474-4f9e-95c0-3cc584e0fef5 · outbound

This paper cites Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling

Reference 29

Resolution
verified exact
local_arxiv, observed 2026-05-19T21:22:48.425470Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:6501e6fb32f57c023d66c32466b24822e5f9c1a3b548b576a541d30d93b4988f

Observation d1e86647-b1ff-42aa-a788-9fd27d94531d · outbound

This paper cites FLUX.1.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models FLUX.1

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T21:23:14.845788Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:e4b49e131e40eedc2436c28883601fa6313ebc3c3b4e487f96675c78652c18b5

Observation d0c393cc-7d6f-43d3-a6bf-dd3c5e7a621d · outbound

This paper cites Geneval: An object-focused frame- work for evaluating text-to-image alignment.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Geneval: An object-focused frame- work for evaluating text-to-image alignment

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T21:23:14.843784Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:28bfacc6c615e86a9a105ba79840a258d6f40e67bb1dd28fa7e4906134b6a522

Observation 3e969a29-2444-4384-a7bd-50f94a3fcaa5 · outbound

This paper cites ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment

Reference 32

Resolution
verified exact
local_arxiv, observed 2026-05-19T21:22:48.494085Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:3a76698044b0549dc191069680721dfb51aed461ba2c2f93c91820fab9b30c02

Observation 6fbac765-82e6-45a8-90bf-cc8b354d35ac · outbound

This paper cites Imagereward: learning and evaluating human preferences for text-to-image generation.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Imagereward: learning and evaluating human preferences for text-to-image generation

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T21:23:14.826422Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:d3aea932e1fffd5c0f62656d2fc41eb3c6166fac2d094d9a0460880cd4098c82

Observation 1dac2acf-fc10-4930-a583-d6d43c4265f3 · outbound

This paper cites Teaching large language models to regress accurate image quality scores using score distribution.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Teaching large language models to regress accurate image quality scores using score distribution

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T21:23:14.828644Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:8e42c1307f11d4c3517fb54f3b9b8c8773fb19495ef45ea237af2966ebc4420e

Observation 65ca208e-e063-481a-9b88-fbb1c8e4aceb · outbound

This paper cites HPSv3: Towards Wide-Spectrum Human Preference Score.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models HPSv3: Towards Wide-Spectrum Human Preference Score

Reference 35

Resolution
verified exact
arxiv_id, observed 2026-05-19T21:22:48.489020Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:e5eee165889b538eb3d0da9c0eb6661dc78666ce8f19e9f896bae884db7b5374

Observation 0242c09e-15c0-4699-9494-8508ea85e858 · outbound

This paper cites UniPercept: Towards unified perceptual-level image understanding across aesthetics, quality, structure, and texture.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models UniPercept: Towards unified perceptual-level image understanding across aesthetics, quality, structure, and texture

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-05-19T21:22:48.455806Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:80b180a3f505983dfe9c9b33321bb2de2ebbf23ee20fd114e9f4a94c59f57fa2

Observation 6b05eaff-e18c-4254-939e-045314f50c4d · outbound

This paper cites clip-score: CLIP Score for PyTorch.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models clip-score: CLIP Score for PyTorch

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T21:23:14.819217Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:b0875cbaf093555ab5c14b8f402c17f08ccaa741f6555995896a30568d6bf18f

Observation 2fdc3926-48ad-4e9b-b568-bdcab2bb034d · outbound

This paper cites Unified Reward Model for Multimodal Understanding and Generation.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Unified Reward Model for Multimodal Understanding and Generation

Reference 38

Resolution
verified exact
local_arxiv, observed 2026-05-19T21:22:48.483463Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:db27c9ff0847866c7f46cec2dc6db76924358e3b09ff443ebca70994836adc67

Observation 6f9d2259-a4e9-464b-a4e3-d7c43a0dd455 · outbound

This paper cites Johnson, Jonathan Ho, Daniel Tarlow, and Rianne van den Berg.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Johnson, Jonathan Ho, Daniel Tarlow, and Rianne van den Berg

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T21:23:14.824069Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:575607555f84c6b15b756e17b779cea4c2548dbf11965d0af9982491ed9f52c8

Observation f28d3db0-58cd-4bff-a49d-a45b13c4037f · outbound

This paper cites Discrete diffusion modeling by estimating the ratios of the data distribution.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Discrete diffusion modeling by estimating the ratios of the data distribution

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T21:23:14.821718Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:e0169e2f363dc7944d3838393851a48442113075ebdbe6c8430908b6abd84ea1

Observation 98cf98dc-4091-4eb2-99b9-f2ad3fee626a · outbound

This paper cites Scaling diffusion language models via adaptation from autoregressive models.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Scaling diffusion language models via adaptation from autoregressive models

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T21:23:14.838801Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:cc2d74ca31126cbdddcd72bc2521426bb9d16060630585d8a179fc6ea0431cf4

Observation e22a7270-976a-41cc-8b63-7aa22625632a · outbound

This paper cites Large Language Diffusion Models.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Large Language Diffusion Models

Reference 42

Resolution
verified exact
local_arxiv, observed 2026-05-19T21:22:48.443148Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:d6a42692d02d9286e40699629c22ddc444fd29cf0c193f2ddb5c9c7235c9f403

Observation 3b432af3-f9ae-42fb-b2ef-eddb1f865cb6 · outbound

This paper cites LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models

Reference 43

Resolution
verified exact
local_arxiv, observed 2026-05-19T21:22:48.478160Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:f5ff5344c8e497e7442c4c32055fa2119e0b51863b1f2d574a55faf284a383cd

Observation 97d16801-5838-4526-827a-d903d58cf0e7 · outbound

This paper cites LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning

Reference 44

Resolution
verified exact
local_arxiv, observed 2026-05-19T21:22:48.437357Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:0cb86741a76fcdfbccc7a299b0a6adf49b9f2994786e73f3edd7e5257a2a2988

Observation 1d6495f0-0281-4b73-b7fd-0d06863f0283 · outbound

This paper cites Muddit: Liberating generation beyond text-to-image with a unified discrete diffusion model.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Muddit: Liberating generation beyond text-to-image with a unified discrete diffusion model

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-05-19T21:23:14.817260Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:093d8d1e2752dee3bdb83742109cec881f7a0394549b35b84c8ef4bf14d7f73f

Observation 563b469b-003a-4174-9ac3-73389ab9136b · outbound

This paper cites Mmada-parallel: Multimodal large diffusion language models for thinking-aware editing and generation.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Mmada-parallel: Multimodal large diffusion language models for thinking-aware editing and generation

Reference 46

Resolution
verified exact
arxiv_id, observed 2026-05-19T21:22:48.467402Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:a6da02d658f834315555e155ec3ade2285508f393dc104f607f82d4c02b21d6a

Observation 21d20a71-dd7b-4be5-8d7f-261f920d7e64 · outbound

This paper cites dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models

Reference 47

Resolution
verified exact
local_arxiv, observed 2026-05-19T21:22:48.472803Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:9ac2f5ad16a435d96e6b7848ac22cb9617465db5d4c219cbdf451927fee82d0e

Observation de768d80-be33-49b7-93e1-023f208db194 · outbound

This paper cites Accelerating masked image generation by learning latent controlled dynamics.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models Accelerating masked image generation by learning latent controlled dynamics

Reference 48

Resolution
verified exact
arxiv_id, observed 2026-05-19T21:22:48.461949Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:e2b0d6f72a39061fc3b88092da85f990e71c630af81b4b254c65adde1244df5a

Observation 8866971d-2261-42c5-a2f3-6420c34e7549 · outbound

This paper cites book above laptop.

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models book above laptop

Reference 49

Resolution
verified exact
arxiv_id, observed 2026-05-19T21:22:48.450511Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T21:18:03.005508Z digest=sha256:6c8b72016b8c1b7d88b74c16ef1a0ff4cafebfb5d08a3897c36f1a102c357603

Pith citing papers

No inbound Pith citation observations are available.