Pith. sign in

Paper Citation Record · LEDGER

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization

As of 6 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2605.28615.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2605.28615 v1

Coverage vector

measured 58 of 58 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-06-29T13:15:24.299457Z

measured 58 of 58 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-05T06:32:48.257954+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

58 of 58 outbound references displayed

  • verified exact19
  • verified fuzzy0
  • unresolved30
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch9

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation da92fc0e-3dc2-424e-acd0-5398b05fc4f4 · outbound

This paper cites VisMin: Visual Minimal-Change Understanding.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization VisMin: Visual Minimal-Change Understanding

Reference 1

Resolution
verified exact
arxiv_id, observed 2026-06-29T13:23:28.314661Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:a09caa83d3cf94b9d76d3ed2a8e755d456d196ae90c77a6e8d5ef05936635c9a

Observation 4b9540b2-3eca-41bf-8f96-0a404812eb55 · outbound

This paper cites Qwen2.5-VL Technical Report.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Qwen2.5-VL Technical Report

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-06-29T13:23:28.317010Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:cc0a214cc9ae3377ecc493a0faf4864eb65a5c0d878335cfae48412c8b9bd175

Observation 397f5500-d34d-4245-a4b8-d14e052a5854 · outbound

This paper cites Improving image generation with better captions.Computer Science.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Improving image generation with better captions.Computer Science

Reference 3

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:6ed2ffd46fb18eec4f7ddf22c370ac09b9bb9c740f9244741b8d326ba7d4f4ef

Observation 9cf8ec4d-9e15-4ce6-bd25-9519ae47445a · outbound

This paper cites Attend-and-excite: Attention-based semantic guidance for text-to-image diffusion models.ACMTransactionson Graphics(TOG), 42:1 – 10, 2023.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Attend-and-excite: Attention-based semantic guidance for text-to-image diffusion models.ACMTransactionson Graphics(TOG), 42:1 – 10, 2023

Reference 4

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:c31c38546f488179afe0fc199f0f3e906607d168a43d2494c996ebf9b3fc08e1

Observation c43429ae-55f5-43cb-84d4-0878a77fe81a · outbound

This paper cites PixArt-$\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization PixArt-$\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis

Reference 5

Resolution
metadata mismatch
local_arxiv, observed 2026-06-29T13:23:28.312079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:fe781f42edc3dfee2114f4f720bfa47886bbb76c5eb4c8702b94df322be94bba

Observation 884d61e2-7a99-4f7f-9b5c-98446b851b3a · outbound

This paper cites Gentron: Diffusion transformers for image and video generation.2024 IEEE/CVF Conferenceon ComputerVisionand PatternRecognition(CVPR), pages 6441–6451, 2023.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Gentron: Diffusion transformers for image and video generation.2024 IEEE/CVF Conferenceon ComputerVisionand PatternRecognition(CVPR), pages 6441–6451, 2023

Reference 6

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:2dbd3c1640317868989dc81eb8b3701572671d1ec2ca7be489774b9d6a7d76d0

Observation c9e9757a-3d36-4281-a70d-0ee0cee81a3d · outbound

This paper cites DeepSeek-V3 Technical Report.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization DeepSeek-V3 Technical Report

Reference 7

Resolution
metadata mismatch
local_arxiv, observed 2026-06-29T13:23:28.329419Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:1633f2fc83e67514858618584fb37df5c1bc92a861a55a132d4fe1f41d64f0f3

Observation 22c8f37c-3e86-4cd3-80a9-568ce0c8f71b · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-06-29T13:23:28.327103Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:94d1ac63561cdc706c031ae4c56d1de18ec73b17e923cb14a0885c89bd8e102a

Observation 12e5ab3d-ad4a-4ba9-bcf9-e0935418d10a · outbound

This paper cites Scaling rectified flow transformers for high-resolution image synthesis.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Scaling rectified flow transformers for high-resolution image synthesis

Reference 9

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:58f3936e1d9ea0b31c9e63e22c07e6e603b1268a3ce70b24b02c797ff10e783e

Observation 7939cb22-7437-47a6-b7e2-853ff16cc20d · outbound

This paper cites Dimba: Transformer-Mamba Diffusion Models.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Dimba: Transformer-Mamba Diffusion Models

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-06-29T13:23:28.309648Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:885e447686906c6a9cc96c1ab622b38ba5aba828f7334180678dbf10631920ee

Observation 9bd29546-d6fa-46d9-9c78-ce15dbaf8ea9 · outbound

This paper cites Ranni: Taming text-to-image diffusion for accurate instruction following.2024IEEE/CVFConferenceonComputerVisionandPatternRecognition(CVPR), pages 4744–4753, 2023.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Ranni: Taming text-to-image diffusion for accurate instruction following.2024IEEE/CVFConferenceonComputerVisionandPatternRecognition(CVPR), pages 4744–4753, 2023

Reference 11

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:1d1f3fe7455f4bd19ae6e29ce13a83dd8e46102ec747df1ff7eb454a70a91632

Observation 4ce23e08-8cb8-4e1b-a379-7d7e40aea350 · outbound

This paper cites Geneval: An object-focused framework for evaluating text-to-image alignment.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Geneval: An object-focused framework for evaluating text-to-image alignment

Reference 12

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:0b52f48acf144e985b99e10f11676659a1bcf640f92f1f5e739b80d9b196fa37

Observation d0502b47-7384-41c1-8920-aca5d3635f82 · outbound

This paper cites Contrafusion: Contrastively improving compositional understanding in diffusion models via fine-grained negative images.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Contrafusion: Contrastively improving compositional understanding in diffusion models via fine-grained negative images

Reference 13

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:bfbcc33904b563cd4b62e54f03736aea06dbd03797f69376017334c0c369b71c

Observation df9c6714-1456-44b4-a6fd-4d87ef5e18a3 · outbound

This paper cites MARS: Mixture of Auto-Regressive Models for Fine-grained Text-to-image Synthesis.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization MARS: Mixture of Auto-Regressive Models for Fine-grained Text-to-image Synthesis

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-06-29T13:23:28.310544Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:da5acbbd7969da21c4879b986557efe1261fef32f0611d67d1ae385a596f8407

Observation c882f8b3-e18b-4f3f-8146-05a01988d4fb · outbound

This paper cites arXiv preprint arXiv:2406.06424 , year=.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization arXiv preprint arXiv:2406.06424 , year=

Reference 15

Resolution
metadata mismatch
arxiv_id, observed 2026-06-29T13:23:28.307268Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:d5bb62c45ff044978485464dce6100bbb11d7143cf218c88f2e7e6eac3ead796

Observation bcab43c5-1ad2-4ddd-8ff2-61ce94027cd1 · outbound

This paper cites Lora: Low-rank adaptation of large language models.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Lora: Low-rank adaptation of large language models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:0135c76c9a4654ccac303f26fd955b200d6586e65c69c4d8040f18c1398d9107

Observation adbcec71-95ac-4dc7-a516-b0955fcb410e · outbound

This paper cites Ella: Equip diffusion models with llm for enhanced semantic alignment, 2024.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Ella: Equip diffusion models with llm for enhanced semantic alignment, 2024

Reference 17

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:034cba4eaff0db1f5a2cdde3e7e4098c9c271cd57206ed01f40d19388f430e3a

Observation 27dbad8e-e2ed-40b6-a4f2-e71b802a6e31 · outbound

This paper cites T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation

Reference 18

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:300bade30dff8efc20ca1d1363a157a473168d2aca4c0850b8ca2fbbe4bb6c62

Observation 284535c7-d273-4ca5-a1f0-286ab423d777 · outbound

This paper cites T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-06-29T13:23:28.308162Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:8e292812f09b48b9fd99d4f2d30cdde1632c28da71a5da283b11c1fd968235f2

Observation 6e1111f1-bca1-4c11-bf02-1835c8669516 · outbound

This paper cites yes" or.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization yes" or

Reference 20

Resolution
metadata mismatch
arxiv_id, observed 2026-06-29T13:23:28.324392Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:e8c1afb4e8190f407d8a0283c9e546ed6b792dc8747c4a1c7fca2ef43fe462b8

Observation 9e90e67f-754f-46fc-97ec-e4e09aa3de87 · outbound

This paper cites Scalable Ranked Preference Optimization for Text-to-Image Generation.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Scalable Ranked Preference Optimization for Text-to-Image Generation

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-06-29T13:23:28.319598Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:d7ba2154d10bcd62e3bf1abbd8ae15e18ada29df5c2689137751cfeed83f6429

Observation 510e5633-8fae-46cd-bcb5-89b3225bd7c7 · outbound

This paper cites Flux.https://github.com/black-forest-labs/flux, 2024.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Flux.https://github.com/black-forest-labs/flux, 2024

Reference 22

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:98c2060c8897aca28b7746f13ff1cd18ad34b3d43e663685df38cf246d57b606

Observation 303f0d4d-bc8c-4e45-ae45-e447a04a7648 · outbound

This paper cites Aligning Text-to-Image Models using Human Feedback.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Aligning Text-to-Image Models using Human Feedback

Reference 23

Resolution
verified exact
local_arxiv, observed 2026-06-29T13:23:28.296582Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:ccdf38e70acf77a717fda05c9c610aa7c6dbae5f98ba29184fe35d282cb7c9a7

Observation cc80049c-57e2-42fb-8447-4cb2862d5099 · outbound

This paper cites an unresolved cited work.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Unresolved cited work

Reference 24

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:d34e4c0d559b4a29d0ee5356dac5360ea5f8bebeeaad27f4ac7c0a7142007a9b

Observation 46780f46-8b9d-45b9-9b28-593598929161 · outbound

This paper cites Calibrated multi-preference optimization for aligning diffusion models.2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 18465–18475, 2025.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Calibrated multi-preference optimization for aligning diffusion models.2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 18465–18475, 2025

Reference 25

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:492d0d6f711f5a0c7f6cbf787c7b6b2f920ce65a3bc175cb9b822889b393f0ad

Observation acdb1d11-57c8-4ee4-982e-01fd1f432468 · outbound

This paper cites Playground v2.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Playground v2

Reference 26

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:b8245d34db7dc90b489623b7366f95554d6740f7c7b7335f6397b1571ff674fe

Observation cb6d2f2b-4f5b-423e-9a6a-40575aedd698 · outbound

This paper cites Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation

Reference 27

Resolution
verified exact
local_arxiv, observed 2026-06-29T13:23:28.281901Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:0de99fc69aaae72a47dc634f4537200e8c6a66070742ffbf928870fb97d3f064

Observation 6f97e364-a2f8-43ea-bb8e-2bd33348ce8d · outbound

This paper cites Gligen: Open-set grounded text-to-image generation.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Gligen: Open-set grounded text-to-image generation

Reference 28

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:4ac58dfd398b46a392ef18c173e85b4e4cf953cfd53be5d93b0381e091162f05

Observation 557264fc-ffe9-48f0-ab1f-15a838f98369 · outbound

This paper cites LAION-SG: An Enhanced Large-Scale Dataset for Training Complex Image-Text Models with Structural Annotations.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization LAION-SG: An Enhanced Large-Scale Dataset for Training Complex Image-Text Models with Structural Annotations

Reference 29

Resolution
metadata mismatch
arxiv_id, observed 2026-06-29T13:23:28.277687Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:941f1615a2911710eb3d7884daaf8ea76b4f5b15981f2832574a5c3545467637

Observation d7917592-7b31-47fe-b35f-64250911c9eb · outbound

This paper cites Llm-grounded diffusion: Enhancing prompt understanding of text-to-image diffusion models with large language models.Trans.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Llm-grounded diffusion: Enhancing prompt understanding of text-to-image diffusion models with large language models.Trans

Reference 30

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:12233b0fba58c03b84f7c69abf4f96e2bfad5f1762e6384a704e2c1cb3dd7358

Observation 91ef9bd6-f350-468b-94b6-76255911bfef · outbound

This paper cites LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-06-29T13:23:28.288224Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:660b742cd940b07e0c17799581775a32496a80373baa2b231d77dc9217b72311

Observation 42e4fffa-f157-4e67-88d8-e82c8036d534 · outbound

This paper cites Aesthetic post-training diffusion models from generic preferences with step-by-step preference optimization.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Aesthetic post-training diffusion models from generic preferences with step-by-step preference optimization

Reference 32

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:e9b02eca688d5ca2a2050002a1eda48913f28c465e0aacf4aca0468705e12557

Observation c6e39825-1d71-4628-8429-6cbf1de93d74 · outbound

This paper cites Grounding dino: Marrying dino with grounded pre-training for open-set object detection.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Grounding dino: Marrying dino with grounded pre-training for open-set object detection

Reference 33

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:d4fef231ed03baa7daa5a3c5f68d387950eb28f3bdbf19045e041df55b6525f4

Observation 582ff4b1-4d6c-49fb-a319-2788ecc4919d · outbound

This paper cites Eclipse: A resource-efficient text-to-imagepriorforimagegenerations.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Eclipse: A resource-efficient text-to-imagepriorforimagegenerations

Reference 34

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:f9bdc5aecf5f504bebe1dadf1183b055e5d1dc104e1ead96892fed508addac41

Observation 183dc7a8-7d43-4fb5-b305-1a7a1f153a78 · outbound

This paper cites Enhancing image layout control with loss-guided diffusion models.2025IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), pages 3916–3924, 2024.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Enhancing image layout control with loss-guided diffusion models.2025IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), pages 3916–3924, 2024

Reference 35

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:f8f23222541c0b757d1686bc5026d9859380a923d6e0eb3e9bb71246d8495151

Observation 1326b9df-2b21-4376-84c5-177c51a1bb88 · outbound

This paper cites Scalable diffusion models with transformers.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Scalable diffusion models with transformers

Reference 36

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:1c3c1d6cc248065d0bde98f3ddee022ef16d8dcf0031517f38effd27e724232f

Observation 6ad8a84f-e736-4331-ad3c-f7c5c9d1954b · outbound

This paper cites SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis

Reference 37

Resolution
metadata mismatch
local_arxiv, observed 2026-06-29T13:23:28.317518Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:b6c88ab12f30f9c6d9cb420a6448682130afb1499d8be291a7a97a33032b7cc4

Observation 4ac09c30-23ee-4d5c-ad04-cf8e721d43b0 · outbound

This paper cites Direct Preference Optimization: Your Language Model is Secretly a Reward Model.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Reference 38

Resolution
metadata mismatch
local_arxiv, observed 2026-06-29T13:23:28.321794Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:02f6495e62458e02369b5b9ac32cf748dd10ee50a71b6a09c52266f6dd038871

Observation 6ad5b72b-5caa-46ff-96a8-145544cd971b · outbound

This paper cites SAM 2: Segment Anything in Images and Videos.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization SAM 2: Segment Anything in Images and Videos

Reference 39

Resolution
metadata mismatch
local_arxiv, observed 2026-06-29T13:23:28.271295Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:670a91a98420f7942c8f35908ca622fb53067941e62693a9a316a1243f6b0ef2

Observation 0dfba7f4-d6ed-44cc-9586-697314419e31 · outbound

This paper cites Blattmann, Dominik Lorenz, Patrick Esser, and Björn Ommer.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Blattmann, Dominik Lorenz, Patrick Esser, and Björn Ommer

Reference 40

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:8b22d5b88e4ddbdbb5a9e34362bd63a77a8318dff9be01003e4fb2120ab820b0

Observation ec046f94-920a-4af2-a4d9-2e965bf65b65 · outbound

This paper cites Joty, and Nikhil Naik.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Joty, and Nikhil Naik

Reference 41

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:7c8b3e9d239b4f5e5d01fffbee7db5e45747bada727c5b8c48ed44d05febe9ec

Observation 4a0f52fc-1ad2-4af7-9ed1-3e5559e29059 · outbound

This paper cites Emu3: Next-Token Prediction is All You Need.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Emu3: Next-Token Prediction is All You Need

Reference 42

Resolution
verified exact
local_arxiv, observed 2026-06-29T13:23:28.268975Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:16c14239e9961eb5b9024f05636c07af427f7034ea80c567ef99c97be59e38e4

Observation 835069a5-55c0-4959-9602-71d237bbe30c · outbound

This paper cites Instancediffusion: Instance- level control for image generation.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Instancediffusion: Instance- level control for image generation

Reference 43

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:89c1b186a769db5f81f4373cb3a92123e0abb09dd4c141e2790098bd3c193c39

Observation db404a6b-ccc1-43c2-aba7-98f5806b4c31 · outbound

This paper cites Tokencompose: Text-to-image diffusion with token-level supervision.2024 IEEE/CVF Conferenceon ComputerVisionand PatternRecognition(CVPR), pages 8553–8564, 2023.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Tokencompose: Text-to-image diffusion with token-level supervision.2024 IEEE/CVF Conferenceon ComputerVisionand PatternRecognition(CVPR), pages 8553–8564, 2023

Reference 44

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:50b1ad87d496959911a23ed1746d74b54c113b62814ffffbd4c9aa3df1237601

Observation effb093e-0bbe-441b-9d17-e9717133fcc0 · outbound

This paper cites Qwen-Image Technical Report.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Qwen-Image Technical Report

Reference 45

Resolution
verified exact
local_arxiv, observed 2026-06-29T13:23:28.264372Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:f9bf9b1fe933c32de7978d99aa5dac0347ea15d72da02551bd27b9011d5ad6e9

Observation 449a95db-e5f9-44f2-89da-6a4985fa6fe7 · outbound

This paper cites Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis

Reference 46

Resolution
verified exact
local_arxiv, observed 2026-06-29T13:23:28.266858Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:d1de35f671e6bb2e779059e776b3b2ebf2f2e727b186207395a2d9589d0e59d6

Observation e4c0aaf3-2f4d-46d8-92d2-4d07a2b27c62 · outbound

This paper cites an unresolved cited work.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Unresolved cited work

Reference 47

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:3cc01b624f9cc216e81d3fb05b05ae5a5bc44017bf95c211e9d930936ba49c61

Observation 984973a1-1b85-409a-85f0-f32006326c4d · outbound

This paper cites Boxdiff: Text-to-image synthesis with training-free box-constrained diffusion.2023IEEE/CVFInternational Conferenceon ComputerVision(ICCV), pages 7418–7427, 2023.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Boxdiff: Text-to-image synthesis with training-free box-constrained diffusion.2023IEEE/CVFInternational Conferenceon ComputerVision(ICCV), pages 7418–7427, 2023

Reference 48

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:213b8bffc24811bd5d1276a0366ff10a58e473f9179eae0c7a6d7b6da73e956b

Observation d25c841a-26d7-402b-88e4-7de930f84fb1 · outbound

This paper cites Show-o: One Single Transformer to Unify Multimodal Understanding and Generation.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Show-o: One Single Transformer to Unify Multimodal Understanding and Generation

Reference 49

Resolution
verified exact
local_arxiv, observed 2026-06-29T13:23:28.262113Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:e1a68566ea1b57b497c7df81b6f41cc09f3e3c121c18f09890bb514f6136ac27

Observation e5da4431-8128-489a-8fe0-2c0fdf5f475a · outbound

This paper cites ImageReward: Learning and Evaluating Human Preferences for Text-to-Image Generation.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization ImageReward: Learning and Evaluating Human Preferences for Text-to-Image Generation

Reference 50

Resolution
metadata mismatch
arxiv_id, observed 2026-06-29T13:23:28.301718Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:bf92cb78890258b56849b8fa3cb54d93d7843ce67a19b2265cd05cc1d070edf7

Observation 276680a2-f601-4dcf-bb86-2f6e84230380 · outbound

This paper cites Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs

Reference 51

Resolution
verified exact
arxiv_id, observed 2026-06-29T13:23:28.259292Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:075bde4d7139083b409455092988a62545392f1968bd178b2f94a0a0977e5dd8

Observation b2376fc3-d09e-491b-ab3d-ff9d59f8ace6 · outbound

This paper cites CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation

Reference 52

Resolution
verified exact
arxiv_id, observed 2026-06-29T13:23:28.291397Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:1567e1e082934e21ed4cb1262af4478307cce5415fd1ea2422d7cc93e43b25d6

Observation 469978e9-f216-421d-9a3b-551371990134 · outbound

This paper cites Diffusionmodelasanoise-aware latent reward model for step-level preference optimization.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Diffusionmodelasanoise-aware latent reward model for step-level preference optimization

Reference 53

Resolution
verified exact
arxiv_id, observed 2026-06-29T13:23:28.274092Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:005c10870582b4a9a4b3e06faa2528cbd8a1a67d57b9d881ab29f615385f93f8

Observation 14a3fe6d-9416-4690-b1b3-fd2691a4c0ad · outbound

This paper cites an unresolved cited work.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Unresolved cited work

Reference 54

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:bb830f2d1502723e74eb2daf128a9abf5290b0b6f14c20e6052a8ebf3a5742c2

Observation 4b283f70-325c-4771-9399-2aeb653f65b2 · outbound

This paper cites Itercomp: Iterative composition-aware feedback learning from model gallery for text-to-image generation.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Itercomp: Iterative composition-aware feedback learning from model gallery for text-to-image generation

Reference 55

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:da28bd21afc14b6348a73baefc2d75382f8a3eb72ec7f9b0e05ce47a0c40c2b3

Observation 7a0a4529-8acb-4d06-9d30-ebdc5e3679fe · outbound

This paper cites ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL

Reference 56

Resolution
verified exact
arxiv_id, observed 2026-06-29T13:23:28.285430Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:7d6224747bf38041b3426aa41831b8ff39c0f714fb265905868f4c9dbef26875

Observation c74e5544-ffba-43da-b3d8-8d7efb67f563 · outbound

This paper cites an unresolved cited work.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Unresolved cited work

Reference 57

Resolution
unresolved
no resolver link, observed 2026-06-29T13:15:24.299457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:87064a57534f24202c1e0cf54788f220f084b97806d90f74cd8e0445b3da1f4e

Observation fee82bc0-6dc0-45e1-8278-a456b7da04f0 · outbound

This paper cites Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT

Reference 58

Resolution
verified exact
arxiv_id, observed 2026-06-29T13:23:28.299117Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:3703c9d9b6bf42267ec10db26d81b55b97d0782004237b1d26051e027519dd7a

Pith citing papers

No inbound Pith citation observations are available.