Pith. sign in

Paper Citation Record · LEDGER

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation

As of 9 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2505.19874.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.19874 v1

Coverage vector

measured 54 of 54 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:09:51.624919Z

measured 55 of 55 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-28T15:39:15.744954Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T22:16:15.736010Z

Reference resolution

54 of 54 outbound references displayed

  • verified exact0
  • verified fuzzy5
  • unresolved49
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation fca194cd-a8c3-4df0-bf7a-6449a1491836 · outbound

This paper cites Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:45.731908Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:45.731908Z digest=sha256:6ae51772908c564e62a6f2c76825a2538cac003ca2f5aae40df35cd339c2803c

Observation 553fa905-4ac6-48b9-b1e9-47d505f6ce20 · outbound

This paper cites Training Diffusion Models with Reinforcement Learning.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Training Diffusion Models with Reinforcement Learning

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:45.870974Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:45.870974Z digest=sha256:92707cba8801656c92439fc26076becd558eb7c025224bd362a5ad12818c6391

Observation 3565bfa3-3c4d-4b1d-9819-e73f4624deba · outbound

This paper cites Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:45.950201Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:45.950201Z digest=sha256:9a163ad2e78b330504f57750bf2435a8ccf96035abad96eaab531af414f5f5d6

Observation 2ac5ac4d-1524-4b64-9514-e256ac64affa · outbound

This paper cites ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:46.064937Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:46.064937Z digest=sha256:d126222cbfb946a95b2a3472649cc1b312c19b5828239c1544cf54b5058e6cc8

Observation 2aa0bf26-a6e9-4d30-973b-3ca8139ac5df · outbound

This paper cites Scaling rectified flow transformers for high-resolution image synthesis.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Scaling rectified flow transformers for high-resolution image synthesis

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:46.163330Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:46.163330Z digest=sha256:92865a7ed57cfd692a7a1fa5294ce594473a4a9e9fd9c1a55f1c56303f8d401e

Observation 7d85b30b-5d56-475e-99e7-0f8838bcd45d · outbound

This paper cites Taming transformers for high-resolution image synthesis.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Taming transformers for high-resolution image synthesis

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:46.335590Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:46.335590Z digest=sha256:cbf8e04de574278d23a85852df73bb2303ae635b6b8035d66c78cca227163506

Observation 52a0af3a-fa36-40b7-9763-9d6f62c03901 · outbound

This paper cites Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:46.457415Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:46.457415Z digest=sha256:cc13994fc444538f3d8da1181a83f688b754bc7ccf51cc21eef5c45e0a9752b2

Observation 60228cfa-672a-4918-8fd0-757974f8416a · outbound

This paper cites Dpok: Reinforcement learning for fine-tuning text-to-image diffusion models.Advances in Neural Information Processing Systems, 36:79858–79885, 2023.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Dpok: Reinforcement learning for fine-tuning text-to-image diffusion models.Advances in Neural Information Processing Systems, 36:79858–79885, 2023

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:46.587603Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:46.587603Z digest=sha256:a7a0e7a1bfc5e0883e2f3cdf8a3f18ae23383efbb3beedc8e4fe517defbad4fd

Observation f88e1f5a-04fb-407b-8b98-d43ede3e84eb · outbound

This paper cites StyleShot: A Snapshot on Any Style.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation StyleShot: A Snapshot on Any Style

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:46.712967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:46.712967Z digest=sha256:baf2524a71989333d2bd9cf22ccead80a4a9487896983f8c2f3bb1491ce90c76

Observation eee7be35-5f74-40fc-ae14-402c4b3ccf6e · outbound

This paper cites Style aligned image generation via shared attention.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Style aligned image generation via shared attention

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:09:52.959159Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T14:09:46.821562Z digest=sha256:cf93d65f4470789216e18aec812493e8e8719deac7834f44860cfa84d12a0b13

Observation 8d6ae7e1-01ae-43f3-aad5-da71b25ca712 · outbound

This paper cites Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:46.917764Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:46.917764Z digest=sha256:9bf9a2557c5742697f701d4d39b1082a4648511286e6a1ba9f29c0a1efdf6e6f

Observation d9a81883-174d-4c7a-857b-a909adbb5bb3 · outbound

This paper cites ArtCrafter: Text-Image Aligning Style Transfer via Embedding Reframing.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation ArtCrafter: Text-Image Aligning Style Transfer via Embedding Reframing

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:47.012312Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:47.012312Z digest=sha256:23ca9d62bd64c26807b1978629951be89b327e391e380445914016563e0e61e7

Observation a0c6081a-9917-4462-95bb-3fa18a84a8df · outbound

This paper cites Perceiver: General perception with iterative attention.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Perceiver: General perception with iterative attention

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:47.106522Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:47.106522Z digest=sha256:eec417f851c0e18096f78147d95ceff53988e7dcbe0ac87e32f0989688334185

Observation 7852db0d-bada-4321-8f55-cfaa4444fbcf · outbound

This paper cites Visual Style Prompting with Swapping Self-Attention.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Visual Style Prompting with Swapping Self-Attention

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:47.274938Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:47.274938Z digest=sha256:a91bf6fc24dfe726e693d6fca6723c4b0e7f7a0584ec67ddc50d78249c6b6a8b

Observation fafef86f-84bd-4705-9e7a-981bb7cf327e · outbound

This paper cites Segment anything.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Segment anything

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:47.387252Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:47.387252Z digest=sha256:21c9e6515f97b3c4ef2cca3db0dcf5f552292d7ad01d4146fb8dbb05d818b2f0

Observation 3d1eaeae-a419-4d3f-aceb-f0793953549b · outbound

This paper cites Flux.https://github.com/black-forest-labs/flux, 2024.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Flux.https://github.com/black-forest-labs/flux, 2024

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:47.496926Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:47.496926Z digest=sha256:03fe1671057091813f35b19d8a9638998090cd2ccc2eb8bc1cc0b577a38e9762

Observation 62cec599-c947-4a54-b4b7-ad3b636aa6b3 · outbound

This paper cites Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:47.643689Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:47.643689Z digest=sha256:6bcf6fb2ff52d88f07cf4b1053ad809ca26cd7122580f80349de02befdb81064

Observation 4ab2158d-e721-4a63-b636-481678a58907 · outbound

This paper cites StyleCrafter: Enhancing Stylized Text-to-Video Generation with Style Adapter.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation StyleCrafter: Enhancing Stylized Text-to-Video Generation with Style Adapter

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:47.837080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:47.837080Z digest=sha256:a9442ae15cc9c909c3abb6a02ebc9047f3bc5b55ac8f8dc9e413bb733c135910

Observation 223b7d21-e690-430f-b59f-43440290ec1b · outbound

This paper cites Subject- driven text-to-image generation via preference-based reinforcement learning.Advances in Neural Informa- tion Processing Systems, 37:123563–123591, 2024.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Subject- driven text-to-image generation via preference-based reinforcement learning.Advances in Neural Informa- tion Processing Systems, 37:123563–123591, 2024

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:09:52.808695Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T14:09:47.959998Z digest=sha256:263e28a4070e850a437a51f9aed643705ed408aca83683e61a92e1fcb865d9de

Observation 2b3f036d-3edd-4154-8dd7-c4506dfa1e04 · outbound

This paper cites Null-text inversion for editing real images using guided diffusion models.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Null-text inversion for editing real images using guided diffusion models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:48.082465Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:48.082465Z digest=sha256:39921f62d7fba93722014067517ee4dde66f362b843a6d54a6cd3085b4b89628

Observation b130d34c-c462-45db-b785-95a970aac38a · outbound

This paper cites laion2b-en-aesthetic-square-cleaned.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation laion2b-en-aesthetic-square-cleaned

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:09:52.613031Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T14:09:48.196971Z digest=sha256:2356bacfba731a0c5d4c4fef7c9dc1b445a5757e85a6b40ec584b86061b71fb6

Observation 911f2656-fcfa-4452-8d16-551ae59a4052 · outbound

This paper cites Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:48.284105Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:48.284105Z digest=sha256:a0141fa710e329195649c8f2e80ac8a8d64b02588eb8631f71bea78c967f572a

Observation d50eb054-58ba-48c6-9ad2-6e456181a4b2 · outbound

This paper cites SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:48.397477Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:48.397477Z digest=sha256:9cd56f7fc9328b1222d9a3bfaad1f5ec46abd23f07d19bf8440e06289087fe86

Observation d5f0034e-e5c8-4564-985c-d8494719ec4f · outbound

This paper cites Learning transferable visual models from natural language supervision.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Learning transferable visual models from natural language supervision

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:48.520560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:48.520560Z digest=sha256:2dae09a1598f4acfa83e7cca9d65497797d0692186fba1dcba6b2502cdbc49f8

Observation f6c746c1-c854-42f7-ba74-323803890a41 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.Advances in Neural Information Processing Systems, 36:53728–53741, 2023.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Direct preference optimization: Your language model is secretly a reward model.Advances in Neural Information Processing Systems, 36:53728–53741, 2023

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:48.648234Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:48.648234Z digest=sha256:a471904730a287df3e423350046b9668b67d3a5ad4f599cf2fe0344bbca74fba

Observation 14e3aa5a-d94c-463c-9809-a11f8e8f719c · outbound

This paper cites High-resolution image synthesis with latent diffusion models.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation High-resolution image synthesis with latent diffusion models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:48.756291Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:48.756291Z digest=sha256:b3c63c61f779de403d93e86e71d8a6e772b97199bae025a303fcf29cb40f028f

Observation c3159c19-a960-4ef4-ab87-66015d4ed7c9 · outbound

This paper cites Dream- booth: Fine tuning text-to-image diffusion models for subject-driven generation.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Dream- booth: Fine tuning text-to-image diffusion models for subject-driven generation

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:48.908838Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:48.908838Z digest=sha256:7e7e6f68c963cb498c41bbadc6b48a7bf3eda85a0f0627ca8fca26e53aa0d978

Observation 26cfabbe-36b6-43a5-aac6-36c58d806951 · outbound

This paper cites Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in neural information processing systems, 35:25278–25294, 2022.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in neural information processing systems, 35:25278–25294, 2022

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:49.042874Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:49.042874Z digest=sha256:f7ccb079719d013c39f5de1f0e8b5c80d7d9a0a0faf616d4ff99b2f284953717

Observation 70dba0c1-a7db-4ba6-8332-8b89f016be9b · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:49.175385Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:49.175385Z digest=sha256:a5e9ff3e55082cade6598c39eac661da7aafcb0dd03be4ec03b0d4b7b7410438

Observation 9f323023-1822-4b25-992d-026a06635e34 · outbound

This paper cites StyleDrop: Text-to-Image Generation in Any Style.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation StyleDrop: Text-to-Image Generation in Any Style

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:49.329940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:49.329940Z digest=sha256:62a38ba6cb1b18f7d08ba8cfb57f8404d5df7cb7a638560b18a24ca1ad43753f

Observation 8b31ddba-8737-42d6-ba19-0449dca3b32a · outbound

This paper cites Personalized Text-to-Image Generation with Auto-Regressive Models.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Personalized Text-to-Image Generation with Auto-Regressive Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:49.457645Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:49.457645Z digest=sha256:adef08b3c8326f66d07bb88be7a936fd21d806c5f663a4c13f97fab340d2c803

Observation d910e862-9f95-4dc7-bcee-fe054e31eabb · outbound

This paper cites Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:49.568383Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:49.568383Z digest=sha256:326bdd657712b7647e6053f92f6baa362c8cd8c2f10cc0fd6d181ff42ce1bc3f

Observation 07711783-a8f8-499c-9f8f-d8908afdaad4 · outbound

This paper cites HART: Efficient Visual Generation with Hybrid Autoregressive Transformer.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation HART: Efficient Visual Generation with Hybrid Autoregressive Transformer

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:49.659343Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:49.659343Z digest=sha256:994416737fd6a9ba78080b586a3fe013e0f90c68719f4d996f533e2c1a16251a

Observation c3bc4e6a-cc68-4997-a6ef-2975ad03ecab · outbound

This paper cites Chameleon: Mixed-Modal Early-Fusion Foundation Models.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Chameleon: Mixed-Modal Early-Fusion Foundation Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:49.739182Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:49.739182Z digest=sha256:6d45c1645047fa89a2ad534baee6a4fb29bb46d715eb01dc45c8588338197c9e

Observation 32c66ba3-57c9-4e13-90f4-cf92abc8c600 · outbound

This paper cites Neural discrete representation learning.Advances in neural information processing systems, 30, 2017.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Neural discrete representation learning.Advances in neural information processing systems, 30, 2017

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:49.806310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:49.806310Z digest=sha256:aa0cabd2d4cc96f4b82331c2fe0ca50b9cfc79a518d0d612a0950b162e38c353

Observation 0e61c2d1-a85a-4246-8f3f-9c48c543c9d3 · outbound

This paper cites Attention is all you need.Advances in neural information processing systems, 30, 2017.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Attention is all you need.Advances in neural information processing systems, 30, 2017

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:49.891224Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:49.891224Z digest=sha256:7ad3b0cc6101e032a2c0f8889672949deecde1b5bde563ae3e3fb8c310a4b2bb

Observation 43711ad9-0f2f-4974-a897-03930acc6342 · outbound

This paper cites Diffusion model alignment using direct preference optimization.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Diffusion model alignment using direct preference optimization

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:49.981311Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:49.981311Z digest=sha256:1ab74df73c11fdb8b41135197be56eb24674ccc332237522cddb1e885cf1265a

Observation d25ef643-909f-4c41-8b38-62c3b186eafd · outbound

This paper cites InstantStyle: Free Lunch towards Style-Preserving in Text-to-Image Generation.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation InstantStyle: Free Lunch towards Style-Preserving in Text-to-Image Generation

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:50.090014Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:50.090014Z digest=sha256:35e370a73da04a27a7e929a37a6df458311c614d3390a8f041fedae585a6efaa

Observation 167101e9-00ba-48f5-916f-a737441f8334 · outbound

This paper cites SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:50.181832Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:50.181832Z digest=sha256:d2d3d2135257f2f1bf73514cf821614cc2c3cf04dea649313475e1a6dfa94c22

Observation 673a9799-3486-4b31-a59a-40c1f88c89bb · outbound

This paper cites Emu3: Next-Token Prediction is All You Need.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Emu3: Next-Token Prediction is All You Need

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:50.256992Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:50.256992Z digest=sha256:6651751939bb98bb4613a74e3e522fd2aa9369a26d206836a07dc7c7eb281b97

Observation 1837bbb7-6f50-4586-896c-b6370f689afc · outbound

This paper cites StyleAdapter: A Unified Stylized Image Generation Model.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation StyleAdapter: A Unified Stylized Image Generation Model

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:50.366092Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:50.366092Z digest=sha256:26215fa84ce5dc4962ae35631ad0ab90e4a5ecfe25c97b0c29983e5bcf2a48a7

Observation 58afe69c-7688-4c7d-b860-5502e679028b · outbound

This paper cites wikiart.https://huggingface.co/datasets/huggan/wikiart, 2022.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation wikiart.https://huggingface.co/datasets/huggan/wikiart, 2022

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:09:52.388325Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T14:09:50.466440Z digest=sha256:f263a7a5ccd9f8b871b0d8176d68d644ece84b3bca165851aa9a8fa34a53ab23

Observation ddb66204-867c-4349-9b57-c15e7ea53cd0 · outbound

This paper cites Infinite-id: Identity-preserved personaliza- tion via id-semantics decoupling paradigm.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Infinite-id: Identity-preserved personaliza- tion via id-semantics decoupling paradigm

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:09:52.228010Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T14:09:50.566996Z digest=sha256:b762f151699f313ddab750b610d0f925105b318c8c7e56219953ae3c6a24f9d3

Observation cb0ad2dd-95d5-4dae-adb5-69ad8dbe9f34 · outbound

This paper cites Proxy-tuning: Tailoring multimodal autoregressive models for subject-driven image generation.arXiv preprint arXiv:2503.10125, 2025.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Proxy-tuning: Tailoring multimodal autoregressive models for subject-driven image generation.arXiv preprint arXiv:2503.10125, 2025

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:50.668515Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:50.668515Z digest=sha256:496a09f241669bb2ba33c5604d8f843a18ef5785beb7f15d57cd10c5ce0cd3fa

Observation e867ddc8-17ba-4b2c-a725-eb741b1236ca · outbound

This paper cites OmniGen: Unified Image Generation.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation OmniGen: Unified Image Generation

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:50.758122Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:50.758122Z digest=sha256:1ac9d31713e196eb41a9735baa25df1df0c6e82fa4930bb91adbad3cf5e62815

Observation 2a394c5d-423a-47e0-b993-212d765cccb3 · outbound

This paper cites Show-o: One Single Transformer to Unify Multimodal Understanding and Generation.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Show-o: One Single Transformer to Unify Multimodal Understanding and Generation

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:50.817953Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:50.817953Z digest=sha256:1e43183644e9c1de44a63e6ccc5ac4d59936c36b0594e65e16259cd14bd9547a

Observation b3bcf9ed-255f-4ce8-ac85-953facd9d194 · outbound

This paper cites Imagereward: Learning and evaluating human preferences for text-to-image generation.Advances in Neural Information Processing Systems, 36:15903–15935, 2023.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Imagereward: Learning and evaluating human preferences for text-to-image generation.Advances in Neural Information Processing Systems, 36:15903–15935, 2023

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:50.936277Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:50.936277Z digest=sha256:5b1c224b21b89b04f5eb922f33a09cd858b7fbb6eac5d5ebd63ae38255f5371e

Observation afb59c33-aab3-486e-b7ea-ddd39bb7179f · outbound

This paper cites DanceGRPO: Unleashing GRPO on Visual Generation.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation DanceGRPO: Unleashing GRPO on Visual Generation

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:51.031982Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:51.031982Z digest=sha256:ac41c0f5a0bcf77d668d78df3a47466b269e71c800675b8e2f7cf8bc6dd5d5ca

Observation 423cda56-fd6a-4788-9cc6-8d764dc2b684 · outbound

This paper cites Qwen2 Technical Report.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Qwen2 Technical Report

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:51.113980Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:51.113980Z digest=sha256:81dd63a32e251edf7e507da8a6b6100c17f3042cf5ce6401ecc3c4c02ca14168

Observation 0149abf8-906e-4d68-a893-d6b5293125f1 · outbound

This paper cites Qwen2.5 Technical Report.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Qwen2.5 Technical Report

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:51.235032Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:51.235032Z digest=sha256:26c46e1ebf077ef196e660f80785249e2d5d6eef66006ac5a6416219b3fed443

Observation 74ff1e8c-efe5-446a-992d-dc056d8f6b86 · outbound

This paper cites IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:51.352941Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:51.352941Z digest=sha256:456946c0e16096d774f69d9bc09269b188c77a9feb28bc8055351a308cf38355

Observation 52a76abc-8b38-4013-b333-46543c7ce459 · outbound

This paper cites Vector-quantized Image Modeling with Improved VQGAN.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Vector-quantized Image Modeling with Improved VQGAN

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:51.442736Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:51.442736Z digest=sha256:be2b352a58fc1aff56fcbe6a56e9c2d5eca242d10170880815eb4ab765047219

Observation 08a76191-56d2-44a6-bd9d-86c777b74e32 · outbound

This paper cites DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:51.515360Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:51.515360Z digest=sha256:9c5cc341c6fccdf105c752f9258f37cc5985a155cc3395f0eeeb76d7ef1388fb

Observation fe1ac081-b2d4-4c35-bc7d-77d0e8557472 · outbound

This paper cites Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model.

StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T14:09:51.624919Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:09:51.624919Z digest=sha256:59195d02bb74c647bc26ff13a87197e278ecbcb780af8e405f049437f4046556

Pith citing papers

Observation 0ef21c97-a801-42c5-9cf6-f5d435d29a09 · inbound

Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering cites this paper.

Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation

Reference 58

Resolution
verified exact
arxiv_id, observed 2026-07-01T22:16:15.737555Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-06-28T15:39:15.744954Z digest=sha256:8eb83e66bbc01af442c37055a3e8ffd535535046af3e09cada75acbd410e6fed