{"as_of":"2026-08-09T16:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:af419d6c94aab1b311dff6031f88325080219ac4f6c7ddc9cf1b3ff1cdf908c7","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:09:51.624919Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T15:39:15.744954Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T22:16:15.736010Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2505.19874","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19874","snapshot_observed_at":"2026-07-01T22:16:15.736010Z","title":"Stylear: Customizing multimodal autoregressive model for style-aligned text-to-image genera- tion.arXiv preprint arXiv:2505.19874, 2025","venue":null,"work_id":"0c15b805-e32a-4f84-9fd1-deafdd5ce673","year":2025},"citing_paper":{"arxiv_id":"2606.01911","last_updated":"2026-06-01T08:47:17Z","snapshot_observed_at":"2026-08-04T20:44:15.334202Z","submitted_at":"2026-06-01T08:47:17Z","title":"Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T15:39:15.744954Z"},"links":{"cited_paper":"/paper/2505.19874","citing_paper":"/paper/2606.01911"},"observation_digest":"sha256:8eb83e66bbc01af442c37055a3e8ffd535535046af3e09cada75acbd410e6fed","observation_id":"0ef21c97-a801-42c5-9cf6-f5d435d29a09","resolution":{"observed_at":"2026-07-01T22:16:15.737555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19874/citation-record","integrity":"/paper/2505.19874/integrity","json":"/paper/2505.19874/citation-record.json","paper":"/paper/2505.19874"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:45.731908Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:45.731908Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:6ae51772908c564e62a6f2c76825a2538cac003ca2f5aae40df35cd339c2803c","observation_id":"fca194cd-a8c3-4df0-bf7a-6449a1491836","resolution":{"observed_at":"2026-08-07T14:09:45.731908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-09T16:20:23.732146Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-07T14:09:45.870974Z","title":"Training diffusion models with reinforcement learning.arXiv preprint arXiv:2305.13301, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:45.870974Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:62c78bd61bcb8c23270b6b84e178ccf2a2418a62e40bfa186e79ff5fdc81a388","observation_id":"553fa905-4ac6-48b9-b1e9-47d505f6ce20","resolution":{"observed_at":"2026-08-07T14:09:45.870974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T14:09:45.950201Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling.arXiv preprint arXiv:2501.17811, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:45.950201Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:9a163ad2e78b330504f57750bf2435a8ccf96035abad96eaab531af414f5f5d6","observation_id":"3565bfa3-3c4d-4b1d-9819-e73f4624deba","resolution":{"observed_at":"2026-08-07T14:09:45.950201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06135","last_updated":"2024-07-08T17:08:02Z","snapshot_observed_at":"2026-08-09T05:47:14.092221Z","submitted_at":"2024-07-08T17:08:02Z","title":"ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06135","snapshot_observed_at":"2026-08-07T14:09:46.064937Z","title":"Anole: An open, autoregressive, native large multimodal models for interleaved image-text generation.arXiv preprint arXiv:2407.06135, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:46.064937Z"},"links":{"cited_paper":"/paper/2407.06135","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:d126222cbfb946a95b2a3472649cc1b312c19b5828239c1544cf54b5058e6cc8","observation_id":"2ac5ac4d-1524-4b64-9514-e256ac64affa","resolution":{"observed_at":"2026-08-07T14:09:46.064937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:46.163330Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:46.163330Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:92865a7ed57cfd692a7a1fa5294ce594473a4a9e9fd9c1a55f1c56303f8d401e","observation_id":"2aa0bf26-a6e9-4d30-973b-3ca8139ac5df","resolution":{"observed_at":"2026-08-07T14:09:46.163330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:46.335590Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:46.335590Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:cbf8e04de574278d23a85852df73bb2303ae635b6b8035d66c78cca227163506","observation_id":"7d85b30b-5d56-475e-99e7-0f8838bcd45d","resolution":{"observed_at":"2026-08-07T14:09:46.335590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13863","last_updated":"2024-10-17T17:59:59Z","snapshot_observed_at":"2026-08-07T22:15:46.490983Z","submitted_at":"2024-10-17T17:59:59Z","title":"Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13863","snapshot_observed_at":"2026-08-07T14:09:46.457415Z","title":"Fluid: Scaling autoregressive text-to-image generative models with continuous tokens.arXiv preprint arXiv:2410.13863, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:46.457415Z"},"links":{"cited_paper":"/paper/2410.13863","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:cc13994fc444538f3d8da1181a83f688b754bc7ccf51cc21eef5c45e0a9752b2","observation_id":"52a0af3a-fa36-40b7-9763-9d6f62c03901","resolution":{"observed_at":"2026-08-07T14:09:46.457415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:46.587603Z","title":"Dpok: Reinforcement learning for fine-tuning text-to-image diffusion models.Advances in Neural Information Processing Systems, 36:79858–79885, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:46.587603Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:a7a0e7a1bfc5e0883e2f3cdf8a3f18ae23383efbb3beedc8e4fe517defbad4fd","observation_id":"60228cfa-672a-4918-8fd0-757974f8416a","resolution":{"observed_at":"2026-08-07T14:09:46.587603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01414","last_updated":"2025-02-23T13:45:34Z","snapshot_observed_at":"2026-08-09T14:50:37.675197Z","submitted_at":"2024-07-01T16:05:18Z","title":"StyleShot: A Snapshot on Any Style","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01414","snapshot_observed_at":"2026-08-07T14:09:46.712967Z","title":"Styleshot: A snapshot on any style.arXiv preprint arXiv:2407.01414, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:46.712967Z"},"links":{"cited_paper":"/paper/2407.01414","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:baf2524a71989333d2bd9cf22ccead80a4a9487896983f8c2f3bb1491ce90c76","observation_id":"f88e1f5a-04fb-407b-8b98-d43ede3e84eb","resolution":{"observed_at":"2026-08-07T14:09:46.712967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:52.922164Z","title":"Style aligned image generation via shared attention","venue":null,"work_id":"87ea50f5-30bc-4e58-b8bf-afe2982fd7bb","year":2024},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:46.821562Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:cf93d65f4470789216e18aec812493e8e8719deac7834f44860cfa84d12a0b13","observation_id":"eee7be35-5f74-40fc-ae14-402c4b3ccf6e","resolution":{"observed_at":"2026-08-07T14:09:52.959159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:46.917764Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:46.917764Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:9bf9a2557c5742697f701d4d39b1082a4648511286e6a1ba9f29c0a1efdf6e6f","observation_id":"8d6ae7e1-01ae-43f3-aad5-da71b25ca712","resolution":{"observed_at":"2026-08-07T14:09:46.917764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02064","last_updated":"2025-04-17T12:49:56Z","snapshot_observed_at":"2026-08-04T23:24:39.639600Z","submitted_at":"2025-01-03T19:17:27Z","title":"ArtCrafter: Text-Image Aligning Style Transfer via Embedding Reframing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02064","snapshot_observed_at":"2026-08-07T14:09:47.012312Z","title":"Artcrafter: Text-image aligning style transfer via embedding reframing.arXiv preprint arXiv:2501.02064, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:47.012312Z"},"links":{"cited_paper":"/paper/2501.02064","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:23ca9d62bd64c26807b1978629951be89b327e391e380445914016563e0e61e7","observation_id":"d9a81883-174d-4c7a-857b-a909adbb5bb3","resolution":{"observed_at":"2026-08-07T14:09:47.012312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:47.106522Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:47.106522Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:eec417f851c0e18096f78147d95ceff53988e7dcbe0ac87e32f0989688334185","observation_id":"a0c6081a-9917-4462-95bb-3fa18a84a8df","resolution":{"observed_at":"2026-08-07T14:09:47.106522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12974","last_updated":"2024-02-21T14:04:30Z","snapshot_observed_at":"2026-08-09T14:50:35.586296Z","submitted_at":"2024-02-20T12:51:17Z","title":"Visual Style Prompting with Swapping Self-Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12974","snapshot_observed_at":"2026-08-07T14:09:47.274938Z","title":"Visual style prompting with swapping self-attention.arXiv preprint arXiv:2402.12974, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:47.274938Z"},"links":{"cited_paper":"/paper/2402.12974","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:a91bf6fc24dfe726e693d6fca6723c4b0e7f7a0584ec67ddc50d78249c6b6a8b","observation_id":"7852db0d-bada-4321-8f55-cfaa4444fbcf","resolution":{"observed_at":"2026-08-07T14:09:47.274938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:47.387252Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:47.387252Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:21c9e6515f97b3c4ef2cca3db0dcf5f552292d7ad01d4146fb8dbb05d818b2f0","observation_id":"fafef86f-84bd-4705-9e7a-981bb7cf327e","resolution":{"observed_at":"2026-08-07T14:09:47.387252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:47.496926Z","title":"Flux.https://github.com/black-forest-labs/flux, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:47.496926Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:03fe1671057091813f35b19d8a9638998090cd2ccc2eb8bc1cc0b577a38e9762","observation_id":"3d1eaeae-a419-4d3f-aceb-f0793953549b","resolution":{"observed_at":"2026-08-07T14:09:47.496926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-07T14:09:47.643689Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining.arXiv preprint arXiv:2408.02657, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:47.643689Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:6bcf6fb2ff52d88f07cf4b1053ad809ca26cd7122580f80349de02befdb81064","observation_id":"62cec599-c947-4a54-b4b7-ad3b636aa6b3","resolution":{"observed_at":"2026-08-07T14:09:47.643689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00330","last_updated":"2024-09-12T06:50:53Z","snapshot_observed_at":"2026-07-06T16:55:29.501535Z","submitted_at":"2023-12-01T03:53:21Z","title":"StyleCrafter: Enhancing Stylized Text-to-Video Generation with Style Adapter","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00330","snapshot_observed_at":"2026-08-07T14:09:47.837080Z","title":"Stylecrafter: Enhancing stylized text-to-video generation with style adapter.arXiv preprint arXiv:2312.00330, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:47.837080Z"},"links":{"cited_paper":"/paper/2312.00330","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:a9442ae15cc9c909c3abb6a02ebc9047f3bc5b55ac8f8dc9e413bb733c135910","observation_id":"4ab2158d-e721-4a63-b636-481678a58907","resolution":{"observed_at":"2026-08-07T14:09:47.837080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:52.721669Z","title":"Subject- driven text-to-image generation via preference-based reinforcement learning.Advances in Neural Informa- tion Processing Systems, 37:123563–123591, 2024","venue":null,"work_id":"1a0d97dc-044a-46a3-9c2c-2d781b4b2b24","year":2024},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:47.959998Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:263e28a4070e850a437a51f9aed643705ed408aca83683e61a92e1fcb865d9de","observation_id":"223b7d21-e690-430f-b59f-43440290ec1b","resolution":{"observed_at":"2026-08-07T14:09:52.808695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:48.082465Z","title":"Null-text inversion for editing real images using guided diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:48.082465Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:39921f62d7fba93722014067517ee4dde66f362b843a6d54a6cd3085b4b89628","observation_id":"2b3f036d-3edd-4154-8dd7-c4506dfa1e04","resolution":{"observed_at":"2026-08-07T14:09:48.082465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:52.537316Z","title":"laion2b-en-aesthetic-square-cleaned","venue":null,"work_id":"a78e983c-b301-4e31-a0de-aa13502d452c","year":2025},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:48.196971Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:2356bacfba731a0c5d4c4fef7c9dc1b445a5757e85a6b40ec584b86061b71fb6","observation_id":"b130d34c-c462-45db-b785-95a970aac38a","resolution":{"observed_at":"2026-08-07T14:09:52.613031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:48.284105Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:48.284105Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:a0141fa710e329195649c8f2e80ac8a8d64b02588eb8631f71bea78c967f572a","observation_id":"911f2656-fcfa-4452-8d16-551ae59a4052","resolution":{"observed_at":"2026-08-07T14:09:48.284105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T14:09:48.397477Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:48.397477Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:9cd56f7fc9328b1222d9a3bfaad1f5ec46abd23f07d19bf8440e06289087fe86","observation_id":"d50eb054-58ba-48c6-9ad2-6e456181a4b2","resolution":{"observed_at":"2026-08-07T14:09:48.397477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:48.520560Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:48.520560Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:2dae09a1598f4acfa83e7cca9d65497797d0692186fba1dcba6b2502cdbc49f8","observation_id":"d5f0034e-e5c8-4564-985c-d8494719ec4f","resolution":{"observed_at":"2026-08-07T14:09:48.520560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:48.648234Z","title":"Direct preference optimization: Your language model is secretly a reward model.Advances in Neural Information Processing Systems, 36:53728–53741, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:48.648234Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:a471904730a287df3e423350046b9668b67d3a5ad4f599cf2fe0344bbca74fba","observation_id":"f6c746c1-c854-42f7-ba74-323803890a41","resolution":{"observed_at":"2026-08-07T14:09:48.648234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:48.756291Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:48.756291Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:b3c63c61f779de403d93e86e71d8a6e772b97199bae025a303fcf29cb40f028f","observation_id":"14e3aa5a-d94c-463c-9809-a11f8e8f719c","resolution":{"observed_at":"2026-08-07T14:09:48.756291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:48.908838Z","title":"Dream- booth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:48.908838Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:7e7e6f68c963cb498c41bbadc6b48a7bf3eda85a0f0627ca8fca26e53aa0d978","observation_id":"c3159c19-a960-4ef4-ab87-66015d4ed7c9","resolution":{"observed_at":"2026-08-07T14:09:48.908838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:49.042874Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in neural information processing systems, 35:25278–25294, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:49.042874Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:f7ccb079719d013c39f5de1f0e8b5c80d7d9a0a0faf616d4ff99b2f284953717","observation_id":"26cfabbe-36b6-43a5-aac6-36c58d806951","resolution":{"observed_at":"2026-08-07T14:09:49.042874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:09:49.175385Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:49.175385Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:a5e9ff3e55082cade6598c39eac661da7aafcb0dd03be4ec03b0d4b7b7410438","observation_id":"70dba0c1-a7db-4ba6-8332-8b89f016be9b","resolution":{"observed_at":"2026-08-07T14:09:49.175385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00983","last_updated":"2023-06-01T17:59:51Z","snapshot_observed_at":"2026-07-06T15:36:45.014921Z","submitted_at":"2023-06-01T17:59:51Z","title":"StyleDrop: Text-to-Image Generation in Any Style","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00983","snapshot_observed_at":"2026-08-07T14:09:49.329940Z","title":"Styledrop: Text-to-image generation in any style.arXiv preprint arXiv:2306.00983, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:49.329940Z"},"links":{"cited_paper":"/paper/2306.00983","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:62a38ba6cb1b18f7d08ba8cfb57f8404d5df7cb7a638560b18a24ca1ad43753f","observation_id":"9f323023-1822-4b25-992d-026a06635e34","resolution":{"observed_at":"2026-08-07T14:09:49.329940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13162","last_updated":"2025-04-17T17:58:26Z","snapshot_observed_at":"2026-08-07T16:01:21.245500Z","submitted_at":"2025-04-17T17:58:26Z","title":"Personalized Text-to-Image Generation with Auto-Regressive Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13162","snapshot_observed_at":"2026-08-07T14:09:49.457645Z","title":"Personalized text-to-image generation with auto-regressive models.arXiv preprint arXiv:2504.13162, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:49.457645Z"},"links":{"cited_paper":"/paper/2504.13162","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:adef08b3c8326f66d07bb88be7a936fd21d806c5f663a4c13f97fab340d2c803","observation_id":"8b31ddba-8737-42d6-ba19-0449dca3b32a","resolution":{"observed_at":"2026-08-07T14:09:49.457645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T14:09:49.568383Z","title":"Autore- gressive model beats diffusion: Llama for scalable image generation.arXiv preprint arXiv:2406.06525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:49.568383Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:326bdd657712b7647e6053f92f6baa362c8cd8c2f10cc0fd6d181ff42ce1bc3f","observation_id":"d910e862-9f95-4dc7-bcee-fe054e31eabb","resolution":{"observed_at":"2026-08-07T14:09:49.568383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10812","last_updated":"2024-10-14T17:59:42Z","snapshot_observed_at":"2026-08-07T19:45:45.522836Z","submitted_at":"2024-10-14T17:59:42Z","title":"HART: Efficient Visual Generation with Hybrid Autoregressive Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10812","snapshot_observed_at":"2026-08-07T14:09:49.659343Z","title":"Hart: Efficient visual generation with hybrid autoregressive transformer.arXiv preprint arXiv:2410.10812, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:49.659343Z"},"links":{"cited_paper":"/paper/2410.10812","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:994416737fd6a9ba78080b586a3fe013e0f90c68719f4d996f533e2c1a16251a","observation_id":"07711783-a8f8-499c-9f8f-d8908afdaad4","resolution":{"observed_at":"2026-08-07T14:09:49.659343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T14:09:49.739182Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:49.739182Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:6d45c1645047fa89a2ad534baee6a4fb29bb46d715eb01dc45c8588338197c9e","observation_id":"c3bc4e6a-cc68-4997-a6ef-2975ad03ecab","resolution":{"observed_at":"2026-08-07T14:09:49.739182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:49.806310Z","title":"Neural discrete representation learning.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:49.806310Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:aa0cabd2d4cc96f4b82331c2fe0ca50b9cfc79a518d0d612a0950b162e38c353","observation_id":"32c66ba3-57c9-4e13-90f4-cf92abc8c600","resolution":{"observed_at":"2026-08-07T14:09:49.806310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:49.891224Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:49.891224Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:7ad3b0cc6101e032a2c0f8889672949deecde1b5bde563ae3e3fb8c310a4b2bb","observation_id":"0e61c2d1-a85a-4246-8f3f-9c48c543c9d3","resolution":{"observed_at":"2026-08-07T14:09:49.891224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:49.981311Z","title":"Diffusion model alignment using direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:49.981311Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:1ab74df73c11fdb8b41135197be56eb24674ccc332237522cddb1e885cf1265a","observation_id":"43711ad9-0f2f-4974-a897-03930acc6342","resolution":{"observed_at":"2026-08-07T14:09:49.981311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02733","last_updated":"2024-04-04T19:42:32Z","snapshot_observed_at":"2026-07-06T17:55:08.182604Z","submitted_at":"2024-04-03T13:34:09Z","title":"InstantStyle: Free Lunch towards Style-Preserving in Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02733","snapshot_observed_at":"2026-08-07T14:09:50.090014Z","title":"Instantstyle: Free lunch towards style-preserving in text-to-image generation.arXiv preprint arXiv:2404.02733, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:50.090014Z"},"links":{"cited_paper":"/paper/2404.02733","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:35e370a73da04a27a7e929a37a6df458311c614d3390a8f041fedae585a6efaa","observation_id":"d25ef643-909f-4c41-8b38-62c3b186eafd","resolution":{"observed_at":"2026-08-07T14:09:50.090014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11455","last_updated":"2025-04-15T17:59:46Z","snapshot_observed_at":"2026-08-08T11:00:06.035456Z","submitted_at":"2025-04-15T17:59:46Z","title":"SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11455","snapshot_observed_at":"2026-08-07T14:09:50.181832Z","title":"Simplear: Pushing the frontier of autoregressive visual generation through pretraining, sft, and rl.arXiv preprint arXiv:2504.11455, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:50.181832Z"},"links":{"cited_paper":"/paper/2504.11455","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:d2d3d2135257f2f1bf73514cf821614cc2c3cf04dea649313475e1a6dfa94c22","observation_id":"167101e9-00ba-48f5-916f-a737441f8334","resolution":{"observed_at":"2026-08-07T14:09:50.181832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T14:09:50.256992Z","title":"Emu3: Next-token prediction is all you need.arXiv preprint arXiv:2409.18869, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:50.256992Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:6651751939bb98bb4613a74e3e522fd2aa9369a26d206836a07dc7c7eb281b97","observation_id":"673a9799-3486-4b31-a59a-40c1f88c89bb","resolution":{"observed_at":"2026-08-07T14:09:50.256992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01770","last_updated":"2024-10-30T17:05:17Z","snapshot_observed_at":"2026-08-09T14:50:52.185803Z","submitted_at":"2023-09-04T19:16:46Z","title":"StyleAdapter: A Unified Stylized Image Generation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01770","snapshot_observed_at":"2026-08-07T14:09:50.366092Z","title":"Styleadapter: A unified stylized image generation model.arXiv preprint arXiv:2309.01770, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:50.366092Z"},"links":{"cited_paper":"/paper/2309.01770","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:26215fa84ce5dc4962ae35631ad0ab90e4a5ecfe25c97b0c29983e5bcf2a48a7","observation_id":"1837bbb7-6f50-4586-896c-b6370f689afc","resolution":{"observed_at":"2026-08-07T14:09:50.366092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:52.299963Z","title":"wikiart.https://huggingface.co/datasets/huggan/wikiart, 2022","venue":null,"work_id":"a2d37603-a30a-44dc-8f0c-faf4388c345c","year":2022},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:50.466440Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:f263a7a5ccd9f8b871b0d8176d68d644ece84b3bca165851aa9a8fa34a53ab23","observation_id":"58afe69c-7688-4c7d-b860-5502e679028b","resolution":{"observed_at":"2026-08-07T14:09:52.388325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:52.167488Z","title":"Infinite-id: Identity-preserved personaliza- tion via id-semantics decoupling paradigm","venue":null,"work_id":"df45d763-9fe0-4627-899a-34c78b4b7ff8","year":2024},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:50.566996Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:b762f151699f313ddab750b610d0f925105b318c8c7e56219953ae3c6a24f9d3","observation_id":"ddb66204-867c-4349-9b57-c15e7ea53cd0","resolution":{"observed_at":"2026-08-07T14:09:52.228010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:50.668515Z","title":"Proxy-tuning: Tailoring multimodal autoregressive models for subject-driven image generation.arXiv preprint arXiv:2503.10125, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:50.668515Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:496a09f241669bb2ba33c5604d8f843a18ef5785beb7f15d57cd10c5ce0cd3fa","observation_id":"cb0ad2dd-95d5-4dae-adb5-69ad8dbe9f34","resolution":{"observed_at":"2026-08-07T14:09:50.668515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11340","last_updated":"2024-11-21T14:09:12Z","snapshot_observed_at":"2026-07-06T19:16:51.512681Z","submitted_at":"2024-09-17T16:42:46Z","title":"OmniGen: Unified Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11340","snapshot_observed_at":"2026-08-07T14:09:50.758122Z","title":"Omnigen: Unified image generation.arXiv preprint arXiv:2409.11340, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:50.758122Z"},"links":{"cited_paper":"/paper/2409.11340","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:1ac9d31713e196eb41a9735baa25df1df0c6e82fa4930bb91adbad3cf5e62815","observation_id":"e867ddc8-17ba-4b2c-a725-eb741b1236ca","resolution":{"observed_at":"2026-08-07T14:09:50.758122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T14:09:50.817953Z","title":"Show-o: One single transformer to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:50.817953Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:1e43183644e9c1de44a63e6ccc5ac4d59936c36b0594e65e16259cd14bd9547a","observation_id":"2a394c5d-423a-47e0-b993-212d765cccb3","resolution":{"observed_at":"2026-08-07T14:09:50.817953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:50.936277Z","title":"Imagereward: Learning and evaluating human preferences for text-to-image generation.Advances in Neural Information Processing Systems, 36:15903–15935, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:50.936277Z"},"links":{"citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:5b1c224b21b89b04f5eb922f33a09cd858b7fbb6eac5d5ebd63ae38255f5371e","observation_id":"b3bcf9ed-255f-4ce8-ac85-953facd9d194","resolution":{"observed_at":"2026-08-07T14:09:50.936277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-07-31T14:51:03.625964Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07818","snapshot_observed_at":"2026-08-07T14:09:51.031982Z","title":"Dancegrpo: Unleashing grpo on visual generation.arXiv preprint arXiv:2505.07818, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:51.031982Z"},"links":{"cited_paper":"/paper/2505.07818","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:ac41c0f5a0bcf77d668d78df3a47466b269e71c800675b8e2f7cf8bc6dd5d5ca","observation_id":"afb59c33-aab3-486e-b7ea-ddd39bb7179f","resolution":{"observed_at":"2026-08-07T14:09:51.031982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T14:09:51.113980Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:51.113980Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:81dd63a32e251edf7e507da8a6b6100c17f3042cf5ce6401ecc3c4c02ca14168","observation_id":"423cda56-fd6a-4788-9cc6-8d764dc2b684","resolution":{"observed_at":"2026-08-07T14:09:51.113980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:09:51.235032Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:51.235032Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:26c46e1ebf077ef196e660f80785249e2d5d6eef66006ac5a6416219b3fed443","observation_id":"0149abf8-906e-4d68-a893-d6b5293125f1","resolution":{"observed_at":"2026-08-07T14:09:51.235032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-07T14:09:51.352941Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models.arXiv preprint arXiv:2308.06721, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:51.352941Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:456946c0e16096d774f69d9bc09269b188c77a9feb28bc8055351a308cf38355","observation_id":"74ff1e8c-efe5-446a-992d-dc056d8f6b86","resolution":{"observed_at":"2026-08-07T14:09:51.352941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-07T14:09:51.442736Z","title":"Vector-quantized image modeling with improved vqgan.arXiv preprint arXiv:2110.04627, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:51.442736Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:be2b352a58fc1aff56fcbe6a56e9c2d5eca242d10170880815eb4ab765047219","observation_id":"52a76abc-8b38-4013-b333-46543c7ce459","resolution":{"observed_at":"2026-08-07T14:09:51.442736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-07T03:38:32.486362Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03605","snapshot_observed_at":"2026-08-07T14:09:51.515360Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object detection.arXiv preprint arXiv:2203.03605, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:51.515360Z"},"links":{"cited_paper":"/paper/2203.03605","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:9c5cc341c6fccdf105c752f9258f37cc5985a155cc3395f0eeeb76d7ef1388fb","observation_id":"08a76191-56d2-44a6-bd9d-86c777b74e32","resolution":{"observed_at":"2026-08-07T14:09:51.515360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-07T14:09:51.624919Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model.arXiv preprint arXiv:2408.11039, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:51.624919Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:59195d02bb74c647bc26ff13a87197e278ecbcb780af8e405f049437f4046556","observation_id":"fe1ac081-b2d4-4c35-bc7d-77d0e8557472","resolution":{"observed_at":"2026-08-07T14:09:51.624919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2505.19874."}