{"as_of":"2026-08-08T02:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2ac87e1de941692be6c3c76bb535e7fed8f3bf5f9f2e52ff924e87fd294e664b","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:23:12.587345Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T05:12:44.268199Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T08:46:26.764949Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05501","snapshot_observed_at":"2026-08-05T05:12:44.268199Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.05714","last_updated":"2025-09-06T13:26:04Z","snapshot_observed_at":"2026-08-06T23:54:59.571872Z","submitted_at":"2025-09-06T13:26:04Z","title":"Towards Meta-Cognitive Knowledge Editing for Multimodal LLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T05:12:44.268199Z"},"links":{"cited_paper":"/paper/2506.05501","citing_paper":"/paper/2509.05714"},"observation_digest":"sha256:70ba28faa7194fc4b6793b636e8bca901e0efe4ceec3ebb74831ca7a11002c5a","observation_id":"c012480a-14d9-4fdf-8d47-e429a5d16559","resolution":{"observed_at":"2026-08-05T05:12:44.268199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"cited_work":{"arxiv_id":"2506.05501","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05501","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"58d822be-d8b1-436e-8b92-856e63dffd8b","year":2025},"citing_paper":{"arxiv_id":"2604.26341","last_updated":"2026-04-29T06:46:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-29T06:46:59Z","title":"SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-07T13:45:53.346402Z"},"links":{"cited_paper":"/paper/2506.05501","citing_paper":"/paper/2604.26341"},"observation_digest":"sha256:a8761494e3e285d452018c0e687ab98c1009ad75d190425fd1b0842569fe02c1","observation_id":"334b2604-7141-46d0-96bc-011d1b7f2b03","resolution":{"observed_at":"2026-05-12T08:46:26.767451Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05501/citation-record","integrity":"/paper/2506.05501/integrity","json":"/paper/2506.05501/citation-record.json","paper":"/paper/2506.05501"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T10:23:12.478364Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.478364Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:e5cf1399958de9803590ac122c80d7dba4108d213ec37e65ae5cc511750124c0","observation_id":"96a77d7f-fa98-41a8-9e07-edf007569884","resolution":{"observed_at":"2026-08-07T10:23:12.478364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:23:12.481259Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.481259Z"},"links":{"citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:b11a69e69f99821e0c5359bef33d0588a099bd8846b8b4eb1b7eab873316cdcd","observation_id":"200d7dc9-908e-44b5-9d48-9045e77bda97","resolution":{"observed_at":"2026-08-07T10:23:12.481259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:23:12.483699Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.483699Z"},"links":{"citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:58cdc03ecb5d3502c99a0060f18d9004e575d05a16e34e77e14b4a32ec14619e","observation_id":"aa50303b-20ca-4208-8b1d-4821dec5f712","resolution":{"observed_at":"2026-08-07T10:23:12.483699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:23:12.954115Z","title":null,"venue":null,"work_id":"41466a54-f49e-4a2f-88f8-9d2c4175791a","year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.485922Z"},"links":{"citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:bad23c4e2d487e1b4b37eb455837a6c3375999d301f3d182dec59fa7a628b5ba","observation_id":"aa006ef1-21b6-45e0-857e-fbe5e29c86db","resolution":{"observed_at":"2026-08-07T10:23:12.956200Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-07T10:23:12.488547Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.488547Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:693923394bd49f9fa4d690ba69a25ef32fb9c1af32e09d8f8e0ec93edde1d62f","observation_id":"5b7d0096-7748-4a23-9d69-4ac1d3a6712c","resolution":{"observed_at":"2026-08-07T10:23:12.488547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-07T10:23:12.491082Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.491082Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:4edcf4db6c1c77a47c20f309cfd8e6933a772eb6910b24f71c4ba04cd7c0fb03","observation_id":"7ef8ac61-7805-45dd-938f-6a7e989dbefb","resolution":{"observed_at":"2026-08-07T10:23:12.491082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T10:23:12.494017Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.494017Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:3eb6e513d6816f58c14c0f5e1a2981ba0403572e2f9c26519990b449003e1efe","observation_id":"8078d485-d69e-4472-96ea-3820844c2e71","resolution":{"observed_at":"2026-08-07T10:23:12.494017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:23:12.496519Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.496519Z"},"links":{"citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:2d7ff860327a3da4ded9582322a24a059aab3eb8c727874bfb107e100b1c317a","observation_id":"cb7208e1-e5af-4525-994d-e3bacfddec81","resolution":{"observed_at":"2026-08-07T10:23:12.496519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:23:12.498502Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.498502Z"},"links":{"citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:1d5f5666f337d3bc2347815a568912bcdd9362455f17a4034fc94c08c75559e5","observation_id":"d38f3067-beb7-4847-bf6f-4fa8939bcc51","resolution":{"observed_at":"2026-08-07T10:23:12.498502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:23:12.500546Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.500546Z"},"links":{"citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:155dc44ae7a0d3307726daa4fe1f674df6fc2aeedc4744c103afd7ef74f0863a","observation_id":"f2ff5d2d-5d0c-45a8-b643-68d21febdb40","resolution":{"observed_at":"2026-08-07T10:23:12.500546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01218","last_updated":"2023-10-02T14:03:02Z","snapshot_observed_at":"2026-08-02T03:02:58.907220Z","submitted_at":"2023-10-02T14:03:02Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01218","snapshot_observed_at":"2026-08-07T10:23:12.502691Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.502691Z"},"links":{"cited_paper":"/paper/2310.01218","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:4429be6db7a985281e010924eedc2e3d92c01a86b75ec17c1613cfd949d5f239","observation_id":"d3487a38-dc62-4b86-bca4-cf93de2dbdb1","resolution":{"observed_at":"2026-08-07T10:23:12.502691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-07T10:23:12.504995Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.504995Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:6d90230e8455ffa4e9e5f7834602de1058f3a82dfd34ef5e26e6fb9ae3bc892e","observation_id":"43cabedf-93fb-4bc3-95f8-3054e75a5a97","resolution":{"observed_at":"2026-08-07T10:23:12.504995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:23:12.936987Z","title":null,"venue":null,"work_id":"0614b8c6-bfcb-4555-97bb-4ca4ff222be0","year":2023},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.507148Z"},"links":{"citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:9b805560eaa9063641e23f53b88e006767dafc15ce051407681ddf0ab177d9a6","observation_id":"729a06c6-ce8a-4ff9-b2b8-40ac076a70a3","resolution":{"observed_at":"2026-08-07T10:23:12.939100Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:23:12.509070Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.509070Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:317da6c8e77d547911a48c166daaf51006e693791ebb1689a2d2023df86cfa16","observation_id":"335c3dbc-5520-48c4-9bd2-b300b359f201","resolution":{"observed_at":"2026-08-07T10:23:12.509070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-07-06T20:25:08.527025Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-08-07T10:23:12.511095Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.511095Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:5c857220cb4a84af28daebc0fea1528e16ba207b9b7acb36314544f98e00f665","observation_id":"96b75dea-f716-4ad6-8b6c-2b525eb43572","resolution":{"observed_at":"2026-08-07T10:23:12.511095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04431","last_updated":"2025-06-17T15:32:20Z","snapshot_observed_at":"2026-08-07T20:34:58.400387Z","submitted_at":"2024-12-05T18:53:02Z","title":"Infinity: Scaling Bitwise AutoRegressive Modeling for High-Resolution Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04431","snapshot_observed_at":"2026-08-07T10:23:12.513374Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.513374Z"},"links":{"cited_paper":"/paper/2412.04431","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:823f7d5d9897d4185fb5d7895fdb8e20181a183fa8be95d0c56a6584822093a2","observation_id":"e2855e21-d9a8-4b73-972d-110d7f90ec7f","resolution":{"observed_at":"2026-08-07T10:23:12.513374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-07T10:23:12.515817Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.515817Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:524f6695e7f785723d0cebd9aed473465d94b20c7325d0a0a8a572a5526bf1ac","observation_id":"b80772bd-6c4d-4a8a-a5b8-b41a05f3c324","resolution":{"observed_at":"2026-08-07T10:23:12.515817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:23:12.518502Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.518502Z"},"links":{"citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:1d60691c57351db208f821e8c18f659b76a4634ece00667f1361a6b20bd327b1","observation_id":"d3300954-a378-45ed-bfd4-cba46133dae8","resolution":{"observed_at":"2026-08-07T10:23:12.518502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-07T20:35:00.460457Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-07T10:23:12.520489Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.520489Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:ed464b012e1f5c8be80a515cc6ff0221872b5ffd6032f4beb9bb600899b396ea","observation_id":"38bfa069-c6de-4947-9281-2cf7158039a3","resolution":{"observed_at":"2026-08-07T10:23:12.520489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:23:12.522483Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.522483Z"},"links":{"citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:d1ad2b89d38538104b15bda1b7cbe4c6fd532ee6b5e47e47e944c0a01e83fbf5","observation_id":"ac842250-4125-431c-9591-e5c9565c852e","resolution":{"observed_at":"2026-08-07T10:23:12.522483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T10:23:12.524294Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.524294Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:5ed3b504d8ccc8f14ed07685641318be1304830b81c8f70feb24ea57a565923b","observation_id":"2702fb33-86bf-49bd-aac5-964a85abd772","resolution":{"observed_at":"2026-08-07T10:23:12.524294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04152","last_updated":"2024-05-25T14:56:21Z","snapshot_observed_at":"2026-08-07T11:39:49.685292Z","submitted_at":"2023-08-08T09:32:43Z","title":"Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04152","snapshot_observed_at":"2026-08-07T10:23:12.526429Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.526429Z"},"links":{"cited_paper":"/paper/2308.04152","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:60b6389de6beb90a1c2722d4ce591249a7707b48b09e8c72241d0d8f71c79270","observation_id":"a5d08ef2-8fb8-46da-aa02-8e3f1342f3db","resolution":{"observed_at":"2026-08-07T10:23:12.526429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:23:12.528420Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.528420Z"},"links":{"citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:5ef8339d874db25031cfff4dd14b61cd674810b50e9753f3b6e28164c1862259","observation_id":"103a01cb-0bb3-487f-acbc-489b357ee2d8","resolution":{"observed_at":"2026-08-07T10:23:12.528420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15932","last_updated":"2025-04-22T14:20:59Z","snapshot_observed_at":"2026-08-07T16:00:13.194822Z","submitted_at":"2025-04-22T14:20:59Z","title":"Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15932","snapshot_observed_at":"2026-08-07T10:23:12.530267Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.530267Z"},"links":{"cited_paper":"/paper/2504.15932","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:d97891658f74bac5c6c4ea455c82716ec08a4dabe66c97f7e661bf38dbd64192","observation_id":"b0172b25-e168-43c2-a262-98253bd749ec","resolution":{"observed_at":"2026-08-07T10:23:12.530267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-05T16:01:06.026395Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-07T10:23:12.532475Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.532475Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:abe6afc26c007eb66cb988339088f50af8f619b9d2ab85243b8a646c70581118","observation_id":"3b20debb-3f5e-4a67-b117-b03d9d4b5172","resolution":{"observed_at":"2026-08-07T10:23:12.532475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:23:12.534533Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.534533Z"},"links":{"citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:b900cff18675c06f3e506ecd87349a20d6a0a9cf9f818def1d9293538348cf0d","observation_id":"9b68318a-909b-42d0-915e-5c207f2ee8c7","resolution":{"observed_at":"2026-08-07T10:23:12.534533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:23:12.536598Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.536598Z"},"links":{"citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:a0bee32a872745db8b8171f1e0849461d8f64dabecf9786aac0099da139095f9","observation_id":"9c5eef34-f8f8-4ee5-a798-8c6b7248206b","resolution":{"observed_at":"2026-08-07T10:23:12.536598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:23:12.911605Z","title":null,"venue":null,"work_id":"951c5eef-7840-4611-b470-316c3e552cd4","year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.538467Z"},"links":{"citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:8c0cf4494aa34896ffffb269f73edb11bd33b52a9bf9b90849b07f0644a4c6e1","observation_id":"9ffdc315-6711-481d-8abc-328255e8f321","resolution":{"observed_at":"2026-08-07T10:23:12.913662Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:23:12.905381Z","title":null,"venue":null,"work_id":"52c7bb4f-fcdb-468e-9823-d3445cf834a9","year":2023},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.540420Z"},"links":{"citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:4932ceab71248a806df7e8025c339b9ae169443a9116dd068083aa41f1ed8abd","observation_id":"1d87d19a-e1ae-4303-9f62-5672c95aadb0","resolution":{"observed_at":"2026-08-07T10:23:12.907359Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:23:12.899460Z","title":null,"venue":null,"work_id":"64db655c-e37c-4c60-bb23-bfe7c2f93d22","year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.542459Z"},"links":{"citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:04750ff3d301bb7735a0997198dc5c211f2510629b30a47f94473cc6b331547c","observation_id":"7332d79e-57f8-4174-85d8-8b70c25bb5a2","resolution":{"observed_at":"2026-08-07T10:23:12.901377Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:23:12.892824Z","title":null,"venue":null,"work_id":"9de7dba9-d2e4-4704-9f48-18604189a564","year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.544337Z"},"links":{"citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:6e4445d17b0d3b6e53075261d5041871ada31a5bdb86abadab3fdc19a8a9872d","observation_id":"9b2e2319-32ed-461f-b9e9-6439c909aa14","resolution":{"observed_at":"2026-08-07T10:23:12.895261Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12314","last_updated":"2023-10-23T12:43:35Z","snapshot_observed_at":"2026-08-04T22:58:40.959486Z","submitted_at":"2023-03-22T05:04:21Z","title":"Self-supervised Meta-Prompt Learning with Meta-Gradient Regularization for Few-shot Generalization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12314","snapshot_observed_at":"2026-08-07T10:23:12.546258Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.546258Z"},"links":{"cited_paper":"/paper/2303.12314","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:fb021af11fe75659934febd596801640172bde0bb16b485055cc2c0c11197a5c","observation_id":"2774d770-059e-47a3-b1ad-0b65c07fcf89","resolution":{"observed_at":"2026-08-07T10:23:12.546258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14666","last_updated":"2025-04-20T16:14:28Z","snapshot_observed_at":"2026-08-07T16:00:45.229157Z","submitted_at":"2025-04-20T16:14:28Z","title":"Generative Multimodal Pretraining with Discrete Diffusion Timestep Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14666","snapshot_observed_at":"2026-08-07T10:23:12.548885Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.548885Z"},"links":{"cited_paper":"/paper/2504.14666","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:a51b70a2762d3ae78ca86f88c587f5fd8403c5a96fb9d8a26643ed63242f9d57","observation_id":"ba6c5649-32ce-4b33-8167-eb10939e377a","resolution":{"observed_at":"2026-08-07T10:23:12.548885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01926","last_updated":"2024-05-03T08:43:06Z","snapshot_observed_at":"2026-07-06T18:09:17.538646Z","submitted_at":"2024-05-03T08:43:06Z","title":"Auto-Encoding Morph-Tokens for Multimodal LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01926","snapshot_observed_at":"2026-08-07T10:23:12.551112Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.551112Z"},"links":{"cited_paper":"/paper/2405.01926","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:236f383cfeb06313b807ad0f1b7f520a32ac4d1efcb64fabad197965bc566e2e","observation_id":"dca5abc9-c343-408a-8b5e-7b94d32c7641","resolution":{"observed_at":"2026-08-07T10:23:12.551112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:23:12.553747Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.553747Z"},"links":{"citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:44a490b6484a8f0535f5ccc810ca5599edc1917aa618ab281c5bb7a2d269b85d","observation_id":"847cb11b-3ecf-415b-86f8-11836b42ae8c","resolution":{"observed_at":"2026-08-07T10:23:12.553747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00161","last_updated":"2025-03-30T14:31:41Z","snapshot_observed_at":"2026-07-06T19:59:11.046948Z","submitted_at":"2024-11-29T11:54:55Z","title":"STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00161","snapshot_observed_at":"2026-08-07T10:23:12.555613Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.555613Z"},"links":{"cited_paper":"/paper/2412.00161","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:f9498e5185726f2d45661f44d8f1508c3403504325c4d8c537ec335e7613c262","observation_id":"c139af4a-b154-427e-9360-3ae217bb71dd","resolution":{"observed_at":"2026-08-07T10:23:12.555613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T10:23:12.558043Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.558043Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:f3ed7076049cd442416338b10a2eb8afb6b8df27a9ca43108034d807de321eb7","observation_id":"d5ab22ed-e6c7-4935-acc6-2f424e9e5885","resolution":{"observed_at":"2026-08-07T10:23:12.558043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T10:23:12.560144Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.560144Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:10d290d56f374ca449ba2c34e5b487e5672604aab683747b112679836e4e4550","observation_id":"80576249-4419-4000-b45b-25bfa0c04620","resolution":{"observed_at":"2026-08-07T10:23:12.560144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08012","last_updated":"2025-03-11T03:40:44Z","snapshot_observed_at":"2026-08-07T17:14:27.711220Z","submitted_at":"2025-03-11T03:40:44Z","title":"Exploring Bias in over 100 Text-to-Image Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08012","snapshot_observed_at":"2026-08-07T10:23:12.562389Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.562389Z"},"links":{"cited_paper":"/paper/2503.08012","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:61489f96d9f24fffcee991f18bc79edcc317bdb70412d6c334c5d3d54fcf4265","observation_id":"d0eaa143-c41d-4162-9181-63929e916336","resolution":{"observed_at":"2026-08-07T10:23:12.562389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T10:23:12.564317Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.564317Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:cb2ea415db166fe382af3d80b1be09eb52bc546247b756cf8fcba919b3f365a6","observation_id":"4577579a-4ee3-4c6b-a3c7-d3abc8a12f2a","resolution":{"observed_at":"2026-08-07T10:23:12.564317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-07T10:23:12.566657Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.566657Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:72f1ab43bcc5d91f674919948e6301e6ccc0f0330216fe489f54616d30e09b2c","observation_id":"6f51ef8b-170d-4fd7-9587-a084cd6aca56","resolution":{"observed_at":"2026-08-07T10:23:12.566657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18427","last_updated":"2025-05-17T13:26:31Z","snapshot_observed_at":"2026-08-06T13:34:35.279373Z","submitted_at":"2025-01-30T15:31:48Z","title":"SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18427","snapshot_observed_at":"2026-08-07T10:23:12.568772Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.568772Z"},"links":{"cited_paper":"/paper/2501.18427","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:75df909d5d4fa5e249b9e2d6da582660a8d0b1e0811e3cc006bd5234fb5d4393","observation_id":"06cef3f4-e53e-4366-a48a-ab0590a4e052","resolution":{"observed_at":"2026-08-07T10:23:12.568772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T10:23:12.571060Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.571060Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:d256dc73a6544edf38fa9ad6474d1152cdcc510e8ff623924daee707acac0c61","observation_id":"cc0bb740-0c9c-45ab-97af-f5ac02e04aae","resolution":{"observed_at":"2026-08-07T10:23:12.571060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11813","last_updated":"2025-09-05T07:15:34Z","snapshot_observed_at":"2026-08-02T19:18:43.494855Z","submitted_at":"2024-08-21T17:58:02Z","title":"SEA: Supervised Embedding Alignment for Token-Level Visual-Textual Integration in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11813","snapshot_observed_at":"2026-08-07T10:23:12.573432Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.573432Z"},"links":{"cited_paper":"/paper/2408.11813","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:5c7ffe7f98ea9b4708dbd296877371815a30cc07722efeb0194657f280b73e5a","observation_id":"002e6126-6d0f-4cb9-9fd6-a1e4c5f649ed","resolution":{"observed_at":"2026-08-07T10:23:12.573432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15738","last_updated":"2025-03-29T04:08:47Z","snapshot_observed_at":"2026-07-06T19:56:04.259325Z","submitted_at":"2024-11-24T07:02:56Z","title":"AnyEdit: Mastering Unified High-Quality Image Editing for Any Idea","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15738","snapshot_observed_at":"2026-08-07T10:23:12.575466Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.575466Z"},"links":{"cited_paper":"/paper/2411.15738","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:854917470b6234dba71cbf9a93c9886234d8f0f8729a215b7a3526d7584b3008","observation_id":"f5bfb895-cb14-434c-94c6-f3ca527b0271","resolution":{"observed_at":"2026-08-07T10:23:12.575466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:23:12.886468Z","title":null,"venue":null,"work_id":"581a8241-7a82-48f0-a9d0-8ab9502eee04","year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.578159Z"},"links":{"citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:b660b60ea930c851f50ab76e7f1c3e70c3ddd383e9d71b9d4d7f213376112bbb","observation_id":"b21326d8-46de-41c1-a09d-972fc86c1262","resolution":{"observed_at":"2026-08-07T10:23:12.888567Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16824","last_updated":"2024-11-25T18:33:14Z","snapshot_observed_at":"2026-07-06T19:56:52.724589Z","submitted_at":"2024-11-25T18:33:14Z","title":"Beyond Sight: Towards Cognitive Alignment in LVLM via Enriched Visual Knowledge","version":1},"cited_work":{"arxiv_id":"2411.16824","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.16824","snapshot_observed_at":"2026-08-07T10:23:12.613702Z","title":"Beyond Sight: Towards Cognitive Alignment in LVLM via Enriched Visual Knowledge","venue":"cs.CV","work_id":"c4d6fcdd-c15c-44f8-8c61-683b77e9a1b8","year":2024},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.580211Z"},"links":{"cited_paper":"/paper/2411.16824","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:5131c98ccd17c15b62240e083549f593ebcc547c4b3afc13563ebb239526c41d","observation_id":"806798e9-e5f9-4bf7-bf90-b96e1a959eaa","resolution":{"observed_at":"2026-08-07T10:23:12.617976Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02949","last_updated":"2025-04-03T18:06:28Z","snapshot_observed_at":"2026-08-07T16:10:37.711691Z","submitted_at":"2025-04-03T18:06:28Z","title":"VARGPT-v1.1: Improve Visual Autoregressive Large Unified Model via Iterative Instruction Tuning and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02949","snapshot_observed_at":"2026-08-07T10:23:12.582550Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.582550Z"},"links":{"cited_paper":"/paper/2504.02949","citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:817523c498b288e01bd843fc20096918e9bddded623fea70d7dc078e59c53586","observation_id":"f2de3076-eb6e-40b3-a718-a37c94f2152c","resolution":{"observed_at":"2026-08-07T10:23:12.582550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:23:12.584717Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.584717Z"},"links":{"citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:1e328eccbe6aecee52e38199e605bf6f72740c311cb86d3f5621af2d48514042","observation_id":"f1cca2d8-79c8-4148-a7e6-e175d8903d09","resolution":{"observed_at":"2026-08-07T10:23:12.584717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:23:12.587345Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T10:23:12.587345Z"},"links":{"citing_paper":"/paper/2506.05501"},"observation_digest":"sha256:d0139e2ccae4c07f42248110c186a59e22eacab62fef7e9b471a2346e4532253","observation_id":"92668bde-dfec-4198-a361-bb225f2e4309","resolution":{"observed_at":"2026-08-07T10:23:12.587345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.05501","last_updated":"2025-06-05T18:36:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:35:29.372904Z","submitted_at":"2025-06-05T18:36:33Z","title":"FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 2 inbound Pith citation observations for arXiv:2506.05501."}