{"as_of":"2026-08-07T23:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:14a7578a02055d9611abd3bb80f44b0fecc62d85b423f44968c41b0260fec83f","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:54:38.274595Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.21391/citation-record","integrity":"/paper/2507.21391/integrity","json":"/paper/2507.21391/citation-record.json","paper":"/paper/2507.21391"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T12:54:32.526329Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:32.526329Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:d5bcaaaa833552d051db584a79b4fe154e7d1e4260a240deeab8c446ae1eb2d2","observation_id":"056a1e6a-beb3-4817-b201-201c4fffe76b","resolution":{"observed_at":"2026-08-06T12:54:32.526329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T12:54:32.634149Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:32.634149Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:2f8d2886bfa82a1e513d661bd6744e9b16785e092cd2998f9864452a548d3f6a","observation_id":"0eb2ab8a-9a25-4c24-aadd-539f4e16e3a0","resolution":{"observed_at":"2026-08-06T12:54:32.634149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T12:54:32.751253Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:32.751253Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:aeea51b7122eef6ed14de055b757cbf43e4541bfe67fde051bba3638aeb70652","observation_id":"1414ac53-eb29-4751-a06b-8f3f69844a80","resolution":{"observed_at":"2026-08-06T12:54:32.751253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01973","last_updated":"2018-06-21T14:54:33Z","snapshot_observed_at":"2026-08-07T19:33:19.839652Z","submitted_at":"2018-01-06T05:44:29Z","title":"A Note on the Inception Score","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01973","snapshot_observed_at":"2026-08-06T12:54:32.829262Z","title":"A note on the inception score","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:32.829262Z"},"links":{"cited_paper":"/paper/1801.01973","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:f29b94fa9bf80b145f6e531e1bc282d108c8310f7d4f782e61f0efb75dc131f5","observation_id":"b0e9eb8b-c2f4-4e4f-9905-3f8dce5d3266","resolution":{"observed_at":"2026-08-06T12:54:32.829262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03621","last_updated":"2024-10-31T09:11:03Z","snapshot_observed_at":"2026-07-06T19:11:05.273789Z","submitted_at":"2024-09-05T15:33:24Z","title":"Attend First, Consolidate Later: On the Importance of Attention in Different LLM Layers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03621","snapshot_observed_at":"2026-08-06T12:54:32.897882Z","title":"Attend first, consolidate later: On the importance of attention in different llm layers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:32.897882Z"},"links":{"cited_paper":"/paper/2409.03621","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:6261745825655a7a12ae80ec0a44a058f936756df9bbb186a41bf29e377208e4","observation_id":"b4616089-20a5-497c-8a4a-67aef162a28a","resolution":{"observed_at":"2026-08-06T12:54:32.897882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-01T15:43:51.739518Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-06T12:54:32.955610Z","title":"Training diffusion models with reinforce- ment learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:32.955610Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:da1165ad44e53c0f5f9bc6a1592b40cf8b88dc5fd8ba14234ff47e039d1a4714","observation_id":"01a57abf-d454-4edd-97d9-20a2f7402118","resolution":{"observed_at":"2026-08-06T12:54:32.955610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:44.603911Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":"db45a092-c04b-42c6-af14-6e43f3b96456","year":1952},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:33.077318Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:e3be20f6d1ea7cf0cde40587eca0d1a5feae1b12a50696077094b56578d4745a","observation_id":"2c9bb625-c517-49c5-a40f-a8c3e4d0db53","resolution":{"observed_at":"2026-08-06T12:54:44.693809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-06T12:54:33.162969Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:33.162969Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:e2398baca7caf8d1f9607bc9c5e51e0a8984d0344358f138686ef3e88fecc780","observation_id":"bb5a2d9f-8017-4cdd-8ae8-61688734c0a3","resolution":{"observed_at":"2026-08-06T12:54:33.162969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01106","last_updated":"2025-03-02T22:41:37Z","snapshot_observed_at":"2026-07-06T19:43:59.326124Z","submitted_at":"2024-11-02T02:09:01Z","title":"SV-RAG: LoRA-Contextualizing Adaptation of MLLMs for Long Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01106","snapshot_observed_at":"2026-08-06T12:54:33.250868Z","title":"Lora-contextualizing adaptation of large mul- timodal models for long document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:33.250868Z"},"links":{"cited_paper":"/paper/2411.01106","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:391241b0a1a8678c3055708433cfc7edeab7bc7a41d44bc19e9645d00a048600","observation_id":"bed65cea-25c8-4a87-a108-28b39587f9d8","resolution":{"observed_at":"2026-08-06T12:54:33.250868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04842","last_updated":"2024-07-05T20:03:16Z","snapshot_observed_at":"2026-08-05T13:28:06.601120Z","submitted_at":"2024-07-05T20:03:16Z","title":"MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04842","snapshot_observed_at":"2026-08-06T12:54:33.346700Z","title":"Mj-bench: Is your multimodal reward model really a good judge for text-to- image generation? arXiv preprint arXiv:2407.04842, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:33.346700Z"},"links":{"cited_paper":"/paper/2407.04842","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:1c52795f70038c2d7941c315f8fda5b205310439d310f7dc9ebe7fbd58b5470e","observation_id":"02c55c24-4378-4579-8a74-f34efdfec3c2","resolution":{"observed_at":"2026-08-06T12:54:33.346700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:33.452384Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:33.452384Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:b463a1a78c7fe5ac90ec6a3a2999b32b89d11bc97c375bd868f4bb74333f5271","observation_id":"8f92e954-ec8f-447b-a014-6cb2464831dd","resolution":{"observed_at":"2026-08-06T12:54:33.452384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:44.314892Z","title":"The socio-moral image database (smid),","venue":null,"work_id":"5c39e963-ec79-4f04-940b-7f09e0569f3f","year":null},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:33.551927Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:d9255f1384b454c9cc9f6850e7729e11c829811170254b1e29bd8877fc279c06","observation_id":"fe32db23-e6ac-4c04-a95c-a2c6e99d02ca","resolution":{"observed_at":"2026-08-06T12:54:44.450201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-06T12:54:33.643754Z","title":"Instructblip: To- wards general-purpose vision-language models with instruc- tion tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:33.643754Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:ee26b9157b662791166c18e391fdd46999c761118550388de5e89cbb2600ad59","observation_id":"62b1b304-f88a-48e3-a114-a693b7d5c173","resolution":{"observed_at":"2026-08-06T12:54:33.643754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14324","last_updated":"2023-10-17T16:33:33Z","snapshot_observed_at":"2026-08-07T09:19:18.826470Z","submitted_at":"2023-05-23T17:54:57Z","title":"Ties Matter: Meta-Evaluating Modern Metrics with Pairwise Accuracy and Tie Calibration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14324","snapshot_observed_at":"2026-08-06T12:54:33.744321Z","title":"Ties matter: Meta-evaluating modern metrics with pairwise accu- racy and tie calibration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:33.744321Z"},"links":{"cited_paper":"/paper/2305.14324","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:9322d058d3e9d211aa5feac45c1133e28c6380e5cae785dbb17a39c0acdc9445","observation_id":"9f9e2686-3aa2-4027-9f15-d3df3ff8be4f","resolution":{"observed_at":"2026-08-06T12:54:33.744321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:33.829967Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:33.829967Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:65d20226cb4e331c48a83eb31f13f00238aa0c5347762b33087269290e28b35c","observation_id":"78af6481-780c-46fc-b0f7-791cee9478e1","resolution":{"observed_at":"2026-08-06T12:54:33.829967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:44.041491Z","title":"Cogview: Mastering text-to-image generation via transformers","venue":null,"work_id":"a2b6c889-072e-48ce-a0de-fd81f973221f","year":2021},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:33.924185Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:5805abd0aaa1a5d8787dacf52067358b625697eb9de6ef7314495573f773137d","observation_id":"c1490d63-88ed-496b-aa9e-9014014c8769","resolution":{"observed_at":"2026-08-06T12:54:44.159261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:43.754442Z","title":"Dpok: Reinforcement learning for fine-tuning text-to-image diffu- sion models","venue":null,"work_id":"176ba917-e957-4374-b069-e9d842094704","year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:34.027720Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:633c9a8cd351c56a4d52fc8aab3cbe840690654a93358d4c4d09ddf6cf2bd8f9","observation_id":"52916587-4e53-4a68-838e-944fbb9d03f4","resolution":{"observed_at":"2026-08-06T12:54:43.900852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:43.483257Z","title":"Geneval: An object-focused framework for evaluating text- to-image alignment","venue":null,"work_id":"5f44f272-aaf8-4b1a-bdb5-39c93b6bf2c4","year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:34.106894Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:51cfc905380fdd135dc51b445f8b5762ea1e792836a8879acc725a482c0bbe64","observation_id":"34de7a70-025e-44a6-9eb6-2c9eec8e2305","resolution":{"observed_at":"2026-08-06T12:54:43.638002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:43.254691Z","title":"Generative adversarial networks","venue":null,"work_id":"bf1c4a14-7663-4a33-99f5-d4acb2e58565","year":2020},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:34.174919Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:81deac3952645ae2af20c72e9f0b7b76af39c1a912890bf4c48efcc0915fc963","observation_id":"60ca7fe7-16c2-4966-bc17-8305b4f4f500","resolution":{"observed_at":"2026-08-06T12:54:43.359411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05113","last_updated":"2025-06-06T17:08:12Z","snapshot_observed_at":"2026-08-06T15:48:59.504311Z","submitted_at":"2024-06-07T17:44:32Z","title":"LlavaGuard: An Open VLM-based Framework for Safeguarding Vision Datasets and Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05113","snapshot_observed_at":"2026-08-06T12:54:34.226626Z","title":"Llavaguard: Vlm-based safeguards for vision dataset curation and safety assessment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:34.226626Z"},"links":{"cited_paper":"/paper/2406.05113","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:24917478ab7e92dcc4c66c103cb2a468f23deb5873c9082e98beb272f2d7a1f8","observation_id":"d8979830-9d36-44d0-be4c-f66261f68e20","resolution":{"observed_at":"2026-08-06T12:54:34.226626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-06T12:54:34.274450Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:34.274450Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:a27366b80e39ab798781bdf6d5d0d4a41c5ca8c303376a41b7e1fb43dbecf315","observation_id":"93f16588-f141-461c-beb4-88fdcbfe6f57","resolution":{"observed_at":"2026-08-06T12:54:34.274450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:34.347454Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:34.347454Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:a8c10c8a7d1b428282c1a19fe0f77155b31e557cc526deb9e3bd8cf64508be7b","observation_id":"221cbe1b-c39c-48fa-b1f5-12875ac86735","resolution":{"observed_at":"2026-08-06T12:54:34.347454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:34.455883Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:34.455883Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:9df5d31b4cc0993e5c8a26ae5b3281cbcb591df3df12dff79720b48f4b3c1a1b","observation_id":"175a9c86-8bea-49fc-b5ff-ec2393d1ae23","resolution":{"observed_at":"2026-08-06T12:54:34.455883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T12:54:34.578707Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:34.578707Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:e789159aea3ac95afc5cdcfd0e43ec8a065bf8139af13c90b203f3f8b989bc24","observation_id":"c6bf3fea-02f6-44eb-904f-15421c7d9897","resolution":{"observed_at":"2026-08-06T12:54:34.578707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-06T12:54:34.709673Z","title":"Llama guard: Llm- based input-output safeguard for human-ai conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:34.709673Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:c94866c978d17dcbb46d432dcec96dc89efebba9e506c5247e8dc0ae37a13a11","observation_id":"848fe526-4132-4bf4-9e22-842a315f02bf","resolution":{"observed_at":"2026-08-06T12:54:34.709673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:42.986894Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation","venue":null,"work_id":"c5e82883-67c1-45b7-b991-c8837169b010","year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:34.861279Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:a10adcd8f67a338a9271537c6f57bcec2239e20e9fb0984dd0e71a7a26d80b00","observation_id":"0bc91a6b-bbdc-4591-8105-4bfd5f909bf7","resolution":{"observed_at":"2026-08-06T12:54:43.109881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14867","last_updated":"2024-06-03T16:59:20Z","snapshot_observed_at":"2026-07-06T17:07:14.412645Z","submitted_at":"2023-12-22T17:45:19Z","title":"VIEScore: Towards Explainable Metrics for Conditional Image Synthesis Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14867","snapshot_observed_at":"2026-08-06T12:54:34.950914Z","title":"Viescore: Towards explainable metrics for conditional image synthesis evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:34.950914Z"},"links":{"cited_paper":"/paper/2312.14867","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:3bd3f274afbe68d48ed4fd91fdb158f8fa000b46a5d2e517c530c873b46d3270","observation_id":"4bf251e1-f89a-4031-8745-a2ac7ded0574","resolution":{"observed_at":"2026-08-06T12:54:34.950914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-07-06T18:09:29.876755Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-06T12:54:35.047298Z","title":"What matters when building vision-language models? arXiv preprint arXiv:2405.02246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.047298Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:fb50138b2489a945f41bc9f8ac7eeab0fbbc071c953f2713387b29494b6ae6b4","observation_id":"d72d80f3-ba3e-4c4d-9c51-5d707ddf2eb9","resolution":{"observed_at":"2026-08-06T12:54:35.047298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:42.672260Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"46bea5d0-1c44-4fe2-b1d2-f56c9143d560","year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.145183Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:768b64c6d4a41615de70b8ddda07bfca41752aa207441af7df55b72982baab61","observation_id":"71df43e3-76ce-4791-a801-b71882b18abe","resolution":{"observed_at":"2026-08-06T12:54:42.807225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12612","last_updated":"2025-07-25T08:18:26Z","snapshot_observed_at":"2026-07-06T20:24:12.803909Z","submitted_at":"2025-01-22T03:29:43Z","title":"T2ISafety: Benchmark for Assessing Fairness, Toxicity, and Privacy in Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12612","snapshot_observed_at":"2026-08-06T12:54:35.249132Z","title":"T2isafety: Benchmark for assessing fairness, toxicity, and privacy in image genera- tion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.249132Z"},"links":{"cited_paper":"/paper/2501.12612","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:c02a1bd1064c0afc3408a8f7ae53df7f7383724486052056566715b45b5536ef","observation_id":"bc9aae33-9a27-401b-b7c8-be632420679e","resolution":{"observed_at":"2026-08-06T12:54:35.249132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:42.401734Z","title":"Remov- ing distributional discrepancies in captions improves image- text alignment","venue":null,"work_id":"c7ed48e2-1534-4f32-a293-97e90ee80d62","year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.362579Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:62195318388da957e3df9dc916d431a65428332c0a8a5042643201296e2a8331","observation_id":"94664539-1edf-4155-acf0-6690ccf5666b","resolution":{"observed_at":"2026-08-06T12:54:42.539329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:42.169324Z","title":"Evaluating text-to-visual generation with image-to-text gen- eration","venue":null,"work_id":"fadbd559-8d69-44c3-a9d1-711d4efc1f48","year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.442644Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:5eefdd8396ce077498e0f4e12ebdbccf07473f07cd3ee5db5cf3842aee995472","observation_id":"337ed284-26b4-4f43-b34a-095d129c1003","resolution":{"observed_at":"2026-08-06T12:54:42.271746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-07T05:53:12.643515Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-06T12:54:35.526604Z","title":"Skywork-reward: Bag of tricks for reward modeling in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.526604Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:af831390f1b7bbe641f6c14aaee8f1c1dc362078d3b89f5424b89f83049afaec","observation_id":"0b495463-d938-487a-836d-29917f2f9c97","resolution":{"observed_at":"2026-08-06T12:54:35.526604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:41.914896Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":"1e967a89-a9e3-4fb2-86e5-d05ea417414d","year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.620233Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:aa1351f7c1bb0f4abdf144c16d22e64c1ea05eddab70f50560b1ba26357e818f","observation_id":"485cd105-58bf-4858-b115-6c11111da2f0","resolution":{"observed_at":"2026-08-06T12:54:42.023960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:41.668014Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"f29f90d1-3628-4ac9-b853-d06350b25988","year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.676524Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:f76665202b4abc9320524dd0613e56dff14aec745db07ba67ff3821302e04afb","observation_id":"0750e59b-d266-4b5c-be87-abf663dab75c","resolution":{"observed_at":"2026-08-06T12:54:41.790950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:41.447438Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"82789989-00e4-40b7-bc7e-f946bed3ae2c","year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.725893Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:7ac79a36f7cb2a2f46799b93f2a13394599f9f6ba426412a1997dbd3f207dda2","observation_id":"e18fadd7-3903-415d-8b9c-58d5e539e4c0","resolution":{"observed_at":"2026-08-06T12:54:41.529889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:35.785004Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.785004Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:3627140e6f677d46233538e75f574360c901babdc8fb50cb8dfa90927da6a826","observation_id":"d4a9139f-d60a-4b32-a7b7-4b4aaa609763","resolution":{"observed_at":"2026-08-06T12:54:35.785004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09732","last_updated":"2025-01-16T18:30:37Z","snapshot_observed_at":"2026-07-06T20:22:04.328179Z","submitted_at":"2025-01-16T18:30:37Z","title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09732","snapshot_observed_at":"2026-08-06T12:54:35.880961Z","title":"Inference-time scaling for diffu- sion models beyond scaling denoising steps","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.880961Z"},"links":{"cited_paper":"/paper/2501.09732","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:d05d8bd3a5d97d141c7c27aafec5371de1c5b6e9f37a50b6932b2b8a6853385b","observation_id":"af03050d-fe22-4c9c-86de-850fb1ef8d9a","resolution":{"observed_at":"2026-08-06T12:54:35.880961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:41.181314Z","title":"Simpo: Sim- ple preference optimization with a reference-free reward","venue":null,"work_id":"f49cfe2f-afba-49d5-bd9c-e9f14fa26d11","year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.929519Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:bcc001459e7de04907d169f472e9e16f244ec947a794a293f5e61302b91e961f","observation_id":"90215b59-d14e-4456-8c68-0e470e90ac48","resolution":{"observed_at":"2026-08-06T12:54:41.318338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:35.985916Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:35.985916Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:53e7e9ddc370357fb0cca4afe90c2d943b755de0cd22e3d3c2f19f7b3d5d1c58","observation_id":"1d91967a-7d25-4f32-86be-571db2738094","resolution":{"observed_at":"2026-08-06T12:54:35.985916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T12:54:36.083635Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:36.083635Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:529b98f876a5b595ae10abe0751ff47ff45b20b1a5d94b187a642bd79213041c","observation_id":"7dbeb8a1-6a9a-4e17-bca3-1bd6e508fc90","resolution":{"observed_at":"2026-08-06T12:54:36.083635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:40.942821Z","title":"Unsafe diffusion: On the generation of unsafe images and hateful memes from text-to-image models","venue":null,"work_id":"c028a1a8-b0e5-4293-881c-e6f9f04b2901","year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:36.177621Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:85aa3cab8d19a376b1014cc08bb632c171e7e7d78597936f305f875eeae96781","observation_id":"19a5864c-3e88-4d4d-8c3a-5565a4ec0ab4","resolution":{"observed_at":"2026-08-06T12:54:41.061472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03486","last_updated":"2025-09-11T08:50:08Z","snapshot_observed_at":"2026-08-04T06:06:53.556065Z","submitted_at":"2024-05-06T13:57:03Z","title":"UnsafeBench: Benchmarking Image Safety Classifiers on Real-World and AI-Generated Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03486","snapshot_observed_at":"2026-08-06T12:54:36.257427Z","title":"Unsafebench: Benchmarking image safety classifiers on real-world and ai-generated im- ages","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:36.257427Z"},"links":{"cited_paper":"/paper/2405.03486","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:4160cb9488050d1107e4ef017fc484aafe644b1079ed352cd887ccecfad7089d","observation_id":"486054fb-1c29-405f-a1e9-74cbe132e51b","resolution":{"observed_at":"2026-08-06T12:54:36.257427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:36.362963Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:36.362963Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:23ae03552f25f5dd798569fa2b22f2e6415c5cab54aa5c956c1fcee0712642cb","observation_id":"498d6646-c498-490b-95c6-c800bcb74c8e","resolution":{"observed_at":"2026-08-06T12:54:36.362963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:40.689888Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"d12c2324-d3eb-4a9d-8775-8136b88a472d","year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:36.445317Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:769d45c469ce2d70a2146bafd5e15968b662994dbc888e557c9730a19d2ce5b4","observation_id":"95dc7cc0-f7d0-40c6-b4f4-aca3578260c1","resolution":{"observed_at":"2026-08-06T12:54:40.824402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:40.416721Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"9dd633e2-459b-477e-9fde-e31bb644a7bd","year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:36.562776Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:1430d3f1314256ac8114fe94f8a6e40d99c9bb54907bc7a83524cccc3f0e9029","observation_id":"607b8cf6-d085-4e66-8f7e-74768b3fca54","resolution":{"observed_at":"2026-08-06T12:54:40.561887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:40.144419Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"79b1cb3c-9c32-45dd-8baa-dec1844cdf91","year":2021},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:36.684650Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:0f2ff8c0e8d78903ce26afae31e10ed9b2cb2cfeafff2b54bd3cea6f1850db8d","observation_id":"dc7536f8-7fcf-463d-90d7-e39f42ce4053","resolution":{"observed_at":"2026-08-06T12:54:40.280839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:39.942608Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"5302e2c7-8739-48d5-94a8-c202dcc5b168","year":2022},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:36.771953Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:a56386ae84394c6d72097afe1f9fd415c66436b12fb0ca38f7c735cf1fc616bc","observation_id":"c52fbfde-6f70-4c49-9cd8-36c5ef12c567","resolution":{"observed_at":"2026-08-06T12:54:40.038981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:39.718710Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"ead90437-1bc1-4f4e-a555-6594e0573e62","year":2022},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:36.863239Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:438cc8b5ef88ec2ada81cacb9dbb45f668c73428ab67c13a855c4b0611083d28","observation_id":"4d7867f7-2ff2-42e1-8576-59eb0668b5c0","resolution":{"observed_at":"2026-08-06T12:54:39.835962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:36.914296Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:36.914296Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:f87db68a74e8e3bd81d49e57d9d82b1374974037c2eeb0d9d6c3f192db53992f","observation_id":"f0c300b8-ddfb-44bf-b455-1d9f0393f153","resolution":{"observed_at":"2026-08-06T12:54:36.914296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T12:54:36.988698Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:36.988698Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:389e20a0f1e8fa725d1fc26eb7243940ff7a09b6271ce865798983acb9030bdc","observation_id":"3ce9b861-b945-4995-ba66-1d41e41b7056","resolution":{"observed_at":"2026-08-06T12:54:36.988698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06848","last_updated":"2025-07-18T17:52:45Z","snapshot_observed_at":"2026-07-06T20:19:55.486841Z","submitted_at":"2025-01-12T15:34:24Z","title":"A General Framework for Inference-time Scaling and Steering of Diffusion Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06848","snapshot_observed_at":"2026-08-06T12:54:37.089978Z","title":"A general framework for inference-time scaling and steering of diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.089978Z"},"links":{"cited_paper":"/paper/2501.06848","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:ef52c7da24a4792d06237ff82dbcf062660298edcd2e637d70039ffbbce43a32","observation_id":"a326a054-deaf-4fbf-8f2f-962890284bd8","resolution":{"observed_at":"2026-08-06T12:54:37.089978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:39.572531Z","title":null,"venue":null,"work_id":"9c5d389e-d821-4ed3-9c1e-f1d6d0d74254","year":2025},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.170906Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:8b03b03b5acc4a45609a4e3dfa838a73e1c9552be8a426317318599b7fa2b273","observation_id":"0fb5a6c6-185f-4428-8657-6b08bb29b32c","resolution":{"observed_at":"2026-08-06T12:54:39.626966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:39.435717Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"91fa8030-db90-4954-a624-593f0f02d99a","year":2015},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.288393Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:2c15662ca5209d39c29fbb555c6a51b8762e30a702e8596d7ccd140ec15506c3","observation_id":"04f9475e-a2e7-4fcf-acdb-d64cd9abb94f","resolution":{"observed_at":"2026-08-06T12:54:39.484015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04991","last_updated":"2025-01-26T00:46:36Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:57:03Z","title":"Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04991","snapshot_observed_at":"2026-08-06T12:54:37.374599Z","title":"Rethink- ing bradley-terry models in preference-based reward mod- eling: Foundations, theory, and alternatives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.374599Z"},"links":{"cited_paper":"/paper/2411.04991","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:afbb23eef8e1f2eb60c0e2804e5566bbbff06936e0e66867707db1930fd0bbcf","observation_id":"faaa401d-b7f0-4ec2-b1aa-a54f8cd4e031","resolution":{"observed_at":"2026-08-06T12:54:37.374599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16562","last_updated":"2024-10-10T14:04:07Z","snapshot_observed_at":"2026-07-06T18:35:59.208843Z","submitted_at":"2024-06-24T11:56:15Z","title":"EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16562","snapshot_observed_at":"2026-08-06T12:54:37.474204Z","title":"Evalalign: Supervised fine- tuning multimodal llms with human-aligned data for evaluat- ing text-to-image models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.474204Z"},"links":{"cited_paper":"/paper/2406.16562","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:353d962fed940891c4c22420b305bcf302a76057880cda54653c58b0595b003f","observation_id":"ee6f6be9-143b-4030-8a6e-1d5888fb3122","resolution":{"observed_at":"2026-08-06T12:54:37.474204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15488","last_updated":"2024-11-23T08:06:06Z","snapshot_observed_at":"2026-07-06T19:55:55.658760Z","submitted_at":"2024-11-23T08:06:06Z","title":"Automatic Evaluation for Text-to-image Generation: Task-decomposed Framework, Distilled Training, and Meta-evaluation Benchmark","version":1},"cited_work":{"arxiv_id":"2411.15488","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.15488","snapshot_observed_at":"2026-08-06T12:54:38.418348Z","title":"Automatic Evaluation for Text-to-image Generation: Task-decomposed Framework, Distilled Training, and Meta-evaluation Benchmark","venue":"cs.CL","work_id":"35e7ac94-442d-429a-891b-4608b008b482","year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.533704Z"},"links":{"cited_paper":"/paper/2411.15488","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:6cfb05652858d70526e526ff0d3e4fdd2d439a7f2d529f0a065211118dcfcff5","observation_id":"cf014844-e467-460e-99a7-964de4cccaef","resolution":{"observed_at":"2026-08-06T12:54:38.472533Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01257","last_updated":"2025-03-06T12:13:14Z","snapshot_observed_at":"2026-07-06T19:25:42.156795Z","submitted_at":"2024-10-02T06:05:52Z","title":"HelpSteer2-Preference: Complementing Ratings with Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01257","snapshot_observed_at":"2026-08-06T12:54:37.619519Z","title":"Helpsteer2-preference: Complementing ratings with preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.619519Z"},"links":{"cited_paper":"/paper/2410.01257","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:39906f1c047ad4acaeeb6edc8a23d3305d45e68d75a6ab42db802fe21b5473cc","observation_id":"0d92521d-7af7-4991-839f-b0e355584ce3","resolution":{"observed_at":"2026-08-06T12:54:37.619519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00192","last_updated":"2025-04-06T17:30:18Z","snapshot_observed_at":"2026-08-02T00:33:49.431280Z","submitted_at":"2024-12-31T00:06:04Z","title":"MLLM-as-a-Judge for Image Safety without Human Labeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00192","snapshot_observed_at":"2026-08-06T12:54:37.686456Z","title":"Mllm-as-a-judge for image safety without human labeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.686456Z"},"links":{"cited_paper":"/paper/2501.00192","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:596c2e52279d62b97e12e30923a89f2270d23503f61f51387daf85478071abd2","observation_id":"0649d742-b68a-404e-b33f-82115b5ade71","resolution":{"observed_at":"2026-08-06T12:54:37.686456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17090","last_updated":"2023-12-28T16:10:25Z","snapshot_observed_at":"2026-08-02T07:14:02.308302Z","submitted_at":"2023-12-28T16:10:25Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17090","snapshot_observed_at":"2026-08-06T12:54:37.787465Z","title":"Q-align: Teaching lmms for visual scoring via discrete text-defined levels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.787465Z"},"links":{"cited_paper":"/paper/2312.17090","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:a5bbc2edfce8feb30541d34883a11ddc075f11a0e82ef86d42d5cf384d6867d8","observation_id":"47994f55-4f79-43be-96c8-6f0b8b3df90c","resolution":{"observed_at":"2026-08-06T12:54:37.787465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:39.310882Z","title":"Human preference score: Better aligning text- to-image models with human preference","venue":null,"work_id":"bde68c7f-ff07-4364-b1cf-32df46f5e6a2","year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.859469Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:e4c552bd5ec6ce13caa7a20065357cd5be79f41dfd6411a9fa887b28f7d122ca","observation_id":"55c643a1-c5da-4050-9945-d9ba9e50d216","resolution":{"observed_at":"2026-08-06T12:54:39.344930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:39.176233Z","title":"Imagere- ward: Learning and evaluating human preferences for text- to-image generation","venue":null,"work_id":"7360ddde-49a3-4564-8973-e12386919d98","year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.927082Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:55c3acc04c9a7e2b2f20260d2e61e8f5a313d6cf2b76a964c573da942ef2284e","observation_id":"75506a12-6c51-49bb-ab43-87fb31752d09","resolution":{"observed_at":"2026-08-06T12:54:39.261401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:39.072509Z","title":"A normalized levenshtein distance metric","venue":null,"work_id":"f0e3acbb-1c2c-4f28-8ea0-bc3c4d2c5830","year":2007},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.998771Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:0afc035a39480c0e9d87eff8fbfa716b35ebcc015a723791d3fb8950a58203b7","observation_id":"3eaeffba-521a-4480-85fb-6f093aab3080","resolution":{"observed_at":"2026-08-06T12:54:39.129080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:38.901234Z","title":"When and why vision- language models behave like bags-of-words, and what to do about it? In The Eleventh International Conference on Learning Representations, 2023","venue":null,"work_id":"088b5812-fea5-4acd-9252-40eb86ec3d64","year":2023},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:38.090385Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:ec28a31ee70cf969d20fe8aa47517327ed665a5b12455f75f3515e4a92d1cf21","observation_id":"3f3acc0d-51d8-422a-8f4f-e5647e7a1e6a","resolution":{"observed_at":"2026-08-06T12:54:38.984919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02197","last_updated":"2025-06-11T13:11:12Z","snapshot_observed_at":"2026-07-06T19:26:43.399756Z","submitted_at":"2024-10-03T04:22:55Z","title":"Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02197","snapshot_observed_at":"2026-08-06T12:54:38.169486Z","title":"General preference modeling with preference rep- resentations for aligning language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:38.169486Z"},"links":{"cited_paper":"/paper/2410.02197","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:f8d58292df60e08a10be7e10b24ca3c5a6e0f8630323ae5a21a123bc4dc04bb1","observation_id":"a5e53093-eb1b-4ff2-9218-0079c8c509a9","resolution":{"observed_at":"2026-08-06T12:54:38.169486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06169","last_updated":"2024-11-30T05:32:51Z","snapshot_observed_at":"2026-07-06T19:29:51.449372Z","submitted_at":"2024-10-08T16:13:24Z","title":"Treat Visual Tokens as Text? But Your MLLM Only Needs Fewer Efforts to See","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06169","snapshot_observed_at":"2026-08-06T12:54:38.229729Z","title":"Treat visual tokens as text? but your mllm only needs fewer efforts to see","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:38.229729Z"},"links":{"cited_paper":"/paper/2410.06169","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:1d925ca09d97ee06bae5897c5c78cab6d3b894e9ee9c25255e4cd739b1e3e293","observation_id":"b42a0d17-7f87-4a78-8598-5098a9b2a63e","resolution":{"observed_at":"2026-08-06T12:54:38.229729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:54:38.782192Z","title":"Towards language-free training for text-to-image generation","venue":null,"work_id":"6f758913-008d-48c1-ae4f-0f9a0e4be228","year":2022},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:38.274595Z"},"links":{"citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:52813ec1ed328665a6521184dd634a9e37e60cdfacbe3a9187c6dca9fa619242","observation_id":"cb6d2b9e-4aab-478f-ba2d-91070b9da082","resolution":{"observed_at":"2026-08-06T12:54:38.832890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T17:28:45.754374Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2507.21391."}