{"as_of":"2026-08-07T18:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:223a542a9268b1b259b620310240ff98b6c909e275f0a5a7e0d4c9271f070073","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:54:26.490129Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T07:03:12.753735Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T13:39:51.508184Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"cited_work":{"arxiv_id":"2510.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.12784","snapshot_observed_at":"2026-07-04T13:39:51.508184Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions.ACM Transactions on Information Systems, 43(2):1–55, 2025a","venue":"cs.CV","work_id":"bb6b9aad-5576-4190-955d-bf07c0d3955b","year":2025},"citing_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-07T17:17:00.060047Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T16:24:27.407376Z"},"links":{"cited_paper":"/paper/2510.12784","citing_paper":"/paper/2503.07265"},"observation_digest":"sha256:e21a785c3dd9420303ff11add58fac1d449bed7a7d24e4374d4bafd11afa7efd","observation_id":"4cf4f63b-3c5e-4d8a-ab65-2a4809a517b3","resolution":{"observed_at":"2026-06-30T02:16:10.489172Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"cited_work":{"arxiv_id":"2510.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.12784","snapshot_observed_at":"2026-07-04T13:39:51.508184Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions.ACM Transactions on Information Systems, 43(2):1–55, 2025a","venue":"cs.CV","work_id":"bb6b9aad-5576-4190-955d-bf07c0d3955b","year":2025},"citing_paper":{"arxiv_id":"2510.16888","last_updated":"2025-11-04T13:15:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-19T15:38:06Z","title":"Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T18:01:19.748677Z"},"links":{"cited_paper":"/paper/2510.12784","citing_paper":"/paper/2510.16888"},"observation_digest":"sha256:c31e004d8cf8d00bd0b32a1a5b7796e77a03059e745372aad112770a5189adab","observation_id":"50317f72-eb0a-44f4-a0d9-edf4bd10776d","resolution":{"observed_at":"2026-06-30T02:16:10.489172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.12784","snapshot_observed_at":"2026-08-03T07:03:12.753735Z","title":"Srum: Fine-grained self-rewarding for unified multimodal models.arXiv preprint arXiv:2510.12784,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.21406","last_updated":"2026-05-25T11:24:48Z","snapshot_observed_at":"2026-08-03T07:03:10.947402Z","submitted_at":"2026-01-29T08:42:25Z","title":"Generation Enhances Understanding in Unified Multimodal Models via Multi-Representation Generation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T07:03:12.753735Z"},"links":{"cited_paper":"/paper/2510.12784","citing_paper":"/paper/2601.21406"},"observation_digest":"sha256:871f00b2df201c9c36b00c374fb36b69d14a43622d9209433496e79be36be196","observation_id":"4310b37d-95b0-4a97-a2c1-5e300df3591e","resolution":{"observed_at":"2026-08-03T07:03:12.753735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"cited_work":{"arxiv_id":"2510.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.12784","snapshot_observed_at":"2026-07-04T13:39:51.508184Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions.ACM Transactions on Information Systems, 43(2):1–55, 2025a","venue":"cs.CV","work_id":"bb6b9aad-5576-4190-955d-bf07c0d3955b","year":2025},"citing_paper":{"arxiv_id":"2605.17766","last_updated":"2026-05-18T02:35:05Z","snapshot_observed_at":"2026-08-02T02:51:49.314780Z","submitted_at":"2026-05-18T02:35:05Z","title":"LatentUMM: Dual Latent Alignment for Unified Multimodal Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T12:39:28.058049Z"},"links":{"cited_paper":"/paper/2510.12784","citing_paper":"/paper/2605.17766"},"observation_digest":"sha256:bf0c6afd7c4106af0fb8ceecb7dc499a5ef3dd9851d52967dda50f53609c3cfa","observation_id":"951fc723-3b58-4cf2-aa41-eccb5dad1761","resolution":{"observed_at":"2026-06-30T02:16:10.489172Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"cited_work":{"arxiv_id":"2510.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.12784","snapshot_observed_at":"2026-07-04T13:39:51.508184Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions.ACM Transactions on Information Systems, 43(2):1–55, 2025a","venue":"cs.CV","work_id":"bb6b9aad-5576-4190-955d-bf07c0d3955b","year":2025},"citing_paper":{"arxiv_id":"2605.25328","last_updated":"2026-05-25T01:17:32Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:17:32Z","title":"DIVA: Harnessing the Representation Divergence in Unified Multimodal Models for Mutual Reinforcement","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T23:08:57.793923Z"},"links":{"cited_paper":"/paper/2510.12784","citing_paper":"/paper/2605.25328"},"observation_digest":"sha256:6f7eb4f3d0793a66097f3ad1f9ddecacefcb09fb010be504335d0f28de8ca591","observation_id":"e1b01783-1022-4eb3-b66e-130f2affe4b0","resolution":{"observed_at":"2026-06-30T02:16:10.489172Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"cited_work":{"arxiv_id":"2510.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.12784","snapshot_observed_at":"2026-07-04T13:39:51.508184Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions.ACM Transactions on Information Systems, 43(2):1–55, 2025a","venue":"cs.CV","work_id":"bb6b9aad-5576-4190-955d-bf07c0d3955b","year":2025},"citing_paper":{"arxiv_id":"2606.05031","last_updated":"2026-06-03T15:58:56Z","snapshot_observed_at":"2026-07-06T23:45:02.342193Z","submitted_at":"2026-06-03T15:58:56Z","title":"MetaPoint: Unlocking Precise Spatial Control in Agentic Visual Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T06:07:06.056441Z"},"links":{"cited_paper":"/paper/2510.12784","citing_paper":"/paper/2606.05031"},"observation_digest":"sha256:7e61076ecad31682a52fda6e299a1ea1a655b36a6d9000c0f75c63b0ed51f8fe","observation_id":"23c978e2-9b35-48b7-a8ae-758dbddb341a","resolution":{"observed_at":"2026-07-02T08:16:48.490594Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"cited_work":{"arxiv_id":"2510.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.12784","snapshot_observed_at":"2026-07-04T13:39:51.508184Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions.ACM Transactions on Information Systems, 43(2):1–55, 2025a","venue":"cs.CV","work_id":"bb6b9aad-5576-4190-955d-bf07c0d3955b","year":2025},"citing_paper":{"arxiv_id":"2606.27376","last_updated":"2026-06-25T17:59:57Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:59:57Z","title":"Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T04:58:15.891214Z"},"links":{"cited_paper":"/paper/2510.12784","citing_paper":"/paper/2606.27376"},"observation_digest":"sha256:ea7d5ff57ec1322c6c526efbee8765d1135b6cd4aacbec1b0cf2baf8a8f0878b","observation_id":"3c66c9a6-e1d5-434b-840b-80d287bbf7af","resolution":{"observed_at":"2026-07-04T13:39:51.510296Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"cited_work":{"arxiv_id":"2510.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.12784","snapshot_observed_at":"2026-07-04T13:39:51.508184Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions.ACM Transactions on Information Systems, 43(2):1–55, 2025a","venue":"cs.CV","work_id":"bb6b9aad-5576-4190-955d-bf07c0d3955b","year":2025},"citing_paper":{"arxiv_id":"2606.29941","last_updated":"2026-06-29T08:20:18Z","snapshot_observed_at":"2026-08-06T16:16:32.268412Z","submitted_at":"2026-06-29T08:20:18Z","title":"Seeing Touch from Motion: A Unified Modality-Aware Visuo-Tactile Policy with Tactile Motion Correlation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T05:55:54.345160Z"},"links":{"cited_paper":"/paper/2510.12784","citing_paper":"/paper/2606.29941"},"observation_digest":"sha256:4dca1cc4964b421b924ea0d782f3283eee473be8233b75c1e98770a3d5b6a0d4","observation_id":"9ae340f2-453f-444f-8f11-073b87cde87f","resolution":{"observed_at":"2026-06-30T13:24:41.122344Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.12784","snapshot_observed_at":"2026-08-02T01:27:21.368364Z","title":"Srum: Fine-grained self- rewarding for unified multimodal models.arXiv preprint arXiv:2510.12784, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14681","last_updated":"2026-07-16T07:43:27Z","snapshot_observed_at":"2026-08-06T12:57:36.194341Z","submitted_at":"2026-07-16T07:43:27Z","title":"ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:21.368364Z"},"links":{"cited_paper":"/paper/2510.12784","citing_paper":"/paper/2607.14681"},"observation_digest":"sha256:d3949f5b4d017f2439bbaaec8b5ca6ee7a458869ddf075f57fee6b4fdbad7565","observation_id":"a544d83d-0cbe-4b99-aa04-ec25b715ca85","resolution":{"observed_at":"2026-08-02T01:27:21.368364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.12784/citation-record","integrity":"/paper/2510.12784/integrity","json":"/paper/2510.12784/citation-record.json","paper":"/paper/2510.12784"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-04T09:54:23.856369Z","title":"Gqa: Training generalized multi-query transformer models from multi-head check- points.arXiv preprint arXiv:2305.13245,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:23.856369Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:dac497f3beeed7ae097ff6e5ad8c07f73d943ab2f356100b9e8b31156a2ba5d8","observation_id":"13b77b4b-7b0e-436d-9ec5-675cc5d63b2a","resolution":{"observed_at":"2026-08-04T09:54:23.856369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-04T09:54:24.057136Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:24.057136Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:b6e89d4c6b08066cbccd6781577824780ffc4d1dd1bb24fdc94fe3e6ce60bef5","observation_id":"532963aa-c400-4198-8e4f-e39c5f12a212","resolution":{"observed_at":"2026-08-04T09:54:24.057136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-04T09:54:24.131408Z","title":"Emerging properties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:24.131408Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:787dbdb6758cd8352de04a51ee459bcd909d7e09d5fa07db623ec0f79a6e7d9c","observation_id":"947d853c-d5f8-4a92-aaad-6d0b9e6cc133","resolution":{"observed_at":"2026-08-04T09:54:24.131408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-04T09:54:24.239016Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv preprint arXiv:2503.10639,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:24.239016Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:228e6685170b03fb8a8c58a3427e4eef853f07d9dd0ad1d32b9ed193e57f12d9","observation_id":"c317703b-34b2-4365-81ba-33f4da95b3ef","resolution":{"observed_at":"2026-08-04T09:54:24.239016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-07-06T05:46:07.424788Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-04T09:54:24.247164Z","title":"Accurate, large minibatch sg d: training imagenet in 1 hour.arXiv preprint arXiv:1706.02677,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:24.247164Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:d8b8a31eecada09f6a0fe9350bf22dad135f90f2f18656eac51a4d0a39006907","observation_id":"426f6dc4-ea4d-4757-936b-199b4552a7d2","resolution":{"observed_at":"2026-08-04T09:54:24.247164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-04T09:54:24.551754Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:24.551754Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:694c38eae9ed0417b6420da95dca90ec32da312d09fb2c4c32c0652305e08b3e","observation_id":"a9b203f2-4f05-4091-8918-ba685e9797a7","resolution":{"observed_at":"2026-08-04T09:54:24.551754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09990","last_updated":"2024-04-15T17:59:31Z","snapshot_observed_at":"2026-07-06T18:00:30.424554Z","submitted_at":"2024-04-15T17:59:31Z","title":"HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09990","snapshot_observed_at":"2026-08-04T09:54:25.111416Z","title":"Hq-edit: A high-quality dataset for instruction-based image editing.arXiv preprint arXiv:2404.09990,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:25.111416Z"},"links":{"cited_paper":"/paper/2404.09990","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:f4ecede8fa3ff21613443e2e0ef21d38b8a394bdc63882d05bba1ed33b38f86b","observation_id":"f6930a8a-66d4-4f86-9732-625c7dd4a24e","resolution":{"observed_at":"2026-08-04T09:54:25.111416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08418","last_updated":"2024-07-12T08:54:51Z","snapshot_observed_at":"2026-08-04T09:18:59.444343Z","submitted_at":"2024-06-12T17:01:04Z","title":"OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08418","snapshot_observed_at":"2026-08-04T09:54:25.305850Z","title":"Qingyun Li, Zhe Chen, Weiyun Wang, Wenhai Wang, Shenglong Ye, Zhenjiang Jin, Guanzhou Chen, Yinan He, Zhangwei Gao, Erfei Cui, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:25.305850Z"},"links":{"cited_paper":"/paper/2406.08418","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:3e02e8a9c36ed6ad073f09228714b46b7286cf06f9a6b2c82fdc1838b2ccdde2","observation_id":"17a19361-0ea5-4e8b-9ff8-16d408649dd5","resolution":{"observed_at":"2026-08-04T09:54:25.305850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:54:25.476201Z","title":"Langbridge: Interpreting image as a combination of language embeddings.arXiv preprint arXiv:2503.19404,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:25.476201Z"},"links":{"citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:4db0e9c2ca879afffd69190e86caf91bbf66fe3c22ef6d87bae9b7122a9c3750","observation_id":"73fba6df-8a41-49d9-a88c-9f7610cd1f28","resolution":{"observed_at":"2026-08-04T09:54:25.476201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-08-04T09:54:25.696314Z","title":"Uniworld: High-resolution semantic encoders for unified visual understanding and generation.arXiv preprint arXiv:2506.03147,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:25.696314Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:ff29a4168af65197b8cad66f1880b3076c775aad3bd1e545d8ba679fe4523248","observation_id":"6fc03e94-81fb-42c7-a47d-c53ada4e7b1d","resolution":{"observed_at":"2026-08-04T09:54:25.696314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-04T09:54:25.973674Z","title":"Visual instruction tuning.NeurIPS, 36:34892–34916, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:25.973674Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:3bc491deb73badc8f1bab20b10e0bb59b1fcfcdb888e3cbe64e2b096e6d62fb0","observation_id":"b0332082-7bb8-4834-b58e-31bdf2308bff","resolution":{"observed_at":"2026-08-04T09:54:25.973674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-07T12:44:53.093273Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23380","snapshot_observed_at":"2026-08-04T09:54:26.172394Z","title":"Unirl: Self-improving unified multimodal models via supervised and reinforcement learning.arXiv preprint arXiv:2505.23380,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.172394Z"},"links":{"cited_paper":"/paper/2505.23380","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:f08914effcbb80ce835306a0d28da8912d7a9688dd7bed17451c98555c65289b","observation_id":"1b38343b-63f0-4da6-9d9e-c2958e2738fb","resolution":{"observed_at":"2026-08-04T09:54:26.172394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-08-04T09:54:26.229865Z","title":"A theory on adam instability in large- scale machine learning.arXiv preprint arXiv:2304.09871,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.229865Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:e1dbb9bda411307b306ebb8a3d67f7fcce8ce60e2e24dcecd4c87981adad1361","observation_id":"69d936c1-0a4b-4c8d-a1ed-c26e1e006dbd","resolution":{"observed_at":"2026-08-04T09:54:26.229865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-07T17:17:00.060047Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-08-04T09:54:26.236524Z","title":"Wise: A world knowledge-informed semantic evaluation for text-to-image genera- tion.arXiv preprint arXiv:2503.07265,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.236524Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:0683c9a982f61692741ea60863865cc6c56f2e31c5b4e499836d77d9c19db6a1","observation_id":"c46305d4-fff1-43f3-9648-b6231f0a8772","resolution":{"observed_at":"2026-08-04T09:54:26.236524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-04T09:54:26.356247Z","title":"Transfer between modalities with metaqueries.arXiv preprint arXiv:2504.06256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.356247Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:57df548a44dd4833fbaee6211dbf2bb145418dfd3eac5711af376986578ba26b","observation_id":"43ca6ec3-72ee-4f1d-be10-ee0266735696","resolution":{"observed_at":"2026-08-04T09:54:26.356247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-04T09:54:26.449060Z","title":"Llamafusion: Adapting pretrained language models for multimodal generation.arXiv preprint arXiv:2412.15188,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.449060Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:02fe8ee15e99a148da7d3331d59c9a3ba478c5a3487ccca8ee753968af4b21c8","observation_id":"527a0908-9afd-40e7-91e4-9cdb4c2ca112","resolution":{"observed_at":"2026-08-04T09:54:26.449060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17472","last_updated":"2025-08-24T17:59:38Z","snapshot_observed_at":"2026-08-05T16:56:27.362307Z","submitted_at":"2025-08-24T17:59:38Z","title":"T2I-ReasonBench: Benchmarking Reasoning-Informed Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17472","snapshot_observed_at":"2026-08-04T09:54:26.459094Z","title":"T2i-reasonbench: Bench- marking reasoning-informed text-to-image generation.arXiv preprint arXiv:2508.17472,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.459094Z"},"links":{"cited_paper":"/paper/2508.17472","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:3a18a0592c2a2a9042abdae14f793783797531bc3adec28a043a16335a81b15f","observation_id":"3d150c1d-1de3-42bd-b40a-4a5b6f331dc0","resolution":{"observed_at":"2026-08-04T09:54:26.459094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-04T09:54:26.461078Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.461078Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:2021feb4c6b4987f4870029ca70470286e7af5e4cacda471992ab468d6862642","observation_id":"a631c8ce-52d5-436a-aa24-2d3cd8ab1869","resolution":{"observed_at":"2026-08-04T09:54:26.461078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-04T09:54:26.463571Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arxiv:2312.11805,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.463571Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:8c2bfa748f4eda145c1d9ead4f320318ea7b610a8aea8beb9eb41d1ebe3342fe","observation_id":"4bde2f6d-1143-4f64-9030-7ec9e531620b","resolution":{"observed_at":"2026-08-04T09:54:26.463571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-04T09:54:26.465656Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning.arXiv preprint arXiv:2412.14164, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.465656Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:500f41f47c6a8238f5607b4b3febe6751ff2a19c89b9e5a7870c30505d765997","observation_id":"9279a138-2b4f-4018-bcff-553a3dc28fcc","resolution":{"observed_at":"2026-08-04T09:54:26.465656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09575","last_updated":"2024-12-31T02:38:30Z","snapshot_observed_at":"2026-07-06T19:32:24.202391Z","submitted_at":"2024-10-12T15:54:29Z","title":"Reconstructive Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09575","snapshot_observed_at":"2026-08-04T09:54:26.467952Z","title":"Reconstructive visual instruction tuning.arXiv preprint arXiv:2410.09575, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.467952Z"},"links":{"cited_paper":"/paper/2410.09575","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:ab583311735797303d8f495a548a7c5ed654e408c2379dae8ee20a2ba39311c7","observation_id":"9c34c403-4ceb-4df0-a2ec-b05a656ffa54","resolution":{"observed_at":"2026-08-04T09:54:26.467952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-04T09:54:26.470131Z","title":"Qwen-image technical report.arXiv preprint arXiv:2508.02324,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.470131Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:fcf112385aa4c342ab9615f9099ff5c40afd8c7e08c2e1325f76072fd28803a1","observation_id":"4bac751c-412b-4afe-b8f8-d54e3c22c915","resolution":{"observed_at":"2026-08-04T09:54:26.470131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-04T09:54:26.472229Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation.arXiv preprint arXiv:2410.13848, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.472229Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:62a53dae712cdf6d3ebb19e8635d5d1f37d492e4f9c0fa184a8cf7aa68b5219f","observation_id":"a54366fb-566a-446d-90c4-5088e15327a5","resolution":{"observed_at":"2026-08-04T09:54:26.472229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15564","snapshot_observed_at":"2026-08-04T09:54:26.474337Z","title":"Show-o2: Improved native unified multimodal models.arXiv preprint arXiv:2506.15564, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.474337Z"},"links":{"cited_paper":"/paper/2506.15564","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:6344f8a282bc4bd6b01a017ec254ca1cc319aae5df8120ba52ecc5f54a6c35e6","observation_id":"fd171dc8-e761-4fe5-81e1-ac08122995db","resolution":{"observed_at":"2026-08-04T09:54:26.474337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-07-31T14:51:03.625964Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07818","snapshot_observed_at":"2026-08-04T09:54:26.476843Z","title":"Dancegrpo: Unleashing grpo on visual generation.arXiv preprint arXiv:2505.07818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.476843Z"},"links":{"cited_paper":"/paper/2505.07818","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:3f417a2e49c405674084ad75e97dbe428f774ad8d0b915466b0f446d063b71dc","observation_id":"8afffa9f-1194-44f1-b8fb-40e94f36eee3","resolution":{"observed_at":"2026-08-04T09:54:26.476843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15738","last_updated":"2025-03-29T04:08:47Z","snapshot_observed_at":"2026-07-06T19:56:04.259325Z","submitted_at":"2024-11-24T07:02:56Z","title":"AnyEdit: Mastering Unified High-Quality Image Editing for Any Idea","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15738","snapshot_observed_at":"2026-08-04T09:54:26.479280Z","title":"Anyedit: Mastering unified high-quality image editing for any idea.arXiv preprint arXiv:2411.15738, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.479280Z"},"links":{"cited_paper":"/paper/2411.15738","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:a0a6fb3526e0e06b79401c398045b04c25d76fd365f5430086e12f004ccc2a52","observation_id":"6373a76c-d776-48cb-b9c9-e52ee0f9deef","resolution":{"observed_at":"2026-08-04T09:54:26.479280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16280","last_updated":"2024-09-24T17:51:04Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:51:04Z","title":"MonoFormer: One Transformer for Both Diffusion and Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16280","snapshot_observed_at":"2026-08-04T09:54:26.483487Z","title":"Yiyang Zhou, Zhiyuan Fan, Dongjie Cheng, Sihan Yang, Zhaorun Chen, Chenhang Cui, Xiyao Wang, Yun Li, Linjun Zhang, and Huaxiu Yao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.483487Z"},"links":{"cited_paper":"/paper/2409.16280","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:91e34152910f0ce61d7a47339b1518fd749385e60e34fce5a08205951e75b16b","observation_id":"3b9d40d5-b6bd-490f-9d3f-24a5d8907f3b","resolution":{"observed_at":"2026-08-04T09:54:26.483487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:54:26.485681Z","title":"Drawing inspiration from (Molybog et al., 2023), we set the epsilon value to1.0×10 −15 to mitigate loss spikes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.485681Z"},"links":{"citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:6bb4db1f88c271ae5744470503c1bbb0f3347da2a1e2e7235e07d78405467391","observation_id":"97895aa8-09d5-4beb-8f1d-93c72b8a4cfc","resolution":{"observed_at":"2026-08-04T09:54:26.485681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:54:26.488117Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.488117Z"},"links":{"citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:e4cf5cc4dbb3890489fa58ba40c73894872867123cd950858fb79acc93fb0137","observation_id":"36ba23e2-6abe-4e01-8f55-e3824ca83694","resolution":{"observed_at":"2026-08-04T09:54:26.488117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:54:26.490129Z","title":"{original_prompt}","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.490129Z"},"links":{"citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:f9ffb6992c74d8f814690c922e9cb9889e7c11edf12fc218ed75634ede713b9c","observation_id":"884fcefc-72a3-4dee-bc33-1b25b51dd186","resolution":{"observed_at":"2026-08-04T09:54:26.490129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T09:54:24.405328Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:24.405328Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:36baa922832cda1467e252cb12ea5453a48c1ed0fadeb1fc3d3c15d0b516f32b","observation_id":"514b78db-af38-44dc-9eff-39a5e4047e4d","resolution":{"observed_at":"2026-08-04T09:54:24.405328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-04T09:54:26.434173Z","title":"Glu variants improve transformer.arXiv preprint arXiv:2002.05202,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.434173Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:badbeddfc3cf07fad57bb3e4129f3222fd2f47c3dfa4d92a7419ba3f0993ce64","observation_id":"0e88a398-161a-422f-9793-868b228fd1dc","resolution":{"observed_at":"2026-08-04T09:54:26.434173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-04T09:54:24.763296Z","title":"Rae, Oriol Vinyals, and Laurent Sifre","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:24.763296Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:3bf3d40b3882bd910f7a7af8df59df5fc0ff4968deb363c6ff529e4f26e49d56","observation_id":"b5313f9c-29ab-4476-ab86-95b5e6ea8956","resolution":{"observed_at":"2026-08-04T09:54:24.763296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17022","last_updated":"2026-04-12T04:05:04Z","snapshot_observed_at":"2026-07-06T21:28:43.610849Z","submitted_at":"2025-05-22T17:59:58Z","title":"GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17022","snapshot_observed_at":"2026-08-04T09:54:24.184568Z","title":"Got-r1: Unleashing reasoning capability of mllm for visual generation with reinforcement learning.arXiv preprint arXiv:2505.17022,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:24.184568Z"},"links":{"cited_paper":"/paper/2505.17022","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:081c1d3a186452939044ccf54edbdced375d1ac3bd2ec67c31300ecb2f4702fc","observation_id":"caa6bf72-8cd2-47eb-9a59-4c222b40aa02","resolution":{"observed_at":"2026-08-04T09:54:24.184568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07963","last_updated":"2025-09-08T14:31:08Z","snapshot_observed_at":"2026-08-07T16:19:14.303147Z","submitted_at":"2025-06-09T17:38:45Z","title":"SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07963","snapshot_observed_at":"2026-08-04T09:54:24.937137Z","title":"Reinforcing mul- timodal understanding and generation with dual self-rewards.arXiv preprint arXiv:2506.07963,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:24.937137Z"},"links":{"cited_paper":"/paper/2506.07963","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:1416a14c4d2cdb866f36bf3450fd77dc01c61ce88790a3547c6e75635711d8a1","observation_id":"7b72bc66-ff7d-4a96-9026-21567ceda278","resolution":{"observed_at":"2026-08-04T09:54:24.937137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04280","last_updated":"2025-05-06T09:56:18Z","snapshot_observed_at":"2026-08-06T16:38:02.520624Z","submitted_at":"2024-12-05T16:00:59Z","title":"HumanEdit: A High-Quality Human-Rewarded Dataset for Instruction-based Image Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04280","snapshot_observed_at":"2026-08-04T09:54:23.900864Z","title":"Humanedit: A high-quality human-rewarded dataset for instruction-based image editing.arXiv preprint arXiv:2412.04280,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:23.900864Z"},"links":{"cited_paper":"/paper/2412.04280","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:69fa3865e9e397f7239fb5b6e710c69bac8bfe03fe20c30f28cbdf3fbf382ccf","observation_id":"3c77074f-a62d-4241-ad3b-60d46aa71d6f","resolution":{"observed_at":"2026-08-04T09:54:23.900864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T09:54:23.983819Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:23.983819Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:1cb583323156babec7f70a0eeeade55cbdb49e238293c23d27c5163a60f83009","observation_id":"01701d6b-77cd-40d3-8742-3dc98c7057ec","resolution":{"observed_at":"2026-08-04T09:54:23.983819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-04T09:54:24.241226Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2306.13394,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:24.241226Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:20b40afbfab463247f5ba2cfdc111cd3ec4889da415f59eae454eeb6f3ac4fac","observation_id":"ad0c698d-34f5-4faf-b73b-d71726bf7048","resolution":{"observed_at":"2026-08-04T09:54:24.241226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 9 inbound Pith citation observations for arXiv:2510.12784."}