{"as_of":"2026-08-08T12:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:963d46867ce30c39064df6f20349d1d0fd33f3c121e87a8e92a83e1d04cd42a9","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:43:48.054205Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.07227/citation-record","integrity":"/paper/2506.07227/integrity","json":"/paper/2506.07227/citation-record.json","paper":"/paper/2506.07227"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:59.358080Z","title":"URL https://api.semanticscholar.org/CorpusID:276612236","venue":null,"work_id":"93cf52e7-0114-420f-9609-e2ecaadf40de","year":null},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:38.608937Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:7f353bfc69ccb3b2251f318e3000512d6f02570ea31543bf6d72226779af2ea6","observation_id":"2de8716a-b311-4ff6-96fe-0cdd660016d0","resolution":{"observed_at":"2026-08-07T05:43:59.507971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T05:43:38.711206Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:38.711206Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:f212987f5cad8f1a28fa800b9ca6212a4ce1f22d58cf790dab92efae9b79b67c","observation_id":"bca26de9-f16f-4a11-a98c-8a064ec72ebc","resolution":{"observed_at":"2026-08-07T05:43:38.711206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T05:43:38.884823Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:38.884823Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:e3515dcfdf19124b1f3fdfec985c625d923c5207dcf9008c5a91e0e3e92732a5","observation_id":"d6ad0563-42e0-4b3e-a964-2444405eca28","resolution":{"observed_at":"2026-08-07T05:43:38.884823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:59.004096Z","title":"Hallucination of multimodal large language models: A survey .CoRR, 2024","venue":null,"work_id":"9d345c2e-57d4-41fc-8086-c9f80159d486","year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.041996Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:03f93e78c679f7c5b06db4dfa46084700b4d2da4ec878cbde5aa2c90e835ce22","observation_id":"2a3bf250-33e3-4e51-84b1-e5994c2a80f7","resolution":{"observed_at":"2026-08-07T05:43:59.171317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:58.716277Z","title":"Flux.1 fill [dev]","venue":null,"work_id":"d490c962-8fdb-44ba-985d-3028f857ad0b","year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.254218Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:3e48f1f0e2eea923d20795b86681707ab095c5cc99ace58713fb0728d989ce9a","observation_id":"423e27ac-0282-4dda-9410-db59986b3274","resolution":{"observed_at":"2026-08-07T05:43:58.861034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:58.293960Z","title":"Ledits++: Limitless image editing using text-to-image models","venue":null,"work_id":"c6c703f9-35bd-4373-8e2e-88c0c20739d3","year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.375131Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:30ab69eb459690737ed8394ddfdd09f9ebf7e844151a3ca103c66203ecc19f1e","observation_id":"5ecf6e1c-d64d-4ff5-ad5e-c9aecd056bb3","resolution":{"observed_at":"2026-08-07T05:43:58.484131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:57.974056Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"98649492-979b-47d5-8210-ac649e8070df","year":2023},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.449044Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:65d60c634b66a62361426dc78c8a44a14554150bf96d858f5eef74484eec1f69","observation_id":"662d1733-67bc-49c9-991b-986ec3bad760","resolution":{"observed_at":"2026-08-07T05:43:58.126442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:39.543224Z","title":"The revolution of multimodal large language models: a survey .arXiv preprint arXiv:2402.12451, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.543224Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:893720ce6c0037cbacc8b734f8533ad588a2389acc4c052de7be54c920aef862","observation_id":"c0ed1ce1-9362-47b4-9348-0c32bc4c05d5","resolution":{"observed_at":"2026-08-07T05:43:39.543224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:57.622657Z","title":"Vlmimic: Vision language models are visual imitation learner for fine-grained actions.Advances in Neural Information Processing Systems, 37:77860–77887, 2024","venue":null,"work_id":"80ba22eb-c641-45a5-ab36-106b96ad90d4","year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.598014Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:f1cb482b2e897c5eb889b5dfea90d94816596ba55c866fec09fe72919b6cf610","observation_id":"06591c43-d4d1-42e2-bec5-d356c2e0dd67","resolution":{"observed_at":"2026-08-07T05:43:57.810907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T05:43:39.736678Z","title":"Are we on the right way for evaluating large vision-language models?arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.736678Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:6fa1feca0315d5a8c662024ecf6148266a361900407f77ebeca7f4ede00b10c0","observation_id":"e6a69b11-b329-4a2a-83ce-f3fd8ebd5ac0","resolution":{"observed_at":"2026-08-07T05:43:39.736678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:57.267597Z","title":"Anydoor: Zero-shot object-level image customization","venue":null,"work_id":"0435bee3-7308-42c1-9b43-e79cca3154e4","year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.854427Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:094cdfe926683092155f77b501aab1919d1ef9b62df989043f825c9af66ad555","observation_id":"c46b15e7-cf14-4543-9487-ea9126ad7257","resolution":{"observed_at":"2026-08-07T05:43:57.415831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07774","last_updated":"2024-12-11T22:51:08Z","snapshot_observed_at":"2026-08-08T03:21:39.147609Z","submitted_at":"2024-12-10T18:59:55Z","title":"UniReal: Universal Image Generation and Editing via Learning Real-world Dynamics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07774","snapshot_observed_at":"2026-08-07T05:43:40.028036Z","title":"Unireal: Universal image generation and editing via learning real-world dynamics.arXiv preprint arXiv:2412.07774, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:40.028036Z"},"links":{"cited_paper":"/paper/2412.07774","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:a79887815982e6eaa0fe862770fc377714355b1b094f3ca23598934e99b34e4c","observation_id":"30ddf113-d876-428b-b26e-898c2a7e035f","resolution":{"observed_at":"2026-08-07T05:43:40.028036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:40.204373Z","title":"Diffusion self-guidance for controllable image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:40.204373Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:1df942da46f114b870abddbcec603d495942f51de7c57ad3af7cbf3638bc5c24","observation_id":"9c6eee60-6280-4765-813f-2a5265c515b8","resolution":{"observed_at":"2026-08-07T05:43:40.204373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15296","last_updated":"2024-12-08T04:24:31Z","snapshot_observed_at":"2026-08-07T09:14:56.498818Z","submitted_at":"2024-11-22T18:59:54Z","title":"MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15296","snapshot_observed_at":"2026-08-07T05:43:40.351303Z","title":"Mme-survey: A comprehensive survey on evaluation of multimodal llms.arXiv preprint arXiv:2411.15296, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:40.351303Z"},"links":{"cited_paper":"/paper/2411.15296","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:66f37bd6c87677b3effd682940fa0b24168e370f2cd24494adcd98431d457502","observation_id":"ceaae5c7-6498-4941-8dce-05f664adf7a8","resolution":{"observed_at":"2026-08-07T05:43:40.351303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04734","last_updated":"2025-02-24T22:15:33Z","snapshot_observed_at":"2026-07-06T19:28:48.185066Z","submitted_at":"2024-10-07T04:00:22Z","title":"TLDR: Token-Level Detective Reward Model for Large Vision Language Models","version":2},"cited_work":{"arxiv_id":"2410.04734","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04734","snapshot_observed_at":"2026-08-07T05:43:48.470768Z","title":"TLDR: Token-Level Detective Reward Model for Large Vision Language Models","venue":"cs.LG","work_id":"da40bdf3-beec-4c26-bce7-7ed6eb1a5ce0","year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:40.500892Z"},"links":{"cited_paper":"/paper/2410.04734","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:89cc2a4f40c1d8408eb1bd1cb42bd3c30c3a3c353d92eee5e7173f7805db849f","observation_id":"2dd79992-184b-4994-89f0-007c48796424","resolution":{"observed_at":"2026-08-07T05:43:48.602722Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:56.874535Z","title":"Towards a benchmark of multimodal large language models for industrial engineering","venue":null,"work_id":"26866842-4320-4f7e-8ab1-839dc0bc2546","year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:40.648100Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:81ae87225c980f3df8fd3e4b8bfaf2db75524e4c89c6d7818b3ee9ed51b98c7a","observation_id":"76f01343-d522-4ef2-82d9-fee5a2b553c0","resolution":{"observed_at":"2026-08-07T05:43:57.107153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:56.564046Z","title":"Generative adversarial networks.Communications of the ACM, 63(11):139–144, 2020","venue":null,"work_id":"9066959c-3c87-462d-8e70-4a32d1fcc97a","year":2020},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:40.743202Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:defb850ee9ee72c9bb1a8fd46c0e353d1135532d7b6ee200098ebb89d05ba1f7","observation_id":"76a6500e-94ff-48d3-be82-8f5016ad95ea","resolution":{"observed_at":"2026-08-07T05:43:56.719981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:56.242880Z","title":"Gemini 2.5 flash","venue":null,"work_id":"45406a35-2bb8-4498-b5eb-f8e6a3559154","year":2025},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:40.943773Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:a945871fd742613df003a28e9fb07aa916d86cbafac69938846a65ebe00db561","observation_id":"a92043ad-40b2-42c7-8553-5c2f0f6a01c3","resolution":{"observed_at":"2026-08-07T05:43:56.397687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:55.849222Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"86342b0f-e618-4716-8699-894d523f1f51","year":2017},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:41.114382Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:8b47e55628c57c017566bb65fa2788abada08fefed1b188e9624a925c52213e5","observation_id":"dee98651-ea66-4bc2-986c-1b7b5327c82f","resolution":{"observed_at":"2026-08-07T05:43:56.065207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T05:43:41.230598Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:41.230598Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:e1b130d1699432da34c2b44f8aeab0c85be0f270ca3651e14f50f8a84b126ae6","observation_id":"e6543063-4d93-461e-a0b3-51ece3c23a4e","resolution":{"observed_at":"2026-08-07T05:43:41.230598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:55.415420Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":"67a03bd2-a086-4e4b-97f9-5187f9326e01","year":2020},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:41.386418Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:f0aadac222fd90267f2ae4947affb952d30fc25f5c637ad5adaa167c1f6c47eb","observation_id":"d1a55e4f-cf1d-44ad-b42f-285b3a768821","resolution":{"observed_at":"2026-08-07T05:43:55.619250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17525","last_updated":"2025-03-11T02:16:29Z","snapshot_observed_at":"2026-08-04T02:22:19.493780Z","submitted_at":"2024-02-27T14:07:09Z","title":"Diffusion Model-Based Image Editing: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17525","snapshot_observed_at":"2026-08-07T05:43:41.528747Z","title":"Diffusion model-based image editing: A survey .arXiv preprint arXiv:2402.17525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:41.528747Z"},"links":{"cited_paper":"/paper/2402.17525","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:277184a356deb6faac84684d4e7819ad8b104193a8575619fae6171e603079ee","observation_id":"6ac500f9-93a6-4298-a548-a3f564b985ed","resolution":{"observed_at":"2026-08-07T05:43:41.528747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:55.076005Z","title":"Smartedit: Exploring complex instruction-based image editing with multimodal large language models","venue":null,"work_id":"2736f636-07b1-451c-b2e1-a71c2ea9ec05","year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:41.681296Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:4a38069fdb4c15c5dceca80125d67336f4b1871d873e93713e9ab4a2018be25c","observation_id":"047225bb-e58e-49e4-ad4b-298873d44d7f","resolution":{"observed_at":"2026-08-07T05:43:55.263948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:54.769403Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"1db1d575-1daa-447f-bcb9-65a4ab2b97d4","year":2019},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:41.824325Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:b9631c8264ba64a47b3f47824fe224c54ac451346c30e8cd81ed085f02ce3198","observation_id":"d8922cbf-9b68-4df8-81f1-1ee09e87f00a","resolution":{"observed_at":"2026-08-07T05:43:54.928422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T05:43:42.006009Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:42.006009Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:d037434b6a129d72081ccc9b69ddab1e1cfb37250739cd3d6e39afeee94caf9d","observation_id":"5b9c44cb-39a4-488a-9d8b-3b679c278984","resolution":{"observed_at":"2026-08-07T05:43:42.006009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:54.357314Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":"5b7f89ef-34fa-4b58-98b1-9d13daf0d7d5","year":2019},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:42.126473Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:16a76678cc5cb29e7cce10e1afa7b87ad39c46e9a9892ccf968db696b4fc063b","observation_id":"d0a575a1-2eee-43b7-9f09-029c7d9a1366","resolution":{"observed_at":"2026-08-07T05:43:54.551988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:42.310898Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:42.310898Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:d311161e9c3bab6f4c34d94879850e0f7d282ca9dbb8c8c48d05009ef6fa8859","observation_id":"555ec626-1b0d-4dc4-915a-bc6c28fc7849","resolution":{"observed_at":"2026-08-07T05:43:42.310898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:54.008482Z","title":"Evaluating and improving compositional text-to-visual generation","venue":null,"work_id":"b83888a8-8fdf-4cbf-a9b3-42eccfb7debe","year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:42.448452Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:23f446019ab9b1bca768292a1b18dc1830d7806b28803d534dda88d8e7c62ab8","observation_id":"2e22816e-3bbe-49f3-a114-f95cd95da233","resolution":{"observed_at":"2026-08-07T05:43:54.203404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T05:43:42.594952Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:42.594952Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:337871f0b22d04d806d36ef140d83b15b1f3d624f8598d264b081f5337dfd75d","observation_id":"d0a127ad-0c9a-430a-b980-f740fee99f64","resolution":{"observed_at":"2026-08-07T05:43:42.594952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:53.673097Z","title":"Evaluating text-to-visual generation with image-to-text generation","venue":null,"work_id":"4be1c0dd-0c74-45bc-a38a-cb87416b03b0","year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:42.736228Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:7a91d4f6bff1686d17df5e86e820bb81edbb67e338b93351361c5d56def21ea3","observation_id":"e5c16a2e-1828-48e6-a089-e465466d583e","resolution":{"observed_at":"2026-08-07T05:43:53.827596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T05:43:42.883509Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:42.883509Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:f26ddf27950bda44512ec745f9471267b9fe32160404aad6227cef311dd4c2f5","observation_id":"01af5ce7-54ed-4e9c-807b-54fd8acf05e5","resolution":{"observed_at":"2026-08-07T05:43:42.883509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:43.066529Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:43.066529Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:3db8baa64d1d1b2f8bfb06a1338c633da61fbc3f34add2a5a146c66c1c4d7249","observation_id":"27be5de5-b3ff-4872-a905-992872b5b4d5","resolution":{"observed_at":"2026-08-07T05:43:43.066529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-08-07T05:43:43.205553Z","title":"Step1x-edit: A practical framework for general image editing.arXiv preprint arXiv:2504.17761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:43.205553Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:fd0e3a319485047fd9ad63801e4f22f80690ea348d67edea748b294af2c64dff","observation_id":"848a6b9b-f94d-49a4-889d-173ff694dbe8","resolution":{"observed_at":"2026-08-07T05:43:43.205553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-07T05:43:43.306278Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:43.306278Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:2d547f1f56401a9782993b5988f015336df43c88e17e84ff9f0d935b192571ef","observation_id":"af6e4322-9d20-45ca-b28b-218f0f494c27","resolution":{"observed_at":"2026-08-07T05:43:43.306278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:53.297223Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pp","venue":null,"work_id":"17fb0570-e176-4b6a-ac1b-d775a72e6bc6","year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:43.488660Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:4cafb148750771d1cc4227ad9e6344d98672b88e6be4d13c8b257a2a5cb63cf8","observation_id":"fefda47f-026b-4584-8273-f95ab4f3f7a0","resolution":{"observed_at":"2026-08-07T05:43:53.466271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:52.952676Z","title":"Customizable image synthesis with multiple subjects.Advances in neural information processing systems, 36:57500–57519, 2023","venue":null,"work_id":"d401aab3-18e7-41cd-b40d-acc61aa7df5c","year":2023},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:43.656077Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:43e15eabaa97288019afba60d16f304c4db58335e85a3bc0ff486b55ea1b78bc","observation_id":"cd9cbec6-efba-4ef9-8ee6-195b3fe737c3","resolution":{"observed_at":"2026-08-07T05:43:53.106964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09703","last_updated":"2025-03-22T10:03:38Z","snapshot_observed_at":"2026-07-06T19:50:33.453131Z","submitted_at":"2024-11-14T18:59:57Z","title":"MagicQuill: An Intelligent Interactive Image Editing System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09703","snapshot_observed_at":"2026-08-07T05:43:43.759971Z","title":"Magicquill: An intelligent interactive image editing system.arXiv preprint arXiv:2411.09703, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:43.759971Z"},"links":{"cited_paper":"/paper/2411.09703","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:1ca8beb602d249a1c15a5de75415a69ba0844ddfb8b5709a216c6af9578c5962","observation_id":"ad8ec765-f698-4aa8-8ebc-9c83b96732ad","resolution":{"observed_at":"2026-08-07T05:43:43.759971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.02024","last_updated":"2023-05-31T06:34:32Z","snapshot_observed_at":"2026-08-03T17:23:55.065560Z","submitted_at":"2022-12-05T04:39:08Z","title":"Fine-grained Image Editing by Pixel-wise Guidance Using Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.02024","snapshot_observed_at":"2026-08-07T05:43:43.858271Z","title":"Fine-grained image editing by pixel-wise guidance using diffusion models.arXiv preprint arXiv:2212.02024, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:43.858271Z"},"links":{"cited_paper":"/paper/2212.02024","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:dc15e87cc1c5edeafaa436d096f89d0b24858fc2b6dd65d955bf7ecfc98deba8","observation_id":"d76e4595-fe58-4982-b974-0dcafeb317c7","resolution":{"observed_at":"2026-08-07T05:43:43.858271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:52.599595Z","title":"Mm1: methods, analysis and insights from multimodal llm pre-training","venue":null,"work_id":"daec624f-67a3-4596-9203-82de4cfdb219","year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:44.006676Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:a9bd80aa1267e1e0c9f438bf4a28e50d47039ba17ac5ab46a117bfac50bbb9bc","observation_id":"a609cc02-e81c-44b7-99a2-3fd8f5996f94","resolution":{"observed_at":"2026-08-07T05:43:52.759445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01073","last_updated":"2022-01-05T00:07:35Z","snapshot_observed_at":"2026-08-08T06:35:17.078531Z","submitted_at":"2021-08-02T17:59:47Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01073","snapshot_observed_at":"2026-08-07T05:43:44.132494Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equations.arXiv preprint arXiv:2108.01073, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:44.132494Z"},"links":{"cited_paper":"/paper/2108.01073","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:69396782c262dcf55dfd1f8a52bc68ddcd33fd51e115105c0d4a105294e03695","observation_id":"4d5993ce-9291-4d6a-abb7-e2b9c4a38b10","resolution":{"observed_at":"2026-08-07T05:43:44.132494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02421","last_updated":"2023-11-20T09:08:42Z","snapshot_observed_at":"2026-07-06T15:50:41.385379Z","submitted_at":"2023-07-05T16:43:56Z","title":"DragonDiffusion: Enabling Drag-style Manipulation on Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02421","snapshot_observed_at":"2026-08-07T05:43:44.281953Z","title":"Dragondiffusion: Enabling drag-style manipulation on diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:44.281953Z"},"links":{"cited_paper":"/paper/2307.02421","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:7228293b06d1a6c47a13460f7ac7c8fd584405b2dcbde8e742cdc31c440a6614","observation_id":"568f2b0c-7928-450d-8e16-dcbddcbffc46","resolution":{"observed_at":"2026-08-07T05:43:44.281953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:52.272019Z","title":"Docci: Descriptions of connected and contrasting images","venue":null,"work_id":"228819e0-c4f2-42c3-a577-aa116a872f0e","year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:44.426315Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:de104baa8993134fab405ef1a00bbd9b3f1a393899945d4ef048988c8ba5a356","observation_id":"2fc74a18-437b-4103-9df5-adaac60d1a1c","resolution":{"observed_at":"2026-08-07T05:43:52.419574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:52.008596Z","title":"Drag your gan: Interactive point-based manipulation on the generative image manifold","venue":null,"work_id":"e89e74bc-2b53-47b1-92f5-b288506afefc","year":2023},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:44.593681Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:bf609725deac31f4d15b50a7e589a2b52f15438b39e8ebc5862f194743a9bb87","observation_id":"01206368-d747-4e59-9a64-aa0084941692","resolution":{"observed_at":"2026-08-07T05:43:52.139918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01730","last_updated":"2024-01-28T09:25:12Z","snapshot_observed_at":"2026-07-06T17:24:33.169277Z","submitted_at":"2024-01-28T09:25:12Z","title":"Evaluating LLM -- Generated Multimodal Diagnosis from Medical Images and Symptom Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01730","snapshot_observed_at":"2026-08-07T05:43:44.803144Z","title":"Evaluating llm–generated multimodal diagnosis from medical images and symptom analysis.arXiv preprint arXiv:2402.01730, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:44.803144Z"},"links":{"cited_paper":"/paper/2402.01730","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:843f0e8b5f055951b2248c95952e3d6e460d73af649f06d52faecc7659196d26","observation_id":"7d1111be-3583-4d87-91b0-2f76161e47d2","resolution":{"observed_at":"2026-08-07T05:43:44.803144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:51.711555Z","title":"Synthesize diagnose and optimize: Towards fine-grained vision-language understanding","venue":null,"work_id":"854562f2-5dd2-454b-825e-68ea13c37522","year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:44.947642Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:95c3dd0125388bd9eb5d47ff2334600566768cf3a42a1618640c6a1620a64c64","observation_id":"adc2cbee-e611-4ec5-87e2-4bb6e832c22b","resolution":{"observed_at":"2026-08-07T05:43:51.859033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:51.379922Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"202dd630-1194-43fa-b8d4-3d7dbede807f","year":2021},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:45.089647Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:93e4ad7762abca5cd518e45b356d1bc6de9537c9091896a78430b9064a07d676","observation_id":"8550cc06-d2f2-421a-b074-ece6b8b6db09","resolution":{"observed_at":"2026-08-07T05:43:51.523948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:51.034401Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"168c9081-b88c-4d10-8192-b25597ecde47","year":2022},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:45.285969Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:80aa38f62227c8dde643462d730792af720b6d883c2a6b3e0d103b607786c66d","observation_id":"2d389b6c-0f67-4f42-af7d-3ab502b2dc24","resolution":{"observed_at":"2026-08-07T05:43:51.197125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:50.727640Z","title":"Towards vqa models that can read","venue":null,"work_id":"12147a0f-3ac5-47ea-8031-167187703312","year":2019},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:45.403062Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:6df0f266537529eaba47207d3dcd9cc33b9560ad3f3be8e31ad8b7767ead817c","observation_id":"d7148344-4a87-4cec-9daa-1b2ce1559118","resolution":{"observed_at":"2026-08-07T05:43:50.871131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T05:43:45.549277Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:45.549277Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:394dabccb18eb9b68d3b29f60ed72da1b04472de11c8d05c009361fcae4954e7","observation_id":"96e3fc7b-ebf8-4fd2-b77a-5842f29604d0","resolution":{"observed_at":"2026-08-07T05:43:45.549277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-07T05:43:45.643297Z","title":"Emu: Generative pretraining in multimodality .arXiv preprint arXiv:2307.05222, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:45.643297Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:5d27c90a6d93c46e19ab5a3adb58d9cbfc180b7dcb83e04180264c5dae770f8a","observation_id":"044c6697-aa23-4e2f-943f-064832cfdae0","resolution":{"observed_at":"2026-08-07T05:43:45.643297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:50.493818Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":"f9004815-c9cf-4d04-adec-a5fc01ec8dd3","year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:45.803662Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:101da1e704e3fe019b99cc0e2298d46816697c8be5acda175f0f9fc0f866f91f","observation_id":"af8ef4b5-8b9f-4203-bcd4-7f186fdc9c5e","resolution":{"observed_at":"2026-08-07T05:43:50.613669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T05:43:45.997544Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:45.997544Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:6a5b99fe17663aa71410ea5729a5ea2094c7b64e5ac0309dfdb0fa0bd80c0678","observation_id":"c5c494f0-50f1-4823-b2b6-bad93ebce212","resolution":{"observed_at":"2026-08-07T05:43:45.997544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:50.099035Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"60080386-edc9-441f-83f0-3068095136cc","year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:46.166326Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:cd33c43684a3744f3d0b29aec881a236a856044e0873d857cc52089f2df526f1","observation_id":"a0777960-5a47-4dc7-89ae-a04082045c34","resolution":{"observed_at":"2026-08-07T05:43:50.258784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T05:43:46.340293Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:46.340293Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:8aadda537d71daaf94a41c2d5c315bc5c5293908df83a28f6c23e3376da375d4","observation_id":"00dbf96f-a28d-4884-b1fd-07ac49ee689a","resolution":{"observed_at":"2026-08-07T05:43:46.340293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:49.798762Z","title":"Image inpainting with external-internal learning and monochromic bottleneck","venue":null,"work_id":"7471842b-d4d0-4ec3-af8c-41b6fc725274","year":2021},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:46.490587Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:c539a118f38d3116b0e2756960966299ef405e52f9f03a079411859d1d626d3c","observation_id":"70ba53b7-68aa-4836-99a8-2ce4865f6875","resolution":{"observed_at":"2026-08-07T05:43:49.954470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T05:43:46.605395Z","title":"Emu3: Next-token prediction is all you need.arXiv preprint arXiv:2409.18869, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:46.605395Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:85a8f1edd264ac976964d86ab885c14f63d3c591b36b37b85444d2284018e66b","observation_id":"6e62a470-9110-4471-9613-977118ae06a6","resolution":{"observed_at":"2026-08-07T05:43:46.605395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:49.448408Z","title":"Uni-paint: A unified framework for multimodal image inpainting with pre- trained diffusion model","venue":null,"work_id":"8e2cb1a4-6885-4eaf-bef7-3b9f0c017923","year":2023},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:46.748089Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:77e1d8208a04c365d7e05a1e2519f31f7f8f95474ba83bdd3b4cd421138f45c4","observation_id":"8655a29c-b26d-4aa5-8575-aa726a637913","resolution":{"observed_at":"2026-08-07T05:43:49.620544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:49.157454Z","title":"Imagebrush: Learning visual in-context instructions for exemplar-based image manipulation","venue":null,"work_id":"836175ed-fe29-41dc-9fee-68a4fd358ccd","year":2023},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:46.871389Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:45dd31deec50885de5c797658b581f952eefed6209bcdd44c8ed67eb6a7534a2","observation_id":"0faa7296-ebbd-4f28-8003-dc62ddc19aa5","resolution":{"observed_at":"2026-08-07T05:43:49.316942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-07T05:43:47.046094Z","title":"Coca: Contrastive captioners are image-text foundation models.arXiv preprint arXiv:2205.01917, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:47.046094Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:f6c18f292fd742eb37a0adfe0f6efa5269d9200e5df119c35a325750b070cbc7","observation_id":"89789c16-fd0a-4782-a737-d1b9b93d86ca","resolution":{"observed_at":"2026-08-07T05:43:47.046094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T05:43:47.201274Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities.arXiv preprint arXiv:2308.02490, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:47.201274Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:27f4005bfa324f69f49f1404f2070b820035ac875cb43dcec4e0babf070de5ba","observation_id":"f38df3e5-9889-4c8b-a62a-44c5a6f99045","resolution":{"observed_at":"2026-08-07T05:43:47.201274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00765","last_updated":"2024-12-01T06:08:00Z","snapshot_observed_at":"2026-08-06T07:47:35.642444Z","submitted_at":"2024-08-01T17:59:54Z","title":"MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00765","snapshot_observed_at":"2026-08-07T05:43:47.364932Z","title":"Mm-vet v2: A challenging benchmark to evaluate large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:47.364932Z"},"links":{"cited_paper":"/paper/2408.00765","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:efa851e9a696f254acd0305e2eb8978202e7098df11c8bcfb46b75b8b2d7d9a0","observation_id":"bcbbe6df-eef7-4337-be5b-744b37dbf1b9","resolution":{"observed_at":"2026-08-07T05:43:47.364932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-04T03:15:18.360813Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20903","snapshot_observed_at":"2026-08-07T05:43:47.468600Z","title":"Walkvlm: Aid visually impaired people walking by vision language model.arXiv preprint arXiv:2412.20903, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:47.468600Z"},"links":{"cited_paper":"/paper/2412.20903","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:6043919e8f822307798b8dd44fd0ff0087f9baa87b3c5df742c52d991171c0ad","observation_id":"1b62c9c2-7faa-47de-b423-b5ce211a1ec8","resolution":{"observed_at":"2026-08-07T05:43:47.468600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:48.882154Z","title":"Mmvp: A multimodal mocap dataset with vision and pressure sensors","venue":null,"work_id":"6c1f0046-fabb-4d57-98e5-43bcf6224794","year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:47.607411Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:28ce474d4266779d2a0ccb5a929d3f312c44a41181974664de3c361c4aa03f71","observation_id":"71db210a-92bf-4f4d-8565-0b4df8778aea","resolution":{"observed_at":"2026-08-07T05:43:48.999053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17422","last_updated":"2025-02-24T18:54:40Z","snapshot_observed_at":"2026-08-07T17:52:20.236795Z","submitted_at":"2025-02-24T18:54:40Z","title":"MLLMs Know Where to Look: Training-free Perception of Small Visual Details with Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17422","snapshot_observed_at":"2026-08-07T05:43:47.780118Z","title":"Mllms know where to look: Training-free perception of small visual details with multimodal llms.arXiv preprint arXiv:2502.17422, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:47.780118Z"},"links":{"cited_paper":"/paper/2502.17422","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:62f6be3b2bb0421977bd2e0fe06242b852bafb38ec42fd69152832eb7699056c","observation_id":"91ac0d10-9a62-47b6-8b17-530ea3d2b2dc","resolution":{"observed_at":"2026-08-07T05:43:47.780118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:47.935836Z","title":"Magicbrush: A manually annotated dataset for instruction-guided image editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:47.935836Z"},"links":{"citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:2e134cfcdc5f1e85e73c9282e205a3ad4b3984b23a27ad9ff13f263ca099332b","observation_id":"c9513c2c-afe2-4653-ae9d-c04995f7b64d","resolution":{"observed_at":"2026-08-07T05:43:47.935836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-07T05:43:48.054205Z","title":"123- ABCD,\\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:48.054205Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:8b5dbe16946265e82fe16e21b62ddb52233a12e67105a08b37d8c568f3b6ce86","observation_id":"47a0b8e6-6264-4127-9748-95e7cd8a76be","resolution":{"observed_at":"2026-08-07T05:43:48.054205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T06:06:25.367121Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":1,"verified_fuzzy":32},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2506.07227."}