{"as_of":"2026-08-04T05:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4ba7c4a83dc7258702c2bdd39fe17a4fc6cd497b9875d278245b6b1dcd1a7425","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T18:15:05.561502Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:55.026823Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2501.05767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-07-04T15:09:55.026823Z","title":"Migician: Revealing the magic of free-form multi-image grounding in multimodal large language models","venue":null,"work_id":"6d070e82-e925-4587-aa4e-857a42c44453","year":2025},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":135,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:d05e0b8b8d51956f1fee617c3bcfd52640c8c4188a3f4f5516398596b89c0ba0","observation_id":"85eec8d3-62e5-4e27-9f0f-024909f90687","resolution":{"observed_at":"2026-05-15T17:18:53.209391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2501.05767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-07-04T15:09:55.026823Z","title":"Migician: Revealing the magic of free-form multi-image grounding in multimodal large language models","venue":null,"work_id":"6d070e82-e925-4587-aa4e-857a42c44453","year":2025},"citing_paper":{"arxiv_id":"2507.00748","last_updated":"2026-04-12T11:20:16Z","snapshot_observed_at":"2026-07-31T10:24:51.553367Z","submitted_at":"2025-07-01T13:48:57Z","title":"Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T06:50:02.607136Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2507.00748"},"observation_digest":"sha256:939c48c978580254169dd839075f1d2632ec5babe8144fcea195811419db362d","observation_id":"9940576a-4182-421d-b421-9bfacf7d6405","resolution":{"observed_at":"2026-05-19T06:52:08.087721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-08-03T18:15:05.561502Z","title":"Migician: Revealing the magic of free-form multi-image grounding in multimodal large language mod- els.arXiv preprint arXiv:2501.05767, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-03T20:21:51.373630Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.561502Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:229d7708950f5a3833af2a9e5180913778748aa8fdac7f080082a3d86639fc73","observation_id":"63fd2520-a011-4839-b7eb-25fdabc0b8cb","resolution":{"observed_at":"2026-08-03T18:15:05.561502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2501.05767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-07-04T15:09:55.026823Z","title":"Migician: Revealing the magic of free-form multi-image grounding in multimodal large language models","venue":null,"work_id":"6d070e82-e925-4587-aa4e-857a42c44453","year":2025},"citing_paper":{"arxiv_id":"2512.08980","last_updated":"2026-04-03T08:53:56Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-05T10:02:38Z","title":"Training Multi-Image Vision Agents via End2End Reinforcement Learning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T00:59:28.618477Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2512.08980"},"observation_digest":"sha256:e9caafe9d50178336efee47fe008f337c41b935d3e1081bfc7024e6d8876f85c","observation_id":"98d23dba-4d73-42f7-b1e8-54a3b0e3bf51","resolution":{"observed_at":"2026-05-17T01:01:24.328661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2501.05767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-07-04T15:09:55.026823Z","title":"Migician: Revealing the magic of free-form multi-image grounding in multimodal large language models","venue":null,"work_id":"6d070e82-e925-4587-aa4e-857a42c44453","year":2025},"citing_paper":{"arxiv_id":"2604.22498","last_updated":"2026-04-24T12:26:49Z","snapshot_observed_at":"2026-07-06T23:08:51.913995Z","submitted_at":"2026-04-24T12:26:49Z","title":"CGC: Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T12:26:01.568507Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2604.22498"},"observation_digest":"sha256:35895dc63cbe7ab6e7ed1d01b935f1322754204c2be52c684a7754b18c2ef465","observation_id":"a417a851-0566-48ec-9742-9f2b06906b2f","resolution":{"observed_at":"2026-05-11T19:16:08.325270Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2501.05767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-07-04T15:09:55.026823Z","title":"Migician: Revealing the magic of free-form multi-image grounding in multimodal large language models","venue":null,"work_id":"6d070e82-e925-4587-aa4e-857a42c44453","year":2025},"citing_paper":{"arxiv_id":"2605.25437","last_updated":"2026-05-25T05:29:07Z","snapshot_observed_at":"2026-07-06T23:35:21.734804Z","submitted_at":"2026-05-25T05:29:07Z","title":"Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T22:53:55.407461Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2605.25437"},"observation_digest":"sha256:47f6090ea58e4aec8bc07baa19066f40ff099de32855d660d4c82decdd37f936","observation_id":"2da49c6c-3e9a-4b2f-929b-abefa8092792","resolution":{"observed_at":"2026-06-29T22:54:00.616287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2501.05767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-07-04T15:09:55.026823Z","title":"Migician: Revealing the magic of free-form multi-image grounding in multimodal large language models","venue":null,"work_id":"6d070e82-e925-4587-aa4e-857a42c44453","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":159,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:b73c8604d5b5fe6b9d43b882ee0f776e6a528cb862e9deb8a432bd9e5ba5296d","observation_id":"ba7be77d-951f-473d-bd51-a39bc7e96394","resolution":{"observed_at":"2026-07-04T15:09:55.029033Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2501.05767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-07-04T15:09:55.026823Z","title":"Migician: Revealing the magic of free-form multi-image grounding in multimodal large language models","venue":null,"work_id":"6d070e82-e925-4587-aa4e-857a42c44453","year":2025},"citing_paper":{"arxiv_id":"2606.26602","last_updated":"2026-06-25T05:02:38Z","snapshot_observed_at":"2026-08-02T18:23:59.483337Z","submitted_at":"2026-06-25T05:02:38Z","title":"DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T05:18:01.931929Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2606.26602"},"observation_digest":"sha256:140c7eb907ef9d6c636552c7d4b9377a3a394a7862a1b00a810b31bdb6723f97","observation_id":"9aaaefa8-de82-4fd4-af0d-07d8ec5d2d9a","resolution":{"observed_at":"2026-07-04T13:19:50.963105Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.05767/citation-record","integrity":"/paper/2501.05767/integrity","json":"/paper/2501.05767/citation-record.json","paper":"/paper/2501.05767"},"outbound":[],"paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2501.05767."}