{"as_of":"2026-08-07T21:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c39ea492426e797a1c266d0d6f0a320d932aa6ed0039fc061ea8f3cb65df5219","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T18:15:09.777799Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2512.06276/citation-record","integrity":"/paper/2512.06276/integrity","json":"/paper/2512.06276/citation-record.json","paper":"/paper/2512.06276"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:04.539569Z","title":"Flamingo: a visual language model for few-shot learning.NeurIPS, 35: 23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:04.539569Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:2423ffe51595530ed41defbcde303b596f61be42ccc67a40bb5c51e0a654fc8a","observation_id":"da3a10ce-0c00-41d9-9d98-3bd16ecac0bc","resolution":{"observed_at":"2026-08-03T18:15:04.539569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-03T18:15:04.579056Z","title":"Llava-onevision-1.5: Fully open framework for democratized multimodal training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:04.579056Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:7e60cf29536b8f9ca8ec420da64091edc9c688c744a222fa0fe605c44f6c64d2","observation_id":"1ac081a8-7e28-4f8c-bf34-9c7875622ae9","resolution":{"observed_at":"2026-08-03T18:15:04.579056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T18:15:04.635320Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:04.635320Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:5d17ce77f27d5bfcb14a53c6989d2521450c498f1e38958f2030081b4821af5d","observation_id":"967822dd-61a2-4198-9923-dc5f5a705185","resolution":{"observed_at":"2026-08-03T18:15:04.635320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T18:15:04.693023Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:04.693023Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:5c1674b3a16fd7c5e3a48cb395eb04272571bfaba15e3827dc1a75eb5af063a2","observation_id":"bf67dab3-b5cb-428a-89e3-45a7a8e5868f","resolution":{"observed_at":"2026-08-03T18:15:04.693023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14231","last_updated":"2025-05-20T11:40:43Z","snapshot_observed_at":"2026-08-07T15:35:48.142895Z","submitted_at":"2025-05-20T11:40:43Z","title":"UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14231","snapshot_observed_at":"2026-08-03T18:15:04.760809Z","title":"Univg-r1: Reasoning guided universal visual grounding with reinforce- ment learning.arXiv preprint arXiv:2505.14231, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:04.760809Z"},"links":{"cited_paper":"/paper/2505.14231","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:fd952e8e01f9250351adbaa431222110b5cf89060bb041a6a25c3ab70496d543","observation_id":"f24a486f-9919-4c6f-9c83-b659c5184936","resolution":{"observed_at":"2026-08-03T18:15:04.760809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:04.818019Z","title":"Revisiting referring expression comprehension eval- uation in the era of large multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:04.818019Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:9227caa6ddc34cf8e6f8e319a693c1e020699e5bf9dd79cf6cad7a8d4c15277b","observation_id":"4432b674-c5e6-4f3b-8cd3-af77f1dad750","resolution":{"observed_at":"2026-08-03T18:15:04.818019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-03T18:15:04.895286Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:04.895286Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:4b6ff1fb8293a2ca2a20893e5bea0ab897be964558db1ffdb09aaded9f95a465","observation_id":"8d9db02b-185a-4933-8366-79daa45afdce","resolution":{"observed_at":"2026-08-03T18:15:04.895286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-03T18:15:04.999810Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:04.999810Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:92f55a1ff16fada64271e8f643c92f3051b686ee4a4c18d5c654592537786dd7","observation_id":"5b8fed1a-db9e-4431-99f9-2085bc73bb16","resolution":{"observed_at":"2026-08-03T18:15:04.999810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:05.037620Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models.arXiv e-prints, pages arXiv–2409, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.037620Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:85843d838f96a56a79a35cf8d48b95beaefe46ccd8f43ecf58a5806040e5208b","observation_id":"78ef50aa-7bb2-4199-bf2e-a4359ee1dfa4","resolution":{"observed_at":"2026-08-03T18:15:05.037620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16182","last_updated":"2023-12-24T15:13:10Z","snapshot_observed_at":"2026-07-06T16:12:22.303188Z","submitted_at":"2023-08-30T17:58:50Z","title":"GREC: Generalized Referring Expression Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16182","snapshot_observed_at":"2026-08-03T18:15:05.093422Z","title":"Grec: Generalized referring expression comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.093422Z"},"links":{"cited_paper":"/paper/2308.16182","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:18e64c702afb63270f5a9afe55f4cf63af5d1414cae67644473d08d941891855","observation_id":"3945e791-9831-4f40-aeb9-39e4a7ffbf6a","resolution":{"observed_at":"2026-08-03T18:15:05.093422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-03T18:15:05.144797Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.144797Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:aca3eeadaa53f07ff306882a4e64a090a846650113f67ca3f202cb58b28aa3e9","observation_id":"1c0a1b47-97c7-49b6-aa46-3b38fbb24aeb","resolution":{"observed_at":"2026-08-03T18:15:05.144797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-02T05:48:34.429861Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18363","snapshot_observed_at":"2026-08-03T18:15:05.207146Z","title":"Chatrex: Tam- ing multimodal llm for joint perception and understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.207146Z"},"links":{"cited_paper":"/paper/2411.18363","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:7bc605cf03ac411b0dee2d2746354a46b64686b4681c1e3bad072e3e2ba9c098","observation_id":"21bcd62c-d96f-4fc7-a957-29b10de5adb9","resolution":{"observed_at":"2026-08-03T18:15:05.207146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04034","last_updated":"2025-06-04T14:56:57Z","snapshot_observed_at":"2026-08-07T10:46:30.489099Z","submitted_at":"2025-06-04T14:56:57Z","title":"Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04034","snapshot_observed_at":"2026-08-03T18:15:05.261966Z","title":"Rex-thinker: Grounded object re- ferring via chain-of-thought reasoning.arXiv preprint arXiv:2506.04034, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.261966Z"},"links":{"cited_paper":"/paper/2506.04034","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:ad282451a01fa0c9f4172fe727c4c6bbc6de383697a904bda9f02eea67f53138","observation_id":"681d3c20-3ae6-471f-993a-9a2a81638482","resolution":{"observed_at":"2026-08-03T18:15:05.261966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08507","last_updated":"2025-05-12T02:14:50Z","snapshot_observed_at":"2026-08-07T17:12:44.716807Z","submitted_at":"2025-03-11T14:57:14Z","title":"Referring to Any Person","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08507","snapshot_observed_at":"2026-08-03T18:15:05.304394Z","title":"Referring to any person.arXiv preprint arXiv:2503.08507, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.304394Z"},"links":{"cited_paper":"/paper/2503.08507","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:3dcda7794022d031fd8b9b762ec64e7a1c413fab402867cb1f191f319880d476","observation_id":"731f7b62-d644-49a6-9fc5-c6e0bae9b1d1","resolution":{"observed_at":"2026-08-03T18:15:05.304394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:05.368756Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.368756Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:78a280ecffc96814c25482cad39da5106c3d4f895eaadcdcfb7b1d4f2f9ecc99","observation_id":"db7e48df-b46e-4f64-bfdf-b05045bf3f46","resolution":{"observed_at":"2026-08-03T18:15:05.368756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-03T18:15:05.459491Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models.arXiv preprint arXiv:2407.07895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.459491Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:beb6908d2e5008e37b37213e469ed63727e8fb0e234b99e4103d895331803db8","observation_id":"b3603a2e-65cf-45c4-8f50-e6e53fa82e62","resolution":{"observed_at":"2026-08-03T18:15:05.459491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-08-03T18:15:05.561502Z","title":"Migician: Revealing the magic of free-form multi-image grounding in multimodal large language mod- els.arXiv preprint arXiv:2501.05767, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.561502Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:a9a0964108331ba4b298be2f59e3614e761794855fc14eab41249c271521a928","observation_id":"63fd2520-a011-4839-b7eb-25fdabc0b8cb","resolution":{"observed_at":"2026-08-03T18:15:05.561502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-08-06T02:17:30.272046Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14818","snapshot_observed_at":"2026-08-03T18:15:05.687979Z","title":"Eagle 2: Building post- training data strategies from scratch for frontier vision- language models.arXiv preprint arXiv:2501.14818, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.687979Z"},"links":{"cited_paper":"/paper/2501.14818","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:e13f3cf92c2a0cd34948648b8af86d17d8572e2776c9b5f299c677c8a70a7a43","observation_id":"9838a444-74c6-4038-9c95-699c7b9eb291","resolution":{"observed_at":"2026-08-03T18:15:05.687979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:05.753276Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.753276Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:eadf45ddb85a88626880dbec04639ec4d95ac105fcb12cc08a73d0ad0440d2b6","observation_id":"10e38b7f-9bbb-4f7b-8d35-e8a5196e304c","resolution":{"observed_at":"2026-08-03T18:15:05.753276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05302","last_updated":"2025-06-05T17:51:39Z","snapshot_observed_at":"2026-08-07T10:19:12.341695Z","submitted_at":"2025-06-05T17:51:39Z","title":"Perceive Anything: Recognize, Explain, Caption, and Segment Anything in Images and Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05302","snapshot_observed_at":"2026-08-03T18:15:05.829843Z","title":"Perceive anything: Recognize, explain, caption, and segment anything in images and videos.arXiv preprint arXiv:2506.05302, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.829843Z"},"links":{"cited_paper":"/paper/2506.05302","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:a3e67ffb5290b8fe5ef36155e9a43c3d85edebee3d63c63b1b0a344ea182a6c6","observation_id":"5bdff3cf-8f46-4932-b4a7-efc5fd55bbdc","resolution":{"observed_at":"2026-08-03T18:15:05.829843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14750","last_updated":"2025-01-11T15:12:37Z","snapshot_observed_at":"2026-07-06T19:20:14.980387Z","submitted_at":"2024-09-23T06:56:51Z","title":"FineCops-Ref: A new Dataset and Task for Fine-Grained Compositional Referring Expression Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14750","snapshot_observed_at":"2026-08-03T18:15:05.876710Z","title":"Finecops-ref: A new dataset and task for fine-grained compositional referring expression comprehension.arXiv preprint arXiv:2409.14750, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.876710Z"},"links":{"cited_paper":"/paper/2409.14750","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:3f344ab397ac4e75efa4fdda0ff0869f6aa9c112626b37de5a448559477d9640","observation_id":"ecb8f732-52e8-46c7-aa42-0f369074d339","resolution":{"observed_at":"2026-08-03T18:15:05.876710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:05.928558Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.928558Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:fed4bbf3b90f00833deb61e266e6acb1b8ad99a217c6fe1bb41d57bde1d39dd7","observation_id":"d3744472-e751-4988-81d6-484f0af9c3e6","resolution":{"observed_at":"2026-08-03T18:15:05.928558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-03T18:15:06.001283Z","title":"Visual- rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.001283Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:0dcc2324bc56cb31db90b6f6d0692820716fd5027497159f196fa9c5248a8a89","observation_id":"61ee1c29-9b90-442f-8d90-54e4bd3ce969","resolution":{"observed_at":"2026-08-03T18:15:06.001283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-06T10:47:13.078840Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-03T18:15:06.083870Z","title":"Ovis: Structural embed- ding alignment for multimodal large language model.arXiv preprint arXiv:2405.20797, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.083870Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:32031fd8480dea2ca219c85d1d7aa55db0c9516744c32c7c6f434eefbebf045d","observation_id":"d081467a-fba5-47ed-8fed-6128430195bb","resolution":{"observed_at":"2026-08-03T18:15:06.083870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11737","last_updated":"2025-08-15T17:01:08Z","snapshot_observed_at":"2026-07-06T22:13:37.150049Z","submitted_at":"2025-08-15T17:01:08Z","title":"Ovis2.5 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11737","snapshot_observed_at":"2026-08-03T18:15:06.151054Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.151054Z"},"links":{"cited_paper":"/paper/2508.11737","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:b75a9e86770dc5becf3b96f8cd3669249114d1e7330ff4687b0effd05b75362b","observation_id":"f99a459e-4aaf-4b83-95b3-b768bf4252aa","resolution":{"observed_at":"2026-08-03T18:15:06.151054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:06.211228Z","title":"Multi-task collabora- tive network for joint referring expression comprehension and segmentation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.211228Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:4d589caf689f6efd8967a7342e3b93a6528867aac340f187f590c98729e108d7","observation_id":"402deff4-801e-4ee6-91ed-d8bc3fdcabcc","resolution":{"observed_at":"2026-08-03T18:15:06.211228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:06.257337Z","title":"Groma: Localized visual tokenization for grounding multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.257337Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:085f53937c37512a84996faa7dade687473e977498ebd882650137cb2edfaff4","observation_id":"5a3c09eb-8af5-4315-b4ac-7e70bc71651c","resolution":{"observed_at":"2026-08-03T18:15:06.257337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:06.316009Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.316009Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:d9b50d310dc5d39affebeff96b8e022c0fc528cf5613424b7d2188afe5f373a2","observation_id":"70e0be89-3c71-40ce-ada3-b967ab81f5c2","resolution":{"observed_at":"2026-08-03T18:15:06.316009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:06.430995Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.430995Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:662613ffa9af68908197b7b64b5e2aa7db56a78f78b29bc8d673abbc49012cf0","observation_id":"e0f64d39-28e0-4eb7-bc2c-991d0754030b","resolution":{"observed_at":"2026-08-03T18:15:06.430995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:06.490275Z","title":"Gpt-4v(ision) system card.https://cdn","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.490275Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:49138ea395928884e4ac2173a80139683fbdd5c4c972df95f7a4a304ead5e186","observation_id":"0f3d6205-ec34-4f98-bc2e-16293ae0aac1","resolution":{"observed_at":"2026-08-03T18:15:06.490275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:06.546252Z","title":"Gpt-5 system card.https://cdn.openai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.546252Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:6ea28a010addf92cfbb15ed561994ee6cd195e0e4c466649401376b69e5ad9b9","observation_id":"a8f49206-0282-4865-84ca-bbbb87e053f2","resolution":{"observed_at":"2026-08-03T18:15:06.546252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:06.662874Z","title":"Referring ex- pression comprehension: A survey of methods and datasets","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.662874Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:b0e9a69839b388bf3680a3c2cfb58676c989808b330953ce118b4fad84c90421","observation_id":"65a78f74-539f-4987-9c7f-731bc1de8bd8","resolution":{"observed_at":"2026-08-03T18:15:06.662874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:06.774752Z","title":"Visual cot: Unleashing chain-of-thought reasoning in multi-modal language models.CoRR, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.774752Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:e1f250db331ddedee3065980fa357a3d50e63bd304e1faa2e86c1b3f041b21de","observation_id":"9dfdd7a3-e0de-4829-8d46-949032369237","resolution":{"observed_at":"2026-08-03T18:15:06.774752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T18:15:06.876514Z","title":"Deepseekmath: Pushing the limits of math- ematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.876514Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:e0d865c539e75d47428c19ff4b4954feaf7662d3e295cbf7aa0ae6468059c123","observation_id":"576bdeb4-f9b7-4bf8-b7f6-5f07d1c93721","resolution":{"observed_at":"2026-08-03T18:15:06.876514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-03T18:15:06.983726Z","title":"Vlm-r1: A stable and generaliz- able r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.983726Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:3233800164ddbbebd789b90aaa72dd52aa21102efefc68f2f80f6e50738697f5","observation_id":"e1296e17-1939-44a6-8446-7d675f11bdad","resolution":{"observed_at":"2026-08-03T18:15:06.983726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:07.060034Z","title":"Patch-as-decodable-token: Towards uni- fied multi-modal vision tasks in mllms.arXiv preprint arXiv:2510.01954, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:07.060034Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:9da9836b6c95989335e7742d2499939823655d64ac2419c5f946a57a01b6cd7e","observation_id":"e6a80eed-482d-4ae2-84cc-0d40b7fb4b12","resolution":{"observed_at":"2026-08-03T18:15:07.060034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:07.259707Z","title":"Glm-4.5v and glm-4.1v-thinking: Towards versatile multi- modal reasoning with scalable reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:07.259707Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:835a4d8b887bb235f25e03278734a7922c92800ab3de33a8fa4ab97ef71db3ed","observation_id":"9b4a338a-fb29-4a97-9e22-fac40314b0b3","resolution":{"observed_at":"2026-08-03T18:15:07.259707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-03T18:15:07.458967Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:07.458967Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:2cf49188fe87549cb973123298fe35884994743e6dff7df540e6df3d1970f3bd","observation_id":"3db9db6f-fcf0-4c3e-880a-67a7059bf4f5","resolution":{"observed_at":"2026-08-03T18:15:07.458967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:07.601795Z","title":"Cogvlm: Visual expert for pretrained language models.Advances in Neural Information Processing Sys- tems, 37:121475–121499, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:07.601795Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:9a0b06b408a3eb6b3270ff92365cdbd215ca8ad1a158837a541033f12f387350","observation_id":"1ccea993-3747-459f-8f58-8bd87257ca8d","resolution":{"observed_at":"2026-08-03T18:15:07.601795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-03T18:15:07.683207Z","title":"Internvl3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:07.683207Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:ea4f6f74d4e26bd2dd05a4dab5c536881f7c5182ee00e9869f305c789d5ae511","observation_id":"da076246-6d8d-4668-bfce-913e2385243b","resolution":{"observed_at":"2026-08-03T18:15:07.683207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:07.787595Z","title":"General object foundation model for images and videos at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:07.787595Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:5000b1a5094e949ff0ae419cd08d42cbf2efcb5a4179f8e64a3a2684a1c2c953","observation_id":"729569c2-b377-4281-b81b-4f524fefe190","resolution":{"observed_at":"2026-08-03T18:15:07.787595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-03T18:15:07.837162Z","title":"Deepseek-vl2: Mixture-of- experts vision-language models for advanced multimodal understanding.arXiv preprint arXiv:2412.10302, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:07.837162Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:f17a8bc44485b3075ced3f4d814f635d5f4d26bb211e5c94506bb08c76b4abda","observation_id":"4d93ed22-5206-4c68-a1ce-0505f0e0f35e","resolution":{"observed_at":"2026-08-03T18:15:07.837162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07608","last_updated":"2025-06-05T11:49:09Z","snapshot_observed_at":"2026-08-07T15:47:50.795694Z","submitted_at":"2025-05-12T14:30:11Z","title":"MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07608","snapshot_observed_at":"2026-08-03T18:15:07.935450Z","title":"Mimo: Unlocking the reasoning potential of language model–from pretraining to posttraining.arXiv preprint arXiv:2505.07608, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:07.935450Z"},"links":{"cited_paper":"/paper/2505.07608","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:776e20b5d66ed3fcf20987f75d41a615f0ddf9f7b88a776f7a603a097ee059cc","observation_id":"db9bcf32-653c-4f92-a650-2d55ad2f5251","resolution":{"observed_at":"2026-08-03T18:15:07.935450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:08.030855Z","title":"FG-CLIP: Fine-grained visual and textual alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:08.030855Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:7f825071903dd45abde1ece3dafdc3b4b0e953b4b32e9054f9f5b1abd60921c1","observation_id":"74f776f6-90cd-48e2-86b5-fdc20ff0c53a","resolution":{"observed_at":"2026-08-03T18:15:08.030855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07954","last_updated":"2025-04-10T17:58:27Z","snapshot_observed_at":"2026-08-07T16:06:45.172290Z","submitted_at":"2025-04-10T17:58:27Z","title":"Perception-R1: Pioneering Perception Policy with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07954","snapshot_observed_at":"2026-08-03T18:15:08.183639Z","title":"Perception-r1: Pioneering perception policy with reinforcement learning.arXiv preprint arXiv:2504.07954,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:08.183639Z"},"links":{"cited_paper":"/paper/2504.07954","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:a1f70d039bd626685c506b8729779c65ee8e577e7a9b8faf0f1217b65aa1499d","observation_id":"2dd413a9-b3c8-492c-8eac-b7f26b238764","resolution":{"observed_at":"2026-08-03T18:15:08.183639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:08.325970Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:08.325970Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:2709bedc39d7607cc6ae2ff859507ffcecf30825f3faf67848762650a24b13c0","observation_id":"b1bce0ce-06fb-40a6-a8ac-362c4126733b","resolution":{"observed_at":"2026-08-03T18:15:08.325970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:08.404859Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:08.404859Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:c6df84ece0bf868382a68e9f7dfa0ebe5342dea2bb2b45e2e6a1becf950dd3c8","observation_id":"5b00f6ce-5600-4dd7-999f-6f8b1b032c79","resolution":{"observed_at":"2026-08-03T18:15:08.404859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:08.514856Z","title":"Revisiting counterfactual prob- lems in referring expression comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:08.514856Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:dc75d05d8dce0e8076522470a2f077d6a29af641caa098409136216b15428b4b","observation_id":"69e15d4d-0cf5-44f3-a7dd-28377eee06ed","resolution":{"observed_at":"2026-08-03T18:15:08.514856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:08.637873Z","title":"Referring expression comprehension with semantic visual relationship and word mapping","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:08.637873Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:a5c2975e39193875643ce858ec9c97d252cee72a5ae41aa140816849e799bcf9","observation_id":"b08e51da-35fe-47f9-8f01-f04124ecdad7","resolution":{"observed_at":"2026-08-03T18:15:08.637873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20566","last_updated":"2024-09-30T17:59:34Z","snapshot_observed_at":"2026-08-05T16:49:53.377557Z","submitted_at":"2024-09-30T17:59:34Z","title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20566","snapshot_observed_at":"2026-08-03T18:15:08.771844Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:08.771844Z"},"links":{"cited_paper":"/paper/2409.20566","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:297b7db16c64f6ffa54eec5f366f35a292285ed40cfa807030f535fd2a71237f","observation_id":"81826f37-eb77-4845-9ef3-01f6a68d07a8","resolution":{"observed_at":"2026-08-03T18:15:08.771844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13076","last_updated":"2022-10-24T09:53:41Z","snapshot_observed_at":"2026-08-05T21:38:11.500694Z","submitted_at":"2022-10-24T09:53:41Z","title":"Towards Unifying Reference Expression Generation and Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13076","snapshot_observed_at":"2026-08-03T18:15:08.894756Z","title":"Towards unifying reference expression generation and comprehension.arXiv preprint arXiv:2210.13076, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:08.894756Z"},"links":{"cited_paper":"/paper/2210.13076","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:816aa8ae692f341bf1dac8740d0ad1d167a3ce3e0ab1bb4968e8be8981c292f9","observation_id":"9fc71d84-4992-4e43-ac5e-d1b650761d0a","resolution":{"observed_at":"2026-08-03T18:15:08.894756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-03T18:15:08.960506Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:08.960506Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:961fa552278ca81b9b5eca7411c5a58146f929e0f43e0280202ec84d1b8680c3","observation_id":"e41f54f7-240d-482c-b270-6870ee617ea7","resolution":{"observed_at":"2026-08-03T18:15:08.960506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:09.052966Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:09.052966Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:2d7d7b9a572bc610c26474e0805c81282db26f02d41a9401eb2f34dab3897dba","observation_id":"8fb223f4-bf55-4590-a199-7f87fab54bbb","resolution":{"observed_at":"2026-08-03T18:15:09.052966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:09.163085Z","title":"We filtered the images based on their resolution, retaining only those within the range of 1024x1024 to 2048x2048 pixels","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:09.163085Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:fcf87117c91c37dea6a1dd4fb6acc20644c59539292f1bb41173debd31883bd7","observation_id":"c8ea21a0-2dee-4786-a61f-ce9642f5adc9","resolution":{"observed_at":"2026-08-03T18:15:09.163085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:09.279542Z","title":"The improve- ments are most pronounced in Compositional Reasoning, especially within the Relation sub-category","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:09.279542Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:4b03ef54e4d758a78f6ba6b3271f8a7d16c04357066582c4db7fd7187e000444","observation_id":"a106fe0a-25e5-4c9c-9802-0fac829d2afb","resolution":{"observed_at":"2026-08-03T18:15:09.279542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:09.349920Z","title":"These fig- ures provide a visual comparison of several representative models across challenging examples from all six categories","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:09.349920Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:f91d18f54ed9fa788ad27b2891d469c3c5a3ab56de3c7cf94c85909502df8110","observation_id":"96c0b0bf-4123-4843-bae8-cc54859bf5b7","resolution":{"observed_at":"2026-08-03T18:15:09.349920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:09.425170Z","title":"Assign a clear and concise class label to each object (e.g., 'person', 'laptop', 'coffee mug', 'dog')","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:09.425170Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:d3de582060c6f1044e517c5a7ac801a68fa85207f563d8b8027a4140a87f976c","observation_id":"2859ab34-9466-434b-b8bd-1486a9a53c2e","resolution":{"observed_at":"2026-08-03T18:15:09.425170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:09.505935Z","title":"Each instance requires its own property dictionary","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:09.505935Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:eeaadc6cd0ab784c6a03be0181cf63d363e2fa9d9de108326420e8640c71e3af","observation_id":"5b8032cb-9060-45fc-8df1-7153f10f2f0f","resolution":{"observed_at":"2026-08-03T18:15:09.505935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:09.567300Z","title":"Populate this object with all observable visual properties","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:09.567300Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:4a3b4b13533872aca5b856637883dd76af3b34cedef9f87027f55a78d0e00ef0","observation_id":"a7f42b7d-661b-4196-91ce-c0d280ed4473","resolution":{"observed_at":"2026-08-03T18:15:09.567300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:09.636249Z","title":"to the left of the monitor","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:09.636249Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:4213d4e8678d3074acb973a65e9f552bf28d0f61c9e98ecababc5ac339cb122f","observation_id":"c28d9f9f-0d1f-481e-9069-a7098eb5704a","resolution":{"observed_at":"2026-08-03T18:15:09.636249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:09.715916Z","title":"a white ceramic mug filled with dark coffee","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:09.715916Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:54b4249d12408dd768f8d91225a472f79d39cd78d978e4c1df3cb5666c9b11f7","observation_id":"9b4d2d47-3db9-4cb0-9e7d-7d8426063bf7","resolution":{"observed_at":"2026-08-03T18:15:09.715916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:15:09.777799Z","title":"scene_properties","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:09.777799Z"},"links":{"citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:0fc941050e3e1e6973cf88e4852f61dd324d4420cf72a92cc189c697d640eb95","observation_id":"37078029-0070-4c8d-a347-1af69d0f174c","resolution":{"observed_at":"2026-08-03T18:15:09.777799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T08:10:23.313193Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2512.06276."}