{"as_of":"2026-08-07T05:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:50f364142fa38ec687fd98bd2bb33147732a1fd9060df42499bf46c456c6bf4d","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:25:03.038918Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T01:50:54.242508Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:55.109470Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"cited_work":{"arxiv_id":"2507.06272","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06272","snapshot_observed_at":"2026-07-04T15:09:55.109470Z","title":null,"venue":null,"work_id":"ee7b6d44-a5c1-4d63-8a50-311289f97eb3","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":144,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2507.06272","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:4f6a9266736961f16fad42d3fa3c3b24217c7c4d92d0082a4ea08ff9c9577d84","observation_id":"fa7ad16a-b5f6-4ed2-bd67-b6d1ce5d30c6","resolution":{"observed_at":"2026-07-04T15:09:55.111055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.06272/citation-record","integrity":"/paper/2507.06272/integrity","json":"/paper/2507.06272/citation-record.json","paper":"/paper/2507.06272"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:02.560688Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.560688Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:605bf011539f2c287e5c482ddaf587e3a253732084ea0afad9f00d5152c98069","observation_id":"07667d61-3b90-4a50-90bc-9f7a8a79023a","resolution":{"observed_at":"2026-08-06T19:25:02.560688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T19:25:02.566717Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.566717Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:91941a3aa6a8e9d7c516dae22935e904583f56abbf0456b7a2f9a011e21926c7","observation_id":"c1f30626-190d-43bc-819e-4e08e8f582bc","resolution":{"observed_at":"2026-08-06T19:25:02.566717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.467020Z","title":"Internlm2 technical report, 2024","venue":null,"work_id":"10ec1974-c9f0-4b59-8cd0-8776334b6d2b","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.573028Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:4f5689c3b80c98ccb323e64a48346765b17383008391bd5ef568c17f41daf30a","observation_id":"d23a0cfd-ddfe-4b24-8f4c-4404ada3607a","resolution":{"observed_at":"2026-08-06T19:25:04.472428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-06T19:25:02.578412Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.578412Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:64d0cdef93eb8dda6eb0bba6e986e94f6296536312d8462e4e0d85815ae77545","observation_id":"123fb9d3-7959-44c2-9874-ddae3b8b1325","resolution":{"observed_at":"2026-08-06T19:25:02.578412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-06T19:25:02.585377Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.585377Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:b8b28978447b623dd18a1fb0bec771ba6fd6651f5bbb11508770d622d48d5b42","observation_id":"c3620d91-5c04-46bf-893c-40517ccf4caa","resolution":{"observed_at":"2026-08-06T19:25:02.585377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-07-06T16:32:37.715900Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-06T19:25:02.592591Z","title":"Pali-3 vision language models: Smaller, faster, stronger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.592591Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:a8e9e1a9e5b945251b716aec87b9469879f6a810250c5b4c4c61aa4e8154701a","observation_id":"946f5be3-94c9-4f85-bc6b-7c95eeeabba7","resolution":{"observed_at":"2026-08-06T19:25:02.592591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.447802Z","title":"Sam4mllm: Enhance multi- modal large language model for referring expression seg- mentation","venue":null,"work_id":"79f9f96b-be1c-4ac3-954c-878b78399af4","year":2025},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.600401Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:f7c3a30c28d42bfecac563c0eec809934eae2f32796aae5e168fe48d8d8aeaae","observation_id":"d81d9a75-d6a1-44b0-939c-e8ea40a342be","resolution":{"observed_at":"2026-08-06T19:25:04.454166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T19:25:02.612441Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.612441Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:2835066d439ca38c5b54b51af1e38370f017385e8a18488405c70e0e4f775080","observation_id":"b0dd2dbc-8952-4815-99c9-5af96197e5de","resolution":{"observed_at":"2026-08-06T19:25:02.612441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-06T19:25:02.620079Z","title":"Mme: A comprehensive evaluation bench- mark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.620079Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:874197e0e6d5d7defb53749e0b49188948e878271e110a32dfb9d287ffb8de3c","observation_id":"c8a9d86c-06d2-405c-bf13-9c82085b0b48","resolution":{"observed_at":"2026-08-06T19:25:02.620079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.426100Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"4e543383-9caf-4a41-8c23-c502fda07714","year":2017},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.626331Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:ae9b7930fdeb3151ceaec028464359af4945a3a5de17eace91bd2ac257608d2a","observation_id":"15eff456-804c-4064-8188-8081a0d0bf2d","resolution":{"observed_at":"2026-08-06T19:25:04.433594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:02.632584Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.632584Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:5f1431952192e2709b62d38610bbf2a1275c9fe3d99ccd74762989002ae381b2","observation_id":"1c9bccd3-d49d-4815-ac94-3b5dbda9a750","resolution":{"observed_at":"2026-08-06T19:25:02.632584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.397157Z","title":"Cogagent: A visual language model for gui agents","venue":null,"work_id":"89432e6a-45b6-433c-8253-8ccfffa94f7b","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.639805Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:43430068ff5cbcf0f4caa552249c8b803b9a1d1ae88803d54424254fa66537d3","observation_id":"d81508aa-362c-4002-8d5a-19dc7109a3c5","resolution":{"observed_at":"2026-08-06T19:25:04.402511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.379242Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"9ab6c7ff-a3d2-4079-aa53-2ce88b0ac6d0","year":2022},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.645404Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:8f350a10139fb1f3d3b7ae45f15680cdd03227190c09cfb23fade36692834417","observation_id":"7d658121-544e-4f2b-8fa0-5497626ca68c","resolution":{"observed_at":"2026-08-06T19:25:04.385021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-06T19:25:02.650218Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.650218Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:5085198d4cc166047041b6384eb300010b466ce60e7c9658b8d41fe38e7eec9e","observation_id":"2fd3d24c-5388-4590-a076-c05969ca92b0","resolution":{"observed_at":"2026-08-06T19:25:02.650218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.359006Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"4196ad0c-2e2e-46b4-bce5-5c1ad364e932","year":2019},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.655642Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:3a935e9d4c90b9833f0252e3fd75d44190eb9edbf197aa26ff5ee66af732748f","observation_id":"92808272-303a-4110-968f-bc3d929e9205","resolution":{"observed_at":"2026-08-06T19:25:04.367323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:02.660377Z","title":"Dvqa: Understanding data visualizations via ques- tion answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.660377Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:24b028057f77367a1ceb7ada652bc5ba37132564aa3be9942956383fce84e063","observation_id":"5d63ed73-3ef4-4c6e-8065-d8fcd8893485","resolution":{"observed_at":"2026-08-06T19:25:02.660377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:02.666783Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.666783Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:416f6af192a2938cda2f1c386436a5945ae90b9f44f7dcbe4fac62c7f620edfe","observation_id":"be61820e-baf0-4138-88c9-9fe5c3de2be3","resolution":{"observed_at":"2026-08-06T19:25:02.666783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:02.679727Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.679727Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:b340259ff2a7098222e2f072bbde67e159548a15e0278b690c123041497cd8e9","observation_id":"5f422613-5648-437a-a5b1-21c108970889","resolution":{"observed_at":"2026-08-06T19:25:02.679727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.290330Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"34e613d7-5ee4-42ac-9c8c-1ac37bcc3755","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.686421Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:3f8791b029d0d406e0abcb59948284cd0c1aba378d2a1eb013a5124323861153","observation_id":"f9151211-5ed7-40c3-a995-6a6ec82e37ca","resolution":{"observed_at":"2026-08-06T19:25:04.296163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09855","last_updated":"2025-02-17T05:35:12Z","snapshot_observed_at":"2026-08-06T09:00:28.179505Z","submitted_at":"2024-10-13T14:28:16Z","title":"Text4Seg: Reimagining Image Segmentation as Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09855","snapshot_observed_at":"2026-08-06T19:25:02.692538Z","title":"Text4seg: Reimagining image segmentation as text genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.692538Z"},"links":{"cited_paper":"/paper/2410.09855","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:d9ce39c4f8ac7e83d3ea93b158bf3600494d748a4e5bf894ff6ee14b613fcc1d","observation_id":"9912157e-0ba8-4078-98f6-3d9d0e1c2f97","resolution":{"observed_at":"2026-08-06T19:25:02.692538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:02.699518Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.699518Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:ba624edc02d332d23d1e1fce1cf7be8843b4e8f7b226c5fe78904cf43708c8d8","observation_id":"438b3181-0746-4800-8651-c1a3abe12590","resolution":{"observed_at":"2026-08-06T19:25:02.699518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10229","last_updated":"2024-10-01T05:56:05Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:59:34Z","title":"OMG-Seg: Is One Model Good Enough For All Segmentation?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10229","snapshot_observed_at":"2026-08-06T19:25:02.706354Z","title":"Omg-seg: Is one model good enough for all segmentation? arXiv preprint arXiv:2401.10229, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.706354Z"},"links":{"cited_paper":"/paper/2401.10229","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:1bd100ee28a2bc529caaef9b273ee289ec2ca1dc7175eae18bb28b628a075c93","observation_id":"e96330e5-cbf0-4c07-b9e9-957de476c346","resolution":{"observed_at":"2026-08-06T19:25:02.706354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.261276Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"7b50e124-516d-4bc4-9270-43fd4680a4a1","year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.713875Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:263a1c9c4c1a0bd0e572f79128b2a12204552c8c76a0fe6735e4c5fa558b019a","observation_id":"6c3b72e5-80cd-47c4-ade6-52e4b22c0a6a","resolution":{"observed_at":"2026-08-06T19:25:04.267371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-06T19:25:02.719308Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.719308Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:ee2b414ccecc3270983fe4ed9953a4567b33e51f2428e4c5f97dbec028f42911","observation_id":"c1effccf-7352-46f9-ac3a-7c10cf449f54","resolution":{"observed_at":"2026-08-06T19:25:02.719308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.243027Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"da97e100-b820-4584-903c-fe8250ebf4e3","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.725997Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:b3a06bc4b2e0482f346b063e5f1fd6b3b87a7c9ae22e561f0c5eb164a7dd31bc","observation_id":"776f9d73-49bf-4390-8d13-8be844bf18ac","resolution":{"observed_at":"2026-08-06T19:25:04.248510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.226624Z","title":"Gres: Gener- alized referring expression segmentation","venue":null,"work_id":"b0daaca4-eca9-40d1-88b7-275ce846c503","year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.731847Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:01d55c5b2857c841c51bd45ef7558d4fb7ef328dc69850a85c6b26b6f1d17140","observation_id":"66c9b9c1-9e14-4c63-98cd-3117bb196e78","resolution":{"observed_at":"2026-08-06T19:25:04.231802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.209123Z","title":"Gres: Gen- eralized referring expression segmentation","venue":null,"work_id":"c6107a99-8a00-4184-8025-6e8eced13393","year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.737729Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:9453c955612d854c36880fdd85596596a7ac54f633170995b227e6547a7e4aa3","observation_id":"1309b116-be41-4492-8150-93af04f8a6ef","resolution":{"observed_at":"2026-08-06T19:25:04.214525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.192793Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"4f0a215d-c48b-432e-9f35-2efb1e602a38","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.743293Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:3874cacec5c738688ae08a8f28117ae8c50ccc3e14f6a1d9069590458daa3399","observation_id":"25cbb403-d745-40c7-9d46-33681c38d58f","resolution":{"observed_at":"2026-08-06T19:25:04.197835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.175653Z","title":"Visual instruction tuning","venue":null,"work_id":"80ff04de-667a-4831-81d0-2dffc5c33269","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.750364Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:b6157f32f9c6c8be56bdcf1425966a558ce68aa87831005823f2037499397198","observation_id":"3a6f45e1-600a-4186-b0b4-b66d8c1959aa","resolution":{"observed_at":"2026-08-06T19:25:04.181474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-08-06T19:25:02.756176Z","title":"Llava-plus: Learning to use tools for creating multi- modal agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.756176Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:46e9258a09c93e5d642f9d9aebd916bdef68d6062b8d1417a3d4bc1b26f0d721","observation_id":"b6798a7d-cf83-4917-bc88-4894cf994b78","resolution":{"observed_at":"2026-08-06T19:25:02.756176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-04T10:28:00.554323Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-06T19:25:02.762351Z","title":"Textmonkey: An ocr-free large multimodal model for understanding document","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.762351Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:385b03219b31d043253dc6ef1c290517b0ff578abd588c80dacf870eb9a97ea3","observation_id":"0a905ad9-f29c-4e9c-b2ec-4f0b1b862264","resolution":{"observed_at":"2026-08-06T19:25:02.762351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:02.768004Z","title":"Mmbench: Is your multi-modal model an all-around player? In European Conference on Computer Vision, pages 216–233","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.768004Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:79977bdaf67d229e2203d36f2d5605eea0bb14bb512787db2e8edbfdf3d1f3fa","observation_id":"608ab5c5-c239-4760-b351-dfcd833a97c9","resolution":{"observed_at":"2026-08-06T19:25:02.768004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05662","last_updated":"2023-06-02T16:19:48Z","snapshot_observed_at":"2026-07-06T15:25:12.782361Z","submitted_at":"2023-05-09T17:58:34Z","title":"InternGPT: Solving Vision-Centric Tasks by Interacting with ChatGPT Beyond Language","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05662","snapshot_observed_at":"2026-08-06T19:25:02.773169Z","title":"Interngpt: Solving vision-centric tasks by interacting with chatgpt beyond language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.773169Z"},"links":{"cited_paper":"/paper/2305.05662","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:c7b0baea25c40b3561bbcc41b4d4b135a07b84c87b565d69c273bb612619836a","observation_id":"4b577851-b868-4a87-a58d-e891afe63e52","resolution":{"observed_at":"2026-08-06T19:25:02.773169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-08-06T19:25:02.779348Z","title":"Chain-of-spot: Interactive reasoning improves large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.779348Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:584e5a514840aeaf43a301ff74a76599d53fa396cfb84098771bdd6a007c67bd","observation_id":"2e4a3485-1b56-4e99-860b-5402c90fa88f","resolution":{"observed_at":"2026-08-06T19:25:02.779348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.146680Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"65d39331-bde6-46b4-b995-fcca75331f50","year":2022},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.786553Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:d225038f5214c422c96eddd94cb6bd0bed2009f9144a45837ca6d087a211ba48","observation_id":"be5cb8d7-a020-43c8-a85c-1bb846236cd4","resolution":{"observed_at":"2026-08-06T19:25:04.152584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-06T19:25:02.794185Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.794185Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:328362c4a0ce5c3f48274d3a23ce6d492b836da3a8d2c43791310d3e2fc5bdff","observation_id":"c64fb980-aa3b-45df-be78-a21e7f0a2fe3","resolution":{"observed_at":"2026-08-06T19:25:02.794185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.130237Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"2a99800b-286d-4ea1-b607-abb2ce667c58","year":2019},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.800568Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:15a0b423041983c9f945fb1acf38f284bc6ddb2dab81844130890b429ec474de","observation_id":"327d3d31-edab-4095-808e-0eb026ee171d","resolution":{"observed_at":"2026-08-06T19:25:04.135326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-06T19:25:02.806358Z","title":"Chartqa: A benchmark for question an- swering about charts with visual and logical reasoning.arXiv preprint arXiv:2203.10244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.806358Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:2b6724f8011ee91966b2fdc376a1ed8b6be072c684d586073712ebba5974f4f1","observation_id":"5625cbc4-79a1-42c8-8255-c8f792690acb","resolution":{"observed_at":"2026-08-06T19:25:02.806358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:02.811525Z","title":"Mod- eling context between objects for referring expression under- standing","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.811525Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:b8c73b4dc7da650b75ceec1e159553b2809a96229c3343d87c66ffdead33270a","observation_id":"446b98f5-a107-4b23-8d14-f98ce24d6a7b","resolution":{"observed_at":"2026-08-06T19:25:02.811525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-06T19:25:02.816755Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.816755Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:770dfd1d82940eb3db0d5dac7c389f8c0fca5bd21dee16d5226f41ef88aa3d15","observation_id":"a79209ef-18ee-4598-bffc-0ed393c22227","resolution":{"observed_at":"2026-08-06T19:25:02.816755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04236","last_updated":"2025-03-02T09:39:57Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:43:48Z","title":"CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04236","snapshot_observed_at":"2026-08-06T19:25:02.822075Z","title":"Cogcom: Train large vision-language models diving into details through chain of manipulations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.822075Z"},"links":{"cited_paper":"/paper/2402.04236","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:e43e05636127fb5d5ec7fc7dc031c989abb8bea8a8b249c286aba73831a790d2","observation_id":"087fa912-cbf8-437d-bf28-1d9225376729","resolution":{"observed_at":"2026-08-06T19:25:02.822075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.102812Z","title":"Reasoning to attend: Try to understand how¡ seg¿ token works","venue":null,"work_id":"65a1172c-0b9d-468d-9f02-a3e8cd3338c9","year":2025},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.828356Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:08789cdb1b7f024e994a5b407b3c057fe828db083245d01e0e0704c6c15e0543","observation_id":"3ce61a4c-e2d4-4cfb-9076-cd599d3f71df","resolution":{"observed_at":"2026-08-06T19:25:04.108283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.086497Z","title":"10 Glamm: Pixel grounding large multimodal model","venue":null,"work_id":"a8f05073-c65a-4315-b4b7-1f06d7f3baea","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.834105Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:fd8a0d5bd54d7c44c55393ad66874a312fc9e5a20f29566b6fa09ca3f587ea69","observation_id":"f2eca709-119d-497e-88a1-f6efe28401e5","resolution":{"observed_at":"2026-08-06T19:25:04.091454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.069890Z","title":"Pixellm: Pixel reasoning with large multimodal model","venue":null,"work_id":"5691acc8-1ad1-408f-a729-1ab1ecb9a09b","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.839396Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:7bc99bf08033d4a92d7a302f5592e663340237202b19ae049113b58a66a2f94b","observation_id":"321b42bd-a7ad-405b-bdc7-4d7fd7a93ac3","resolution":{"observed_at":"2026-08-06T19:25:04.075155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:02.846541Z","title":"Object hallucination in image cap- tioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.846541Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:2a63323805935720a6e8f7072fe75f303dcbb7d32161dbd1a91c6ea5af609d17","observation_id":"ef42190d-5df3-4e58-8f53-d637060f1479","resolution":{"observed_at":"2026-08-06T19:25:02.846541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.041362Z","title":"A-okvqa: A benchmark for visual question answering using world knowl- edge","venue":null,"work_id":"38d724c3-3db9-4a79-af2b-861aae1772c0","year":2022},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.851753Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:5022b3ad3121741e77a73dbaffc2b201d690d9a4827a45cb1bb3b8f40b783745","observation_id":"08f1824d-f5a8-4416-970e-15639a0b1d05","resolution":{"observed_at":"2026-08-06T19:25:04.047364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.022015Z","title":"Tinylvlm-ehub: Towards com- prehensive and efficient evaluation for large vision-language models, 2024","venue":null,"work_id":"d0246dee-bc94-4e51-a988-2f2332d62324","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.856963Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:ad6b42b82dca6ec1863b961bcb0a3c0731cca0393e361c410372cb92abe85ab2","observation_id":"70e555ba-6fe2-4a70-b233-858ccd208a78","resolution":{"observed_at":"2026-08-06T19:25:04.027874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:02.862897Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.862897Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:c8f4da1813ef0bdae94f1281ba1ceb8f2a8486b74a6a5559e03d10137c456d40","observation_id":"a1553ffa-e220-4930-84d1-3e7668aa78e4","resolution":{"observed_at":"2026-08-06T19:25:02.862897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.992417Z","title":"Cambrian-1: A fully open, vision-centric explo- ration of multimodal llms","venue":null,"work_id":"961a9e2e-4f4a-420f-9cdb-6b2da2330878","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.869346Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:4ba0f94d7494b0a5eed257affb6bdbe2a980946c5d611a39e4b4bc41833c955c","observation_id":"951a132c-acf1-4cbd-b158-19561d0a73d8","resolution":{"observed_at":"2026-08-06T19:25:03.997513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T19:25:02.874944Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.874944Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:928fa732917b05898c98b687bc043bd9bbfcd40a35fb0b3bf685b3279bd98740","observation_id":"34dc3d2c-51ae-41a9-a577-67bf4810d1a9","resolution":{"observed_at":"2026-08-06T19:25:02.874944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-06T19:25:02.881306Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.881306Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:9af2191708ac4c3ea1faf55bf79f7cbecf830e27fe59400fa995b4ff41b3ac5b","observation_id":"1834aff1-5fff-49d6-8c83-2fbb9966a293","resolution":{"observed_at":"2026-08-06T19:25:02.881306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.975456Z","title":"Visionllm: Large language model is also an open- ended decoder for vision-centric tasks","venue":null,"work_id":"b8bb2839-7ea7-4d77-b73b-29acadcd9ffa","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.892908Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:49654f8cea7054811ad49e76b2b6dd03e999434f463a0d91b6557d90e28d293a","observation_id":"6664a6e4-dea9-464e-bce3-8631bbe9691b","resolution":{"observed_at":"2026-08-06T19:25:03.980701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.957466Z","title":"Hierar- chical open-vocabulary universal image segmentation","venue":null,"work_id":"dbf07366-f0e6-4d3b-83a6-adb28d26b285","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.899849Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:af167f82943c2ba61c1f3c03426e663cacd2ceab70834b3d77647e8d7cbc2ed4","observation_id":"7727ef6d-8e2a-4681-add6-7b3405fa1997","resolution":{"observed_at":"2026-08-06T19:25:03.963856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18923","last_updated":"2024-10-31T19:44:05Z","snapshot_observed_at":"2026-08-07T00:25:33.233087Z","submitted_at":"2024-10-24T17:11:52Z","title":"SegLLM: Multi-round Reasoning Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18923","snapshot_observed_at":"2026-08-06T19:25:02.905453Z","title":"Segllm: Multi-round reasoning segmenta- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.905453Z"},"links":{"cited_paper":"/paper/2410.18923","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:65e65c2034a33e7bf992feb25ece7b4209a345c230eec8cca696a9421b844cb7","observation_id":"a118ef6e-a4e0-4a5f-a839-c70b4d9bbcac","resolution":{"observed_at":"2026-08-06T19:25:02.905453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08506","last_updated":"2024-04-12T14:40:45Z","snapshot_observed_at":"2026-08-02T23:06:41.458983Z","submitted_at":"2024-04-12T14:40:45Z","title":"LaSagnA: Language-based Segmentation Assistant for Complex Queries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08506","snapshot_observed_at":"2026-08-06T19:25:02.914864Z","title":"Lasagna: Language-based segmentation assistant for complex queries","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.914864Z"},"links":{"cited_paper":"/paper/2404.08506","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:d55125e95aad476c8339d2966e4111e4caa135455cd97df7069ee43870f6ace1","observation_id":"079b2c5b-371f-4f8f-8e52-c5cff871c6e6","resolution":{"observed_at":"2026-08-06T19:25:02.914864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.940241Z","title":"General object foundation model for images and videos at scale","venue":null,"work_id":"15924f18-ec2f-49db-8437-809648847cb8","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.920393Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:c64fe3000e6e40f4f5b8d9641c5340d35c331a08962e0be5f913d5905c2b713d","observation_id":"0b659962-2df3-4eea-b750-fe0c9decdd8a","resolution":{"observed_at":"2026-08-06T19:25:03.946172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08394","last_updated":"2024-12-31T05:35:05Z","snapshot_observed_at":"2026-08-06T17:31:18.801416Z","submitted_at":"2024-06-12T16:44:50Z","title":"VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08394","snapshot_observed_at":"2026-08-06T19:25:02.926461Z","title":"Visionllm v2: An end-to-end general- ist multimodal large language model for hundreds of vision- language tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.926461Z"},"links":{"cited_paper":"/paper/2406.08394","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:03d7e0d3464a59c410bdbc928ba9c4a661cc3e42820d1560298c3cdbdc9a467d","observation_id":"a8036437-e011-48ec-9078-abfa965eb13e","resolution":{"observed_at":"2026-08-06T19:25:02.926461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.923978Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":"55d5f245-52a9-4c6b-9657-a47b99b3e482","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.934981Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:25c3c08ae1df5359921e1141de7f1728bce8556e4a9c2207b3a91a9a25417080","observation_id":"59987610-2c72-4322-9dd0-1d553565e551","resolution":{"observed_at":"2026-08-06T19:25:03.929391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.906438Z","title":"Gsva: Generalized segmentation via multimodal large language models","venue":null,"work_id":"d3c87a80-cbfc-47f1-b047-4af150feb118","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.940703Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:356165bafff15898acd1cb534482352e774df2898419f95dcf5f1a19b6ae119a","observation_id":"30aae116-914d-4b0e-8ae2-252453f7df71","resolution":{"observed_at":"2026-08-06T19:25:03.911800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-06T16:32:30.757011Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-06T19:25:02.946036Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.946036Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:b0b7c9e33dfbdf834cee2a57bd74dea898a16ca302739ea50391600fc04e5b5c","observation_id":"8a51f921-683d-4c95-aaa1-d22e69acf980","resolution":{"observed_at":"2026-08-06T19:25:02.946036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.888686Z","title":"Qwen2 technical report, 2024","venue":null,"work_id":"99c42410-c536-4452-9896-437b42f7d2dc","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.952327Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:93c6fd7f903fc532019578ef9782419529e187b9aadb484d74ef247e1c9461d7","observation_id":"991fa207-564b-42eb-b34a-12de5323ffce","resolution":{"observed_at":"2026-08-06T19:25:03.894309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17240","last_updated":"2024-01-22T06:53:23Z","snapshot_observed_at":"2026-07-31T19:08:37.289553Z","submitted_at":"2023-12-28T18:58:33Z","title":"LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17240","snapshot_observed_at":"2026-08-06T19:25:02.959690Z","title":"An improved baseline for reasoning segmentation with large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.959690Z"},"links":{"cited_paper":"/paper/2312.17240","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:9bf7d2a1e0a70d6873ecefb46f308b8184426ccf038d081f9e0ea1c8af3127c4","observation_id":"ae5f731d-8a5b-4e55-8359-535d567b62d7","resolution":{"observed_at":"2026-08-06T19:25:02.959690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.870141Z","title":"Ureader: Universal ocr-free visually-situated language understanding with multimodal large language model","venue":null,"work_id":"16dcc591-9d9e-4fdb-8ad5-79cab1017cab","year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.966226Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:f730ce09d1aeece42e0ce6c48562ec123fff7174bc76d946dd7ef7b5e3d801c1","observation_id":"6b3102a1-ab8f-4168-8805-3f6862cb943c","resolution":{"observed_at":"2026-08-06T19:25:03.876247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-06T19:25:02.971505Z","title":"mplug-owl3: Towards long image-sequence understanding 11 in multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.971505Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:435574cdcf0212f7d14db0ad1accde3443aecefb24cba80757b1af1f7a598f66","observation_id":"f156745b-ab03-44ca-becf-967ee861c55b","resolution":{"observed_at":"2026-08-06T19:25:02.971505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-06T19:25:02.977524Z","title":"mplug-owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.977524Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:b7cebf2e3d8bd57110c89ea31075e2db9c7804dfc128ba65c103dfd255f1feae","observation_id":"2182922a-1b65-4d5c-8bf2-36da9a7155b1","resolution":{"observed_at":"2026-08-06T19:25:02.977524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.851340Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"0eec65a0-7fbc-437a-9798-861350835525","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.984296Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:b721494b1cdbe9a8c3242fdc965cdbc2a73ec5b73714da73a6c8528df0e4d0e4","observation_id":"836ac2fe-de2b-4583-aa04-dd43e5df3ee7","resolution":{"observed_at":"2026-08-06T19:25:03.857363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.834344Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":"b9de0ba6-3c1a-454a-8de4-13087ed44842","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.991047Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:efcf7aa35a9c07135e69ea08fe50f463e37197271fb62f19d09029cbf41b1922","observation_id":"fe05fdce-4e5e-4b39-bd41-193b88ab0b47","resolution":{"observed_at":"2026-08-06T19:25:03.839191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.817538Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":"a8bb8ebc-a8bd-4096-b65b-a53b549477dd","year":2016},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.998247Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:0b5343a534096a8c0ed2ca8f6b4955762ab0c96ae672e3c923292eced6ba843b","observation_id":"19788345-0a4a-453f-8243-d4300b29a1ec","resolution":{"observed_at":"2026-08-06T19:25:03.822751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-06T19:25:03.005676Z","title":"Internlm-xcomposer-2.5: A versatile large vision language model supporting long-contextual in- put and output","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:03.005676Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:ff25006bfc405e926491d2f24a3af01d5b2a43c58c61a3902b8eb7f3328dbf54","observation_id":"b9a6494e-4048-411a-9dcd-9946a68d8d5b","resolution":{"observed_at":"2026-08-06T19:25:03.005676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03601","last_updated":"2025-06-12T00:15:18Z","snapshot_observed_at":"2026-08-06T08:24:07.376776Z","submitted_at":"2023-07-07T13:43:44Z","title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03601","snapshot_observed_at":"2026-08-06T19:25:03.012476Z","title":"Gpt4roi: Instruction tuning large language model on region- of-interest","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:03.012476Z"},"links":{"cited_paper":"/paper/2307.03601","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:fb98e8778e6e7a7a92dc4739dc607a5613ed01c5faa56ce65501c411d9397e73","observation_id":"fa0bda23-d1d4-4f18-ab4c-7c1957fad63b","resolution":{"observed_at":"2026-08-06T19:25:03.012476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.800614Z","title":"Omg-llava: Bridging image-level, object-level, pixel-level reasoning and understanding","venue":null,"work_id":"9196457f-9e63-4b53-8205-77582b4e1cec","year":null},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:03.020693Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:f09ca2953017a6f782560355c46b1ce588ffb31a27841df0680c581fb143b80c","observation_id":"5faef72c-b81c-4aea-8c07-04ecd20f71e1","resolution":{"observed_at":"2026-08-06T19:25:03.805984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.781557Z","title":"Psalm: Pixelwise segmentation with large multi-modal model","venue":null,"work_id":"bdf8bf44-bdc2-4016-91b5-9574a8d27e52","year":2025},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:03.026335Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:b15037d6c16790359f6c211d16b58a8346ba39a474cc785119966925fece1391","observation_id":"d06d3946-b1e1-46c6-82e1-dcc182433d74","resolution":{"observed_at":"2026-08-06T19:25:03.787981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T19:25:03.032130Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:03.032130Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:abc7253e4afcb911b07f6465b8c816ea1773487d57f31de3139a90c96c3743a1","observation_id":"068d6238-60ab-4185-b6b0-29f180f24a04","resolution":{"observed_at":"2026-08-06T19:25:03.032130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:03.761066Z","title":"When the provided information is insufficient, respond with ‘Unanswerable,’","venue":null,"work_id":"053f88a9-213e-4523-bf02-d28d4bed58af","year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:03.038918Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:83eeed9b300d0eee7361e2d3a51166c0972dfbd1bf628f77de11b6f289d2a170","observation_id":"ffabad69-66d6-401c-9b0b-cfdb05f446f3","resolution":{"observed_at":"2026-08-06T19:25:03.769446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:25:04.318583Z","title":null,"venue":null,"work_id":"156b7b87-7a17-49a1-866e-a1b34cafda65","year":2016},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":251,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.672598Z"},"links":{"citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:fc1aa4048e1757fe28ec778d8a26843ccef7080236c5d8f9956acb77f90d5945","observation_id":"fd18e0b8-357d-4092-a28a-536a65f6a9a0","resolution":{"observed_at":"2026-08-06T19:25:04.323807Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T19:16:35.536045Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":40,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 1 inbound Pith citation observation for arXiv:2507.06272."}